Jednym z założeń regresji liniowej jest to, że powinna istnieć stała wariancja w kategoriach błędów oraz że przedziały ufności i testy hipotez związane z modelem opierają się na tym założeniu. Co dokładnie dzieje się, gdy terminy błędów nie mają stałej wariancji?
Załóżmy następującą zależność liniową: , gdzie jest zmienną zależną, pojedynczą zmienną niezależną, a termin błędu.Yi=β0+β1Xi+uiYi=β0+β1Xi+uiY_i = \beta_0 + \beta_1 X_i + u_iYiYiY_iXiXiX_iuiuiu_i Według Stock & Watson (Wprowadzenie do ekonometrii; Rozdział 4 ), trzecim najmniejszym kwadratem jest założenie, że czwarte momenty i są niezerowe i skończone .XiXiX_iuiuiu_i(0<E(X4i)<∞ and 0<E(u4i)<∞)(0<E(Xi4)<∞ and 0<E(ui4)<∞)(0<E(X_i^4)<\infty …
Załóżmy, że korzystam z regresji liniowej, która ma postać .y=β0+β1A +β2)B +β3)A B + ϵy=β0+β1A+β2B+β3AB+ϵy = \beta_0 + \beta_1A+\beta_2B+\beta_3AB +\epsilon Jeśli jest dodatnia, czy oznacza to dodatnią korelację między i ? (Odwrotnie, korelacja ujemna, jeśli jest ujemna?)β3)β3\beta_3ZAAAbBBβ3)β3\beta_3
Mam zestaw danych z zależną i niezależną zmienną. Oba nie są szeregami czasowymi. Mam 120 obserwacji. Współczynnik korelacji wynosi 0,43 Po tych obliczeniach dodałem kolumnę dla obu zmiennych ze średnią dla każdych 12 obserwacji, w wyniku czego otrzymałem 2 nowe kolumny ze 108 obserwacjami (parami). Współczynnik korelacji tych kolumn wynosi …
Muszę rozwiązać skomplikowany problem regresji na dysku jednostki. Oryginalne pytanie przyciągnęło kilka interesujących komentarzy, ale niestety nie otrzymano odpowiedzi. Tymczasem nauczyłem się czegoś więcej na temat tego problemu, dlatego spróbuję podzielić oryginalny problem na podproblemy i zobaczę, czy tym razem będę miał więcej szczęścia. Mam 40 czujników temperatury regularnie rozmieszczonych …
Wiem, jak zaimplementować liniową funkcję celu i liniowe wzmocnienia w XGBoost. Moje konkretne pytanie brzmi: kiedy algorytm pasuje do resztkowego (lub ujemnego gradientu), czy używa jednej cechy na każdym etapie (tj. Modelu jednoczynnikowego) czy wszystkich cech (model wielowymiarowy)? Będziemy wdzięczni za wszelkie odniesienia do dokumentacji dotyczącej liniowych wzmocnień w XGBoost. …
Próbuję zinterpretować wyniki artykułu, w którym zastosowali regresję wielokrotną, aby przewidzieć różne wyniki. Jednak (standardowe współczynniki B zdefiniowane jako gdzie jest zależne zmienna, a jest predyktorem) zgłoszone wydają się nie pasować do zgłoszonego :ββ\betaβx1=bx1⋅S D.x1S D.yβx1=Bx1⋅SDx1SDy\beta_{x_1} = B_{x_1} \cdot \frac{\mathrm{SD}_{x_1}}{\mathrm{SD}_y}yyyx1x1x_1R2)R2R^2 Pomimo wynoszących -0,83, -0,29, -0,16, -0,43, 0,25 i -0,29, zgłaszane …
Ponieważ błąd standardowy regresji liniowej jest zwykle podawany dla zmiennej odpowiedzi, zastanawiam się, jak uzyskać przedziały ufności w innym kierunku - np. Dla przecięcia x. Jestem w stanie wyobrazić sobie, co to może być, ale jestem pewien, że musi istnieć prosty sposób, aby to zrobić. Poniżej znajduje się przykład w …
Czy ktoś mógłby mi powiedzieć, dlaczego otrzymuję różne wyniki od Rważonego najmniejszego kwadratu i ręcznego rozwiązania przez operację macierzy ? W szczególności próbuję ręcznie rozwiązać , gdzie to macierz diagonalna na wagach, to macierz danych, to odpowiedź wektor. W A x = W bW.ZAx=W.b\mathbf W \mathbf A\mathbf x=\mathbf W \mathbf …
Mój przyjaciel niedawno zapytał, co jest takiego zwyczajnego, o zwykłych najmniejszych kwadratach. Wydaje się, że nigdzie nie rozmawialiśmy. Obaj zgodziliśmy się, że OLS jest specjalnym przypadkiem modelu liniowego, ma wiele zastosowań, jest dobrze znany i jest szczególnym przypadkiem wielu innych modeli. Ale czy to naprawdę wszystko? Dlatego chciałbym wiedzieć: Skąd …
Jak przypisać większą wagę do najnowszych obserwacji w R? Zakładam, że jest to często zadawane pytanie lub pragnienie, ale trudno mi dokładnie wymyślić, jak to zrealizować. Próbowałem znaleźć wiele, ale nie jestem w stanie znaleźć dobrego praktycznego przykładu. W moim przykładzie z czasem miałbym duży zestaw danych. Chcę powiedzieć, że …
W modelach szeregów czasowych, takich jak ARMA-GARCH, do wyboru odpowiedniego opóźnienia lub kolejności modelu stosowane są różne kryteria informacyjne, takie jak AIC, BIC, SIC itp. Moje pytanie jest bardzo proste, dlaczego nie używamy skorygowanego aby wybrać odpowiedni model? Możemy wybrać model, który prowadzi do wyższej wartości skorygowanego . Ponieważ zarówno …
Używając R na niektórych danych i próbując sprawdzić, czy moje dane są heteroscedastyczne, znalazłem dwie implementacje testu Breusch-Pagan, bptest (pakiet lmtest) i ncvTest (pakiet samochodów). Dają one jednak różne wyniki. Jaka jest różnica między nimi? Kiedy powinieneś wybrać jedno lub drugie? > model <- lm(y ~ x) > bp <- …
Załóżmy, że mamy macierz danych XX\mathbf{X}, który jest nnn-przez-pppi wektor etykiety YYY, który jest nnn-do-jednego. Tutaj każdy wiersz macierzy jest obserwacją, a każda kolumna odpowiada wymiarowi / zmiennej. (założyćn > pn>pn>p) Więc co data space, variable space, observation space, model spaceoznaczają? Czy przestrzeń jest rozpięta przez wektor kolumny, a (zdegenerowana) …
Typowe wartości AIC, które widziałem dla modeli logistycznych, są w tysiącach, a przynajmniej setkach. np. na http://www.r-bloggers.com/how-to-perform-a-logistic-regression-in-r/ AIC to 727,39 Chociaż zawsze mówi się, że AIC należy używać wyłącznie do porównywania modeli, chciałem zrozumieć, co oznacza konkretna wartość AIC. Zgodnie ze wzorem A jado= - 2 log( L ) + …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.