Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy estymacja MLE jest asymptotycznie normalna i skuteczna, nawet jeśli model nie jest prawdziwy?
Przesłanka: to może być głupie pytanie. Znam tylko stwierdzenia o właściwościach asymptotycznych MLE, ale nigdy nie badałem dowodów. Gdybym to zrobił, może nie zadawałbym tych pytań, a może zdałbym sobie sprawę, że te pytania nie mają sensu ... więc spokojnie. Często widziałem stwierdzenia, które mówią, że estymator MLE parametrów modelu …

2
Czy istnieją okoliczności, w których należy zastosować regresję stopniową?
W przeszłości stosowano regresję krokową w wielu pracach biomedycznych, ale wydaje się, że poprawia się to wraz z lepszą edukacją wielu zagadnień. Jednak wielu starszych recenzentów wciąż o to prosi. Jakie są okoliczności, w których regresja krokowa odgrywa rolę i powinna być stosowana, jeśli w ogóle?

1
AIC regresji kalenicowej: stopnie swobody a liczba parametrów
Chcę obliczyć AICc modelu regresji grzbietu. Problemem jest liczba parametrów. W przypadku regresji liniowej większość osób sugeruje, że liczba parametrów jest równa liczbie szacowanych współczynników plus sigma (wariancja błędu). Jeśli chodzi o regresję grzbietu, czytam, że ślad macierzy kapelusza - stopień swobody (df) - jest po prostu używany jako liczba …

1
Czy możesz podać proste intuicyjne wyjaśnienie metody IRLS, aby znaleźć MLE GLM?
Tło: Staram się śledzić ocenę Princeton dotyczącą oszacowania MLE dla GLM . I zrozumieć podstawy szacowania MLE: likelihood, score, obserwowane i oczekiwane Fisher informationi Fisher scoringtechnika. I wiem, jak uzasadnić prostą regresję liniową estymacją MLE . Pytanie: Nie rozumiem nawet pierwszego wiersza tej metody :( Jaka intuicja kryje się za …

1
Pakiet GBM vs. Caret korzystający z GBM
Stroiłem model przy użyciu caret, ale potem ponownie uruchomiłem model przy użyciu gbmpakietu. Rozumiem, że caretpakiet używa gbmi wynik powinien być taki sam. Jednak tylko szybki test przy użyciu data(iris)wykazuje rozbieżność w modelu około 5% przy użyciu RMSE i R ^ 2 jako metryki oceny. Chcę znaleźć optymalną wydajność modelu …

2
Funkcje kowariancji lub jądra - czym dokładnie są?
Jestem raczej nowy w dziedzinie procesów gaussowskich i ich zastosowania w uczeniu maszynowym. Czytam i słyszę o funkcjach kowariancji będących główną atrakcją tych metod. Czy ktoś mógłby zatem w intuicyjny sposób wyjaśnić, co dzieje się w tych funkcjach kowariancji? W przeciwnym razie możesz wskazać konkretny samouczek lub dokument wyjaśniający je.

1
Dlaczego ecdf używa funkcji krokowej, a nie interpolacji liniowej?
Empiryczne funkcje CDF są zwykle szacowane przez funkcję krokową. Czy istnieje powód, dla którego odbywa się to w taki sposób, a nie przy użyciu interpolacji liniowej? Czy funkcja kroku ma jakieś interesujące właściwości teoretyczne, które sprawiają, że ją preferujemy? Oto przykład dwóch: ecdf2 <- function (x) { x <- sort(x) …
13 r  distributions  ecdf 

2
Dlaczego odcięcie P> 0,5 nie jest „optymalne” dla regresji logistycznej?
PRZEDMOWA: Nie dbam o zalety zastosowania odcięcia lub nie, ani o to, jak należy wybrać odcięcie. Moje pytanie jest czysto matematyczne i wynika z ciekawości. Regresja logistyczna modeluje prawdopodobieństwo warunkowe tylne klasy A w porównaniu z klasą B i pasuje do hiperpłaszczyzny, w której prawdopodobieństwa warunkowe tylne są równe. Teoretycznie …


1
Łącznie uzupełnij wystarczające statystyki: jednolite (a, b)
Niech X=(x1,x2,…xn)X=(x1,x2,…xn)\mathbf{X}= (x_1, x_2, \dots x_n) będzie próbką losową z rozkładu jednolitego na (a,b)(a,b)(a,b) , gdzie a&lt;ba&lt;ba < b . Niech Y1Y1Y_1 i YnYnY_n będą największymi i najmniejszymi statystykami rzędu. Pokaż, że statystyka (Y1,Yn)(Y1,Yn)(Y_1, Y_n) jest łącznie kompletną wystarczającą statystyką dla parametru θ=(a,b)θ=(a,b)\theta = (a, b). Nie jest dla mnie …

2
Jak zdefiniować region odrzucenia, gdy nie ma UMP?
Rozważ model regresji liniowej y=Xβ+uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} , u∼N(0,σ2I)u∼N.(0,σ2)ja)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) , E(u∣X)=0mi(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} . Niech vs .H0:σ20=σ2H.0:σ02)=σ2)H_0: \sigma_0^2=\sigma^2H1:σ20≠σ2H.1:σ02)≠σ2)H_1: \sigma_0^2\neq\sigma^2 Możemy wywnioskować, że , gdzie . A to typowy zapis dla matrycy anihilatora, , gdzie jest zmienną zależną zrestartował się w .yTMXyσ2∼χ2(n−k)yT.M.Xyσ2)∼χ2)(n-k)\frac{\mathbf{y}^T\mathbf{M_X}\mathbf{y}}{\sigma^2}\sim \chi^2(n-k)dim(X)=n×krejam(X)=n×kdim(\mathbf{X})=n\times kMXMX\mathbf{M_X}MXy=y^MXy=y^\mathbf{M_X}\mathbf{y}=\hat{\mathbf{y}}y^y^ \hat{\mathbf{y}}yy\mathbf{y}XX\mathbf{X} Książka, którą czytam, stwierdza, co następuje: Wcześniej zapytałem, jakie …


2
Wyjaśnienie wariancji modelu regresji
To może być proste wyjaśnienie (i tak mam nadzieję). Przeprowadziłem analizę regresji w Matlabie przy użyciu zestawu narzędzi regresji. Natknąłem się jednak na badanie, które stwierdza: „Dzięki analizie regresji możliwe było skonfigurowanie modelu predykcyjnego przy użyciu tylko czterech cech dźwiękowych, które wyjaśniają 60% wariancji” Link do artykułu jest dostępny w …
13 variance 


2
Czy wspólna normalność jest niezbędnym warunkiem, aby suma normalnych zmiennych losowych była normalna?
W komentarzach po tej mojej odpowiedzi na powiązane pytanie Użytkownicy ssdecontrol i Glen_b zapytali, czy wspólna normalność i Y jest konieczna do zapewnienia normalności sumy X + Y ? Ta wspólna normalność jest wystarczająca, jest oczywiście dobrze znana. To dodatkowe pytanie nie zostało tam poruszone i być może jest warte …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.