Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy jest zamkniętym zestawem konwencji w testowaniu hipotez?
W testowaniu hipotez statystycznych hipoteza zerowa często przyjmuje postać (przynajmniej w książkach, które przeczytałem): lub H0H0H_0H0:H0:θ=θ0θ≤θ0H0:θ=θ0H0:θ≤θ0 \begin{align*} H_0:&\theta=\theta_0\\ H_0:&\theta\le\theta_0 \end{align*} H0:θ1≤θ≤θ2H0:θ1≤θ≤θ2 H_0:\theta_1\le\theta\le\theta_2 Czy to tylko konwencja, że ​​zestawy w są zamknięte? Czy są jakieś inne powody?H0H0H_0

2
Jak powinienem modelować interakcje między zmiennymi objaśniającymi, gdy jedna z nich może mieć wyrażenia kwadratowe i sześcienne?
Mam szczerą nadzieję, że sformułowałem to pytanie w taki sposób, że można na nie ostatecznie odpowiedzieć - jeśli nie, proszę dać mi znać, a spróbuję ponownie! Powinienem też chyba zauważyć, że do tych analiz będę używać R. Mam kilka środków, plant performance (Ys)które, jak podejrzewam, były pod wpływem czterech zabiegów, …

2
Czy istnieje elegancki / wnikliwy sposób zrozumienia tej tożsamości regresji liniowej dla wielu ?
W regresji liniowej doszedłem do cudownego wyniku, jeśli dopasujemy model E[Y]=β1X1+β2X2+c,E[Y]=β1X1+β2X2+c,E[Y] = \beta_1 X_1 + \beta_2 X_2 + c, to jeśli znormalizujemy i wyśrodkujemy dane , i ,YYYX1X1X_1X2X2X_2 R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R^2 = \mathrm{Cor}(Y,X_1) \beta_1 + \mathrm{Cor}(Y, X_2) \beta_2. Wydaje mi się, że jest to zmienna wersja dla regresji , co jest przyjemne.R2=Cor(Y,X)2R2=Cor(Y,X)2R^2 …

1
Odniesienie do historii o pobieraniu próbek z książki telefonicznej
Rozmawiałem dzisiaj z kimś o pobieraniu próbek i niejasno pamiętam historię o bardzo szanowanym statystyce, który zaleca systematyczne pobieranie próbek z książki telefonicznej w konkretnej sprawie prawnej. Pamiętam historię, która opowiadała coś jak sędzia w sądzie, mówiąc coś do niego: „Nie wiem wiele o statystykach, ale wiem, że pobieranie próbek …

1
Od identyfikacji do oszacowania
Obecnie czytam pracę Pearl (Pearl, 2009, 2. wydanie) na temat przyczynowości i walki o ustalenie związku między nieparametryczną identyfikacją modelu a faktycznym oszacowaniem. Niestety sam Pearl milczy na ten temat. Na przykład mam na myśli prosty model z przyczynową ścieżką, x → z→ yx→z→yx \rightarrow z \rightarrow yoraz zamieszanie, które …

3
Wykrywanie anomalii szeregów czasowych za pomocą Pythona
Muszę wdrożyć wykrywanie anomalii w kilku zestawach danych szeregów czasowych. Nigdy wcześniej tego nie robiłem i liczyłem na radę. Bardzo dobrze czuję się w Pythonie, więc wolałbym, aby rozwiązanie było zaimplementowane w nim (większość mojego kodu to Python dla innych części mojej pracy). Opis danych: to miesięczne dane szeregów czasowych, …


2
Jak interpretować wykresy ACF i PACF
Chcę tylko sprawdzić, czy poprawnie interpretuję wykresy ACF i PACF: Dane odpowiadają błędom wygenerowanym między rzeczywistymi punktami danych a oszacowaniami wygenerowanymi przy użyciu modelu AR (1). Spojrzałem na odpowiedź tutaj: Oszacuj współczynniki ARMA na podstawie kontroli ACF i PACF Po przeczytaniu, że wydaje się, że błędy nie są autokorelowane, ale …

1
Bezstronny estymator z minimalną wariancją dla
Niech będzie losową próbką o rozkładzie dla . To znaczy,X1,...,XnX1,...,Xn X_1, ...,X_nGeometric(θ)Geometric(θ)Geometric(\theta)0&lt;θ&lt;10&lt;θ&lt;10<\theta<1 pθ(x)=θ(1−θ)x−1I{1,2,...}(x)pθ(x)=θ(1−θ)x−1I{1,2,...}(x)p_{\theta}(x)=\theta(1-\theta)^{x-1} I_{\{1,2,...\}}(x) Znajdź obiektywny estymator o minimalnej wariancji dlag(θ)=1θg(θ)=1θg(\theta)=\frac{1}{\theta} Moja próba: Ponieważ rozkład geometryczny pochodzi z rodziny wykładniczej, statystyki jest kompletna i wystarczająca dla . Ponadto, jeśli jest estymatorem dla , jest on bezstronny. Dlatego według twierdzenia Rao-Blackwella …

3
Dlaczego ludzie lubią płynne dane?
Mam użyć kwadratu jądra wykładniczego (SE) do regresji procesu Gaussa. Zalety tego jądra są: 1) proste: tylko 3 hiperparametry; 2) gładka: to jądro jest gaussowskie. Dlaczego ludzie tak bardzo lubią „gładkość”? Wiem, że jądro Gaussa jest nieskończenie zróżnicowane, ale czy to takie ważne? (Daj mi znać, jeśli istnieją inne powody, …

1
Rodzina wykładnicza: obserwowane a oczekiwane wystarczające statystyki
Moje pytanie wynika z przeczytania „Szacowania rozkładu Dirichleta” Minki , który stwierdza bez dowodu w kontekście wyprowadzenia estymatora największego prawdopodobieństwa dla rozkładu Dirichleta na podstawie obserwacji losowych wektorów: Jak zawsze w przypadku rodziny wykładniczej, gdy gradient wynosi zero, oczekiwane wystarczające statystyki są równe zaobserwowanym wystarczającym statystykom. Nie widziałem oszacowania maksymalnego …

4
Najmniej skorelowany podzbiór zmiennych losowych z macierzy korelacji
Mam macierz korelacji , którą uzyskałem za pomocą współczynnika korelacji liniowej Pearsona za pomocą corrcoef Matlaba () . Macierz korelacji o wymiarze 100x100, tj. Obliczyłem macierz korelacji na 100 zmiennych losowych.ZAZAA Spośród tych 100 zmiennych losowych chciałbym znaleźć 10 zmiennych losowych, których macierz korelacji zawiera możliwie „małą korelację” (patrz Obliczanie, …


5
Czy używanie decyli do znalezienia korelacji jest statystycznie poprawnym podejściem?
Mam próbkę 1449 punktów danych, które nie są skorelowane (r-kwadrat 0,006). Analizując dane, odkryłem, że dzieląc wartości zmiennych niezależnych na grupy dodatnie i ujemne, wydaje się, że istnieje znacząca różnica w średniej zmiennej zależnej dla każdej grupy. Dzieląc punkty na 10 przedziałów (decyli) przy użyciu niezależnych wartości zmiennych, wydaje się, …

2
Regresja logistyczna i porządkowe zmienne niezależne
Znalazłem ten post: Tak. Współczynnik odzwierciedla zmianę ilorazów logarytmicznych dla każdego przyrostu zmiany w predyktorze porządkowym. Ta (bardzo powszechna) specyfikacja modelu zakłada, że ​​predyktor ma liniowy wpływ na swoje przyrosty. Aby przetestować to założenie, możesz porównać model, w którym używasz zmiennej porządkowej jako pojedynczego predyktora, z modelem, w którym dyskretyzujesz …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.