Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Który z nich jest lepszy maksymalnym prawdopodobieństwem lub marginalnym prawdopodobieństwem i dlaczego?
Wykonując regresję, jeśli zastosujemy definicję z: Jaka jest różnica między częściowym prawdopodobieństwem, prawdopodobieństwem profilu i prawdopodobieństwem krańcowym? że, maksymalne prawdopodobieństwo Znajdź β i θ, które maksymalizuje L (β, θ | dane). Chociaż, Krańcowa Prawdopodobieństwo Integrujemy się θ z równania prawdopodobieństwa, wykorzystując fakt, że możemy zidentyfikować rozkład prawdopodobieństwa θ uwarunkowane beta. …

1
Test na kointegrację między dwoma szeregami czasowymi przy użyciu dwuetapowej metody Engle – Grangera
Próbuję przetestować kointegrację między dwoma szeregami czasowymi. Obie serie mają tygodniowe dane obejmujące ~ 3 lata. Próbuję wykonać metodę dwuetapową Engle-Granger. Moja kolejność operacji jest następująca. Testuj każdą serię czasową pod kątem pierwiastka za pomocą Augmented Dickey-Fuller. Zakładając, że oba mają pierwiastki, następnie znajdź liniowe przybliżenie relacji za pomocą OLS. …

4
Dobra praktyka analizy statystycznej w środowisku biznesowym
(Chociaż zdaję sobie sprawę, że nie chodzi wyłącznie o statystyki, chodzi o rozpowszechnianie statystyk w środowisku biznesowym, więc założyłem, że nadal mieści się w zakresie tematycznym CV) Krótkie tło: Nasze środowisko biznesowe (i podejrzewam, że inne środowiska) mają funkcję wsparcia, która specjalizuje się w analizach statystycznych i badaniach. Ściśle współpracujemy …

3
Dlaczego asymptotyczna wydajność względna testu Wilcoxona
Powszechnie wiadomo, że asymptotyczna wydajność względna (ARE) testu rang ze znakiem Wilcoxona wynosi porównaniu z testem t- Studenta, jeśli dane pochodzą z populacji o rozkładzie normalnym. Dotyczy to zarówno podstawowego testu z jedną próbką, jak i wariantu dla dwóch niezależnych próbek (Wilcoxon-Mann-Whitney U). Jest to również ARE testu Kruskala-Wallisa w …




1
Niepoprawne wnioskowanie, gdy obserwacje nie są niezależne
Nauczyłem się w statystyce elementarnej, że przy ogólnym modelu liniowym, aby wnioski były ważne, obserwacje muszą być niezależne. Kiedy występuje klastrowanie, niezależność może już nie prowadzić, prowadząc do nieprawidłowego wnioskowania, chyba że zostanie to uwzględnione. Jednym ze sposobów uwzględnienia takiego grupowania jest użycie modeli mieszanych. Chciałbym znaleźć przykładowy zestaw danych, …

2
Przykład niespójnego estymatora maksymalnego prawdopodobieństwa
Czytam komentarz do artykułu, a autor stwierdza, że ​​czasami, mimo że estymatory (znalezione przez ML lub maksymalne quasilikelihood) mogą nie być spójne, moc testu ilorazu wiarygodności lub quasi-ilorazu wiarygodności może nadal być zbieżna z 1, ponieważ liczba obserwowanych danych dąży do nieskończoności (spójność testu). Jak i kiedy to się dzieje? …

2
Czy za pomocą pakietu Caret można uzyskać macierze pomyłek dla określonych wartości progowych?
Otrzymałem model regresji logistycznej (via train) dla odpowiedzi binarnej i uzyskałem macierz dezorientacji logistycznej przez confusionMatrixin caret. Daje mi to macierz dezorientacji modelu logistycznego, choć nie jestem pewien, jakiego progu używa się do jej uzyskania. Jak uzyskać macierz nieporozumień dla określonych wartości progowych za pomocą confusionMatrixin caret?

1
Dlaczego nie zawsze korzystać z nauki zespołowej?
Wydaje mi się, że uczenie się w zespole zawsze da lepsze wyniki predykcyjne niż w przypadku jednej hipotezy uczenia się. Dlaczego więc nie używamy ich przez cały czas? Sądzę, że powodem są być może ograniczenia obliczeniowe? (nawet wtedy używamy słabych predyktorów, więc nie wiem).


4
Czym różni się weryfikacja krzyżowa od szpiegowania danych?
Właśnie skończyłem „Wprowadzenie do uczenia statystycznego” . Zastanawiałem się, czy zastosowanie weryfikacji krzyżowej w celu znalezienia najlepszych parametrów dostrajania różnych technik uczenia maszynowego różni się od szpiegowania danych? Wielokrotnie sprawdzamy, która wartość parametru strojenia daje najlepszy wynik predykcyjny w zestawie testowym. Co się stanie, jeśli parametr strojenia, do którego doszliśmy, …

1
Dlaczego lm () R zwraca inne współczynniki niż mój podręcznik?
tło Próbuję zrozumieć pierwszy przykład w kursie na temat dopasowywania modeli (więc może się to wydawać absurdalnie proste). Obliczenia wykonałem ręcznie i pasują one do przykładu, ale kiedy powtórzę je w R, współczynniki modelu są wyłączone. Myślałem, że różnica może wynikać z tego, że podręcznik używa wariancji populacji ( ), …
13 r  regression  self-study  lm 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.