Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Współczynnik korelacji międzyklasowej w modelu mieszanym z losowymi nachyleniami
Mam następujący model m_plotwyposażony w lme4::lmerskrzyżowane efekty losowe dla uczestników ( lfdn) i przedmiotów ( content): Random effects: Groups Name Variance Std.Dev. Corr lfdn (Intercept) 172.173 13.121 role1 62.351 7.896 0.03 inference1 24.640 4.964 0.08 -0.30 inference2 52.366 7.236 -0.05 0.17 -0.83 inference3 21.295 4.615 -0.03 0.22 0.86 -0.77 content …

1
Czy można wykazać statystycznie, że samochody są używane jako narzędzia zbrodni?
Niedawno usłyszałem historię, w której ktoś powiedział, że jeśli chce kogoś zabić (i uciec), zrobi to z samochodem. Przytaczali różne statystyki dotyczące liczby zgonów związanych z samochodami (w tym samochodów na pieszych) w połączeniu z dodatkowymi statystykami dotyczącymi liczby kierowców faktycznie skazanych na wszelkiego rodzaju przestępstwa ... bla, bla, bla. …

3
Wnioskowanie o modelu mieszanki 2-gaussowskiej z MCMC i PyMC
Problem Chcę dopasować parametry modelu prostej populacji mieszanki 2-Gaussa. Biorąc pod uwagę cały szum wokół metod bayesowskich, chcę zrozumieć, czy w przypadku tego problemu wnioskowanie bayesowskie jest lepszym narzędziem niż tradycyjne metody dopasowywania. Do tej pory MCMC radzi sobie bardzo słabo w tym przykładzie z zabawkami, ale może coś przeoczyłem. …


2
Jak wybrać rozmiar zestawu szkoleniowego, walidacji krzyżowej i zestawu testowego dla danych o małej próbce?
Załóżmy, że mam małą próbkę, np. N = 100, i dwie klasy. Jak wybrać rozmiar zestawu szkoleniowego, walidacyjnego i testowego do uczenia maszynowego? Intuicyjnie wybrałbym Rozmiar zestawu treningowego wynosi 50 Zestaw do walidacji krzyżowej rozmiar 25 i Rozmiar testowy wynosi 25. Ale prawdopodobnie ma to mniej lub bardziej sens. Jak …

2
Jak zmienić próg klasyfikacji w R randomForests?
Cała literatura na temat modelowania rozmieszczenia gatunków sugeruje, że przy przewidywaniu obecności / nieobecności gatunku przy użyciu modelu, który generuje prawdopodobieństwa (np. RandomForests), ważny jest wybór progowej prawdopodobieństwa, według której można faktycznie sklasyfikować gatunek jako obecność lub nieobecność i należy nie zawsze polegają na domyślnej wartości 0,5. Potrzebuję w tym …


2
W jaki sposób statystyki chi-kwadrat Pearsona przybliżają rozkład chi-kwadrat
Jeśli więc podana jest chi-kwadratowa statystyka Pearsona dla tabeli , wówczas jej forma jest następująca:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} W przybliżeniu , rozkład chi-kwadrat z n - 1 stopniami swobody, gdy wielkość próbki N powiększa się. χ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN Nie rozumiem, jak działa to asymptotyczne przybliżenie. Czuję, że w mianownikach należy …




2
Caret varImp dla modelu randomForest
Mam problem ze zrozumieniem, jak varImpdziała ta funkcja dla modelu randomForest z caretpakietem. W poniższym przykładzie funkcja var3 uzyskuje zerową ważność za pomocą varImpfunkcji Careta, ale leżący u jej podstaw model końcowy randomForest ma niezerowe znaczenie dla cechy var3. Dlaczego tak jest? require(randomForest) require(caret) rf <- train(x, y, method = …
10 r  caret  random-forest 

2
Interwencja z różnicowaniem
Podczas przeprowadzania analizy interwencyjnej z wykorzystaniem danych szeregów czasowych (zwanych również przerwanymi szeregami czasowymi), jak tutaj omówiono , na przykład jednym z moich wymagań jest oszacowanie całkowitego zysku (lub straty) spowodowanego interwencją - tj. Liczby jednostek uzyskanych lub utraconych (zmienna Y ). Nie do końca rozumiem, jak oszacować funkcję interwencji …

1
Czy walidacja wstrzymania jest lepszym przybliżeniem „uzyskiwania nowych danych” niż k-krotnie CV?
Zastanawiam się nad odpowiedzią na pytanie kilka tygodni temu Potwierdzenie wzajemnej walidacji daje jeden zestaw testowy, który można wielokrotnie wykorzystywać do celów demonstracyjnych. Wydaje się, że wszyscy zgadzamy się, że jest to pod wieloma względami cecha negatywna, ponieważ jeden ustalony zestaw może okazać się niereprezentatywny z powodu losowości. Co więcej, …

2
Czy typy danych (nominalne / porządkowe / interwałowe / stosunek) naprawdę powinny być uważane za typy zmiennych?
Oto na przykład definicje, które otrzymuję ze standardowych podręczników Zmienna - charakterystyczna dla populacji lub próby. dawny. Cena akcji lub oceny na teście Dane - rzeczywiste obserwowane wartości Tak więc dla raportu dwukolumnowego [Nazwa | Dochód] nazwami kolumn byłyby zmienne, a rzeczywiste zaobserwowane wartości {dave | 100K}, {jim | 200 …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.