Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



2
Jak przeprowadzić walidację krzyżową za pomocą proporcjonalnego modelu zagrożeń Coxa?
Załóżmy, że zbudowałem model predykcyjny dla wystąpienia określonej choroby w jednym zestawie danych (zestaw danych budowania modelu) i teraz chcę sprawdzić, jak dobrze model działa w nowym zestawie danych (zestaw danych sprawdzania poprawności). Dla modelu zbudowanego z regresją logistyczną obliczałbym przewidywane prawdopodobieństwo dla każdej osoby w zbiorze danych sprawdzania poprawności …

2
Partycjonowanie drzew w R: party vs. rpart
Minęło trochę czasu, odkąd spojrzałem na dzielenie drzew. Ostatnim razem, gdy robiłem takie rzeczy, lubię imprezę w R (stworzoną przez Hothorn). Idea wnioskowania warunkowego za pomocą próbkowania ma dla mnie sens. Ale rpart również miał apelację. W obecnej aplikacji (nie mogę podać szczegółów, ale wiąże się to z próbą ustalenia, …
15 r  cart  rpart  partitioning 




3
Kiedy należy rozważyć użycie GMM?
Jedną z rzeczy, która sprawia, że ​​ekonometria jest wyjątkowa, jest zastosowanie techniki ogólnej metody momentów. Jakie rodzaje problemów sprawiają, że GMM jest bardziej odpowiedni niż inne techniki szacowania? Co kupuje GMM pod względem wydajności, mniejszej stronniczości lub bardziej szczegółowych oszacowań parametrów? I odwrotnie, co tracisz, używając GMM nad MLE itp.?



4
Jaka jest korelacja, jeśli odchylenie standardowe jednej zmiennej wynosi 0?
Jak rozumiem, możemy uzyskać korelację poprzez normalizację kowariancji za pomocą równania ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} gdzie to odchylenie standardowe . Xiσi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XiXiX_i Moje obawy dotyczą tego, czy odchylenie standardowe wynosi zero? Czy jest jakiś warunek, który gwarantuje, że nie może wynosić zero? Dzięki.

2
Rosnąca liczba funkcji powoduje spadek dokładności, ale wzrost wstępnego / wycofania
Jestem nowy w uczeniu maszynowym. W tej chwili używam klasyfikatora Naive Bayes (NB) do klasyfikowania małych tekstów w 3 klasach jako pozytywne, negatywne lub neutralne, używając NLTK i python. Po przeprowadzeniu niektórych testów z zestawem danych złożonym z 300 000 instancji (16 924 pozytywów 7 477 negatywów i 275 599 …

6
Jak wykryć znaczącą zmianę danych szeregów czasowych z powodu zmiany „zasad”?
Mam nadzieję, że jest to właściwe miejsce do opublikowania tego. Rozważyłem opublikowanie go sceptykom, ale sądzę, że po prostu powiedzieliby, że badanie było statystycznie nieprawidłowe. Jestem ciekaw drugiej strony pytania, jak to zrobić dobrze. Na stronie internetowej Quantified Self autor opublikował wyniki eksperymentu pewnej miary wydajności mierzonej na sobie w …


5
Jaki jest dobry zasób obejmujący porównanie zalet i wad różnych klasyfikatorów?
Jaki jest najlepszy gotowy do użycia klasyfikator 2 klas? Tak, myślę, że to pytanie za milion dolarów i tak, jestem świadomy twierdzenia o braku darmowego lunchu , a także przeczytałem poprzednie pytania: Jaki jest najlepszy gotowy do użycia 2-klasowy klasyfikator dla Twojej aplikacji? i najgorszy klasyfikator Nadal jestem zainteresowany czytaniem …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.