Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy można zaakceptować alternatywną hipotezę?
Znam tutaj kilka powiązanych pytań (np. Hipoteza testująca terminologię otaczającą zero , Czy można udowodnić hipotezę zerową? ), Ale nie znam ostatecznej odpowiedzi na moje pytanie poniżej. Załóżmy test hipotez, w którym chcemy sprawdzić, czy moneta jest uczciwa, czy nie. Mamy dwie hipotezy: H.0: p ( h e a d) …

1
Kolejność opóźnień dla testu przyczynowości Grangera
Załóżmy, że rozważam kilka niezależnych zmiennych w celu ewentualnego włączenia do opracowywanego modelu ARIMAX. Przed dopasowaniem różnych zmiennych chciałbym odfiltrować zmienne wykazujące odwrotną przyczynowość za pomocą testu Grangera (używam granger.testfunkcji z MSBVARpakietu w R, chociaż uważam, że inne wtrącenia działają podobnie). Jak ustalić, ile opóźnień należy przetestować? Funkcja R to:, …

2
Wykrywanie wartości odstających za pomocą regresji
Można zastosować regresję do wykrycia naszych poziomów. Rozumiem, że istnieją sposoby na ulepszenie modelu regresji poprzez usunięcie wartości odstających. Ale głównym celem tutaj nie jest dopasowanie modelu regresji, ale znalezienie lierów za pomocą regresji

2
Funkcje Percentile Loss
Rozwiązanie problemu: minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] jest dobrze znana jako mediana XXX , ale jak wygląda funkcja utraty dla innych percentyli? Np .: 25. percentyl X jest rozwiązaniem: minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] Co to jest LLL w tym przypadku?

4
Jak radzić sobie z brakującymi wartościami, aby przygotować dane do wyboru funkcji w LASSO?
Moja sytuacja: mała wielkość próby: 116 binarna zmienna wyniku długa lista zmiennych objaśniających: 44 zmienne objaśniające nie pochodziły z mojej głowy; ich wybór opierał się na literaturze. większość przypadków w próbie i większość zmiennych ma brakujące wartości. Podejdź do wybranego wyboru funkcji: LASSO Pakiet glmnet R nie pozwala mi uruchomić …

5
Algorytm Metropolis Hastings
Muszę przestudiować metody Markov Chain Monte Carlo, a dokładniej muszę przestudiować algorytm Metropolis Hastings i wszystko w tym stylu, jak kryteria konwergencji. Kto może przepisać mi książkę, artykuł lub stronę internetową, które wyjaśniają ten argument przy użyciu prostych terminów, ale nie są trywialne?
11 references  mcmc 

1
Zalety odległości Jeffries Matusita
Według niektórych artykułów, które czytam, powszechnie stosuje się odległość Jeffriesa i Matusity. Ale nie mogłem znaleźć wielu informacji na ten temat, z wyjątkiem poniższej formuły JMD (x, y) = ∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} Jest podobny do odległości euklidesowej z wyjątkiem pierwiastka kwadratowego E (x, y) = ∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} Pod względem klasyfikacji odległość JM jest …

3
Jak trenować regresję (logistyczną?) W R za pomocą funkcji utraty L1?
Potrafię trenować regresję logistyczną w zakresie Rkorzystania glm(y ~ x, family=binomial(logit))) ale IIUC optymalizuje to pod kątem prawdopodobieństwa dziennika. Czy istnieje sposób wytrenowania modelu za pomocą funkcji straty liniowej ( L.1L1L_1 ) (która w tym przypadku jest taka sama jak całkowita odległość zmienności )? To znaczy, biorąc pod uwagę wektor …
11 logistic 

5
Intuicja na temat definicji kowariancji
Próbowałem lepiej zrozumieć kowariancję dwóch zmiennych losowych i zrozumieć, jak pierwsza osoba, która o tym pomyślała, doszła do definicji rutynowo stosowanej w statystyce. Poszedłem na wikipedię, aby lepiej to zrozumieć. Z artykułu wynika, że ​​dobra miara kandydata lub ilość dla powinna mieć następujące właściwości:doo v ( X, Y)Cov(X,Y)Cov(X,Y) Powinien mieć …

2
Regresja logistyczna: interpretacja zmiennych ciągłych
Miałem kilka pytań dotyczących interpretacji ilorazów szans dla zmiennych ciągłych w regresji logistycznej. Wydaje mi się, że są to podstawowe pytania dotyczące regresji logistycznej (i prawdopodobnie ogólnie regresji) i chociaż wstydzę się nieco, że nie znam odpowiedzi, przełknę dumę i zapytam, aby je poznać przyszłość! Oto moja sytuacja ... Patrzę …


1
Jak przewidujemy rzadkie zdarzenia?
Pracuję nad opracowaniem modelu przewidywania ryzyka ubezpieczeniowego. Modele te mają „rzadkie zdarzenia”, takie jak przewidywanie braku linii lotniczych, wykrywanie usterek sprzętowych itp. Przygotowując zestaw danych, próbowałem zastosować klasyfikację, ale nie mogłem uzyskać przydatnych klasyfikatorów z powodu dużej liczby przypadków negatywnych . Nie mam dużego doświadczenia w statystyce i modelowaniu danych …

1
Jak wybrać prawdopodobieństwo odcięcia dla rzadkiego zdarzenia Regresja logistyczna
Mam 100 000 obserwacji (9 zmiennych fikcyjnych) z 1000 pozytywów. Regresja logistyczna powinna w tym przypadku działać dobrze, ale prawdopodobieństwo odcięcia mnie zastanawia. W powszechnej literaturze wybieramy 50% wartości odcięcia, aby przewidzieć 1 i 0. Nie mogę tego zrobić, ponieważ mój model daje maksymalną wartość ~ 1%. Więc próg może …

4
Wprowadzenie do statystyki nieparametrycznej
Przez ostatnie dwa lata studiowałem statystyki. Prawie wszystko, czego się nauczyłem, dotyczy statystyki parametrycznej. Teraz chciałbym dowiedzieć się więcej o statystyce nieparametrycznej. Czy ktoś może zasugerować zwięzłe (być może również czytelne) wprowadzenie w tę dziedzinę?

3
Jakiego algorytmu należy użyć, aby zgrupować ogromny binarny zestaw danych w kilka kategorii?
Mam dużą (650K wierszy * 62 kolumny) macierz danych binarnych (tylko wpisy 0-1). Matryca jest w większości rzadka: około 8% jest wypełnione. Chciałbym podzielić go na 5 grup - powiedzmy nazwanych od 1 do 5. Próbowałem zgrupować hierarchicznie i nie byłem w stanie obsłużyć rozmiaru. Użyłem również algorytmu grupowania k-średnich …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.