Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


11
Podcasty statystyczne
Jakie są podcasty związane z analizą statystyczną? Znalazłem kilka nagrań audio z wykładów uniwersyteckich na ITunes U, ale nie znam żadnych statystycznych podcastów. Najbliższa rzecz, o której wiem, to podcast z badań operacyjnych The Science of Better . Dotyka kwestii statystycznych, ale nie jest to konkretnie program statystyczny.
29 references 

3
Jak przeprowadzić regresję ortogonalną (suma najmniejszych kwadratów) za pomocą PCA?
Zawsze używam lm()w R do regresji liniowej na . Ta funkcja zwraca współczynnik taki, żeyyyxxxββ\betay=βx.y=βx.y = \beta x. Dzisiaj dowiedziałem się o całkowitej liczbie najmniejszych kwadratów i tej princomp()funkcji (analiza głównego składnika, PCA) można użyć do jej wykonania. To powinno być dla mnie dobre (dokładniejsze). Zrobiłem kilka testów przy użyciu …


6
Zmienna procedura selekcji do klasyfikacji binarnej
Jakiego wyboru zmiennych / cech preferujesz do klasyfikacji binarnej, gdy w zestawie do nauki jest o wiele więcej zmiennych / cech niż obserwacji? Celem jest omówienie procedury wyboru funkcji, która najlepiej redukuje błąd klasyfikacji. Możemy poprawić notacje dla spójności: dla , niech będą zestawem uczącym się obserwacji z grupy . …

6
Test na skończoną wariancję?
Czy możliwe jest sprawdzenie skończoności (lub istnienia) wariancji zmiennej losowej na podstawie próbki? Jako zero, albo {wariancja istnieje i jest skończona}, albo {wariancja nie istnieje / jest nieskończona} byłoby dopuszczalne. Filozoficznie (i obliczeniowo) wydaje się to bardzo dziwne, ponieważ nie powinno być różnicy między populacją bez wariancji skończonej, a populacją …


1
Jakie są wady średniego bezwzględnego błędu procentowego (MAPE)?
Mean Absolute Procent Błąd ( mape ) jest powszechną miarą dokładności lub błąd w przypadku szeregów czasowych lub innych przewidywań, MAPE=100n∑t=1n|At−Ft|At%,MAPE=100n∑t=1n|At−Ft|At%, \text{MAPE} = \frac{100}{n}\sum_{t=1}^n\frac{|A_t-F_t|}{A_t}\%, gdzie to wartości rzeczywiste, a odpowiednie prognozy lub prognozy.F tAtAtA_tFtFtF_t MAPE to wartość procentowa, dzięki czemu możemy łatwo porównać ją między seriami, a ludzie mogą łatwo …
29 accuracy  mape 

2
Dlaczego warto stosować stratyfikację krzyżową? Dlaczego nie wpływa to na korzyści związane z wariancją?
Powiedziano mi, że korzystne jest stosowanie warstwowej weryfikacji krzyżowej, zwłaszcza gdy klasy odpowiedzi są niezrównoważone. Jeśli jednym z celów walidacji krzyżowej jest pomoc w rozliczeniu losowości naszej oryginalnej próbki danych treningowych, na pewno sprawienie, by każda zakładka miała taki sam rozkład klas, działałoby przeciwko temu, chyba że byłeś pewien, że …

1
Interwał przewidywania ładowania początkowego
Czy jest dostępna technika ładowania początkowego do obliczania przedziałów predykcji dla prognoz punktowych uzyskanych np. Z regresji liniowej lub innej metody regresji (k-najbliższy sąsiad, drzewa regresji itp.)? Jakoś wydaje mi się, że czasami proponowanym sposobem, aby po prostu wyrzucić prognozę punktową (patrz np. Przedziały predykcji dla regresji kNN ), nie …


4
Pseudo-R2 Interpretacja McFaddena
Mam binarny model regresji logistycznej z pseudo-kwadratem McFaddena wynoszącym 0,192 ze zmienną zależną o nazwie płatność (1 = płatność i 0 = brak płatności). Jaka jest interpretacja tego pseudo R-kwadrat? Czy jest to porównanie względne dla modeli zagnieżdżonych (np. Model 6 zmiennych ma pseudo R kwadrat McFaddena równy 0,192, podczas …

1
Metryki błędów dla krzyżowej weryfikacji modeli Poissona
Sprawdzam krzyżowo model, który próbuje przewidzieć liczbę. Gdyby to był problem z klasyfikacją binarną, obliczyłbym nieoczekiwane AUC, a jeśli byłby to problem regresji, obliczyłbym nieoczekiwanie RMSE lub MAE. W przypadku modelu Poissona, jakich mierników błędów mogę użyć do oceny „dokładności” prognoz poza próbą? Czy istnieje rozszerzenie AUC Poissona, które sprawdza, …

3
Regresja wielomianowa za pomocą scikit-learn
Próbuję użyć scikit-learn do regresji wielomianowej. Z tego, co czytam, regresja wielomianowa jest szczególnym przypadkiem regresji liniowej. Miałem nadzieję, że może jeden z uogólnionych modeli liniowych scikit może zostać sparametryzowany, aby pasował do wielomianów wyższego rzędu, ale nie widzę takiej możliwości. Udało mi się użyć Support Vector Regressor z wielordzeniowym …

2
Jak statystycznie porównać wydajność klasyfikatorów uczenia maszynowego?
W oparciu o szacunkową dokładność klasyfikacji chcę przetestować, czy jeden klasyfikator jest statystycznie lepszy na zestawie podstawowym niż inny klasyfikator. Dla każdego klasyfikatora wybieram próbkę szkoleniową i testową losowo z zestawu podstawowego, trenuję model i testuję model. Robię to dziesięć razy dla każdego klasyfikatora. Dlatego mam dziesięć dokładnych pomiarów dokładności …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.