Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Błąd podczas uruchamiania glmnet w trybie wielomianowym [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 9 miesięcy temu . Problem wspomniany w tym pytaniu został rozwiązany w wersji 1.7.3 pakietu R glmnet. Mam problemy z uruchomieniem glmnet z rodziną = …
9 r  multinomial  glmnet 

1
Kiedy wybrać PCA vs. LSA / LSI
Pytanie: Czy istnieją jakieś ogólne wytyczne dotyczące charakterystyki danych wejściowych, które można wykorzystać do podjęcia decyzji między zastosowaniem PCA a LSA / LSI? Krótkie streszczenie PCA vs. LSA / LSI: Zasada analizy składowej (PCA) i analizy utajonej semantycznej (LSA) lub utajonej indeksacji semantycznej (LSI) są podobne w tym sensie, że …

1
Najlepszy sposób obsługi niezbilansowanego zestawu danych wieloklasowych za pomocą SVM
Próbuję zbudować model predykcyjny za pomocą maszyn SVM na dość niezrównoważonych danych. Moje etykiety / wyniki mają trzy klasy: pozytywną, neutralną i negatywną. Powiedziałbym, że pozytywny przykład stanowi około 10-20% moich danych, neutralny około 50-60%, a negatywny około 30-40%. Próbuję zrównoważyć klasy, ponieważ koszty związane z niepoprawnymi prognozami między klasami …


2
Jak dopasować regresję, taką jak in R?
Mam pewne dane szeregów czasowych, w których mierzoną zmienną są dyskretne dodatnie liczby całkowite (liczby). Chcę sprawdzić, czy z czasem (lub nie) występuje trend wzrostowy. Zmienna niezależna (x) jest w zakresie 0-500, a zmienna zależna (y) jest w zakresie 0-8. Myślałem, że odpowiem na to, dopasowując regresję formy y = …
9 r  regression  python 

1
Porady dla absolwentów statystyki
W tym roku rozpocząłem doktorat z statystyki i szukam twoich najlepszych praktyk, porad i (meta-porad) dotyczących tego, jak się rozwijać i zostać dobrym naukowcem w dziedzinie statystyki / ML. Ogólne przemyślenia i linki są mile widziane, ale aby rozpocząć grę, oto kilka pytań zebranych ze wspaniałego artykułu Michaela Steele'a „ …
9 careers  phd  academia 


4
Jak powiedzieć ilościowo, czy dane 1D są skupione wokół 1 czy 3 wartości?
Mam dane na temat czasu między uderzeniami serca człowieka. Jednym ze wskazań ektopowych (dodatkowych) uderzeń jest to, że przedziały te są skupione wokół trzech wartości zamiast jednej. Jak mogę uzyskać ilościową miarę tego? Chcę porównać wiele zestawów danych, a te dwa 100-bin histogramy są reprezentatywne dla wszystkich z nich. Mógłbym …


1
Rozkład odwrotności współczynnika regresji
Załóżmy, że mamy model liniowy który spełnia wszystkie założenia regresji standardowej (Gaussa-Markowa). Interesuje nas .yi=β0+β1xi+ϵiyi=β0+β1xi+ϵiy_i = \beta_0 + \beta_1 x_i + \epsilon_iθ=1/β1θ=1/β1\theta = 1/\beta_1 Pytanie 1: Jakie założenia są konieczne, aby rozkład był dobrze zdefiniowany? byłoby ważne --- jakieś inne?θ^θ^\hat{\theta}β1≠0β1≠0\beta_1 \neq 0 Pytanie 2: Dodaj założenie, że błędy mają rozkład …


3
Jaka może być jasna, praktyczna definicja „rodziny hipotez” (w odniesieniu do rodzinnego poziomu błędu)?
Próbując ocenić, co stanowi rodzinę hipotez w ramach eksperymentu / projektu / analizy, znalazłem „podobne w celu” i „podobne w treści” podane jako wytyczne do rozgraniczania rodzin, ale pozostawiają one wiele możliwości interpretacji ( delikatnie mówiąc). Wydaje się jasne, że jeśli w trakcie analizy przeprowadzę kilka testów średnich grupowych i …

2
Czy mogę ufać regresji, jeśli zmienne są autokorelowane?
Obie zmienne (zależne i niezależne) wykazują efekty autokorelacji. Dane są szeregami czasowymi i stacjonarnymi Po uruchomieniu regresji reszty wydają się nie być skorelowane. Moja statystyka Durbina-Watsona jest większa niż górna wartość krytyczna, więc istnieją dowody, że terminy błędów nie są dodatnio skorelowane. Również, gdy wykreślam ACF pod kątem błędów, wygląda …


1
Wizualizacja kolejnych proporcji
Staram się wizualizować niektóre dane konsumentów, które mają 4 kategorie. Użytkownicy mogą swobodnie przełączać się między różnymi kategoriami. Chciałbym wizualizować ostatnie trzy lub cztery przełączniki dla każdej osoby. Zaczniemy więc od wykresu z kolumną o 4 stosach. Potem będziemy mieli 16, ponieważ każda kategoria dzieli się na to, co ludzie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.