Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



2
PCA i eksploracyjna analiza czynnikowa w tym samym zbiorze danych: różnice i podobieństwa; model czynnikowy vs PCA
Chciałbym wiedzieć, czy logiczne jest przeprowadzanie analizy głównych składników (PCA) i eksploracyjnej analizy czynnikowej (EFA) na tym samym zbiorze danych. Słyszałem, że specjaliści wyraźnie zalecają: Zrozum, jaki jest cel analizy i wybierz PCA lub EFA do analizy danych; Po przeprowadzeniu jednej analizy nie ma potrzeby wykonywania drugiej analizy. Rozumiem różnice …

3
Jak ocenić skośność na podstawie wykresu pudełkowego?
Jak decydować o skośności, patrząc na wykres pudełkowy zbudowany z tych danych: 340, 300, 520, 340, 320, 290, 260, 330 Jedna z książek mówi: „Jeśli dolny kwartyl znajduje się dalej od mediany niż górny kwartyl, wówczas rozkład jest ujemnie wypaczony”. Kilka innych źródeł powiedziało mniej więcej to samo. Zbudowałem boxplot …

1
Oblicz i wykreśl granicę decyzyjną LDA
Widziałem wykres LDA (liniowa analiza dyskryminacyjna) z granicami decyzyjnymi z elementów uczenia statystycznego : Rozumiem, że dane są rzutowane na podprzestrzeń o niższych wymiarach. Chciałbym jednak wiedzieć, w jaki sposób uzyskujemy granice decyzji w oryginalnym wymiarze, tak że mogę rzutować granice decyzji na podprzestrzeń o niższych wymiarach (lubi czarne linie …

4
W praktyce, w jaki sposób ludzie obsługują ANOVA, gdy dane nie spełniają założeń?
To nie jest pytanie ściśle statystyczne - mogę przeczytać wszystkie podręczniki dotyczące założeń ANOVA - Staram się dowiedzieć, jak prawdziwi pracujący analitycy radzą sobie z danymi, które nie do końca spełniają założenia. Przeszedłem wiele pytań na tej stronie w poszukiwaniu odpowiedzi i ciągle znajduję posty o tym, kiedy nie używać …

4
GEE: wybór odpowiedniej roboczej struktury korelacji
Jestem epidemiologiem, który próbuje zrozumieć GEE w celu prawidłowej analizy badania kohortowego (używając regresji Poissona z łączem logarytmicznym, aby oszacować ryzyko względne). Mam kilka pytań dotyczących „korelacji roboczej”, które chciałbym wyjaśnić komuś bardziej kompetentnemu: (1) Jeśli powtórzyłem pomiary u tej samej osoby, czy zazwyczaj najbardziej rozsądne jest przyjęcie struktury wymiennej? …
19 gee 

1
Kiedy dostępny jest analityczny jakobian, czy lepiej jest przybliżyć Hessian przez
Powiedzmy, że obliczam niektóre parametry modelu, minimalizując resztkowe sumy do kwadratu i zakładam, że moje błędy są gaussowskie. Mój model wytwarza analityczne pochodne, więc optymalizator nie musi używać różnic skończonych. Po zakończeniu dopasowania chcę obliczyć standardowe błędy dopasowanych parametrów. Zasadniczo w tej sytuacji przyjmuje się, że Hesja funkcji błędu jest …

2
Bootstrapping - czy najpierw muszę usunąć wartości odstające?
Przeprowadziliśmy test podziału nowej funkcji produktu i chcemy sprawdzić, czy wzrost przychodów jest znaczący. Nasze obserwacje zdecydowanie nie są normalnie rozpowszechniane (większość naszych użytkowników nie wydaje, a wśród tych, którzy to robią, jest mocno wypaczona w kierunku wielu małych wydawców i kilku bardzo dużych wydawców). Zdecydowaliśmy się na użycie ładowania …

1
Caret i współczynniki (glmnet)
Interesuje mnie korzystanie z narzędzia do robienia wniosków na temat określonego zestawu danych. Czy można wykonać następujące czynności: wytwarzam współczynniki modelu glmnet, który trenowałem w toku. Chciałbym używać glmnet ze względu na nieodłączny wybór funkcji, ponieważ nie wierzę, że glm go ma? inne niż metryka ROC, czy istnieje inna metryka, …
19 caret  glmnet 

2
Losowy las jest zbyt dobry?
Eksperymentuję z losowymi lasami za pomocą scikit-learn i uzyskuję świetne wyniki mojego zestawu treningowego, ale stosunkowo słabe wyniki na moim zestawie testowym ... Oto problem (inspirowany pokerem), który próbuję rozwiązać: biorąc pod uwagę karty własne gracza A, karty własne gracza B i flop (3 karty), który gracz ma najlepszą rękę? …

1
Uzyskiwanie wartości p dla „multinom” w R (pakiet nnet)
Jak uzyskać wartości p za pomocą multinomfunkcji nnetpakiet w R? Mam zestaw danych, który składa się z „wyników patologii” (nieobecny, łagodny, ciężki) jako zmiennej wynikowej oraz dwóch głównych efektów: wieku (dwa czynniki: dwadzieścia / trzydzieści dni) i grupy leczenia (cztery czynniki: zainfekowany bez ATB; zainfekowany + ATB1; zainfekowany + ATB2; …

3
Związek między regresją kalenicową a regresją PCA
Pamiętam, że gdzieś w Internecie przeczytałem związek między regresją kalenicy (z regulacją ℓ2ℓ2\ell_2 ) a regresją PCA: podczas korzystania z regresji regulowanej z hiperparametrem , jeśli , to regresja jest równoważna usunięciu Zmienna PC o najmniejszej wartości własnej.ℓ2ℓ2\ell_2λλ\lambdaλ→0λ→0\lambda \to 0 Dlaczego to prawda? Czy to ma coś wspólnego z procedurą …


4
Czy analiza Bayesian Statistics wymaga analizy mocy?
Ostatnio badałem bayesowskie podejście do statystyki klasycznej. Po przeczytaniu o czynniku Bayesa zastanawiałem się, czy analiza mocy jest niezbędna w tym widoku statystyki. Moim głównym powodem do zastanowienia się nad tym jest fakt, że czynnik Bayesa wydaje się po prostu współczynnikiem prawdopodobieństwa. Kiedy jest to 25: 1, wydaje się, że …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.