Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Zapobieganie przeuczeniu LSTM w małym zestawie danych
Modeluję 15000 tweetów do prognozowania nastrojów za pomocą jednowarstwowej LSTM ze 128 ukrytymi jednostkami za pomocą reprezentacji podobnej do word2vec o 80 wymiarach. Dostaję dokładność zniżania (38% losowo = 20%) po 1 epoce. Więcej treningów powoduje, że dokładność walidacji zaczyna spadać, gdy dokładność treningu zaczyna się wspinać - wyraźny znak …


2
Test t niezależnych próbek: Czy dane naprawdę muszą być normalnie dystrybuowane dla dużych próbek?
Powiedzmy, że chcę przetestować, czy dwie niezależne próbki mają różne środki. Wiem, że podstawowy rozkład nie jest normalny . Jeśli dobrze rozumiem, moja statystyka testowa jest średnią , a dla wystarczająco dużych próbek, średnia powinna się rozkładać normalnie, nawet jeśli próbki nie są. Więc parametryczny test istotności powinien być w …

2
Jakie są znane, istniejące praktyczne zastosowania teorii chaosu w eksploracji danych?
W ciągu ostatnich kilku lat od czasu do czasu czytając niektóre prace rynku masowego dotyczące teorii chaosu, zacząłem się zastanawiać, w jaki sposób można zastosować różne aspekty jej eksploracji danych i powiązanych dziedzin, takich jak sieci neuronowe, rozpoznawanie wzorców, zarządzanie niepewnością itp. Do tej pory natknąłem się na tak mało …

3
W jaki sposób można wykorzystać modele uczenia maszynowego (GBM, NN itp.) Do analizy przeżycia?
Wiem, że tradycyjne modele statystyczne, takie jak regresja Cox Proportional Hazards i niektóre modele Kaplana-Meiera, można wykorzystać do przewidywania dni do następnego wystąpienia zdarzenia, np. Niepowodzenia itp., Czyli analizy przeżycia pytania W jaki sposób można zastosować wersję regresji modeli uczenia maszynowego, takich jak GBM, sieci neuronowe itp., Aby przewidzieć dni …

3
Jakie były główne dane statystyczne Ronalda Fishera?
Richard Dawkins opisał Ronalda Fishera jako „ojca nowoczesnej statystyki i eksperymentalnego projektu”, linii cytowanej w biografii Fishera w Wikipedii . A także Anders Hald nazwał go „geniuszem, który prawie samodzielnie stworzył podstawy współczesnej nauki statystycznej” w swojej książce A History of Mathematical Statistics . Zastanawiam się tylko, co dokładnie zrobił, …

1
Oceń Random Forest: OOB vs CV
Kiedy oceniamy jakość Losowego Lasu, na przykład za pomocą AUC, czy bardziej odpowiednie jest obliczenie tych ilości na podstawie próbek po wyjęciu z torby lub na podstawie zestawu krzyżowego sprawdzania poprawności? Słyszałem, że obliczenie go na próbkach OOB daje bardziej pesymistyczną ocenę, ale nie rozumiem dlaczego.

2
Wyjaśnienie laika dotyczące cenzury w analizie przeżycia
Czytałem o tym, czym jest cenzura i jak należy ją uwzględnić w analizie przeżycia, ale chciałbym usłyszeć jej mniej matematyczną definicję i bardziej intuicyjną definicję (zdjęcia byłyby świetne!). Czy ktoś może mi wyjaśnić 1) cenzurę i 2) w jaki sposób wpływa to na krzywe Kaplana-Meiera i regresję Coxa?


4
Wykresy małych próbek
Mam mały zestaw danych 14 osobnych razy, aby wykonać zadanie. Mam jednak trudności ze znalezieniem odpowiedniego wykresu, którego można by użyć do wykreślenia danych. Gdyby próbka była większa, użyłbym wykresu pudełkowego lub histogramu, ale nie jestem pewien, czy stosowne byłoby użycie w tym przypadku, gdy próbka jest tak mała. Aktualizacja: …

1
Rozkład wariancji odchylenia
W sekcji 3.2 Rozpoznawania wzorców i uczenia maszynowego Bishopa omawia dekompozycję wariancji odchylenia, stwierdzając, że dla funkcji straty kwadratowej oczekiwana strata może zostać rozłożona na wartość kwadratową błędu (która opisuje, jak daleko średnie prognozy są od prawdziwej model), termin wariancji (który opisuje rozkład prognoz wokół średniej) i termin szumu (który …


1
Twierdzenie Bayesa z wieloma warunkami
Nie rozumiem, jak wyprowadzono to równanie. P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} To równanie pochodzi z pracy „Trial by Probability”, gdzie przypadek OJ Simpsona podano jako przykładowy problem. Oskarżony jest sądzony za podwójne zabójstwo i przedstawiono mu dwa dowody. M1M1M_{1} to zdarzenie, w którym krew pozwanego odpowiada kropli krwi znalezionej na …

1
Czy ANOVA opiera się na metodzie chwil, a nie na maksymalnym prawdopodobieństwie?
Widzę w różnych miejscach wspomniane, że ANOVA dokonuje oszacowania za pomocą metody momentów. Twierdzenie to wprawia mnie w zakłopotanie, ponieważ chociaż nie znam metody momentów, rozumiem, że jest to coś innego niż metoda największego prawdopodobieństwa i nie jest ona równoważna; z drugiej strony, ANOVA może być postrzegana jako regresja liniowa …

1
Dlaczego Daniel Wilks (2011) twierdzi, że regresja głównego składnika „będzie tendencyjna”?
W Metodach statystycznych w naukach atmosferycznych Daniel Wilks zauważa, że ​​wielokrotna regresja liniowa może prowadzić do problemów, jeśli między predyktorami występują bardzo silne wzajemne korelacje (wydanie trzecie, strona 559-560): Patologia, która może wystąpić w wielokrotnej regresji liniowej, polega na tym, że zestaw zmiennych predykcyjnych o silnych wzajemnych korelacjach może skutkować …
13 regression  pca  bias 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.