Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


4
Jaki problem rozwiązuje oversampling, undersampling i SMOTE?
W ostatnim dobrze odebranym pytaniu Tim pyta, kiedy niezrównoważone dane naprawdę stanowią problem w uczeniu maszynowym ? Przesłanka tego pytania polega na tym, że istnieje wiele literatury dotyczącej uczenia maszynowego, która omawia równowagę klas i problem niezrównoważonych klas . Chodzi o to, że zestawy danych z nierównowagą między klasą dodatnią …

1
Co to są wariacyjne autoencodery i do jakich zadań uczenia się są wykorzystywane?
Zgodnie z tą i tą odpowiedzią autoencodery wydają się być techniką wykorzystującą sieci neuronowe do redukcji wymiarów. Chciałbym dodatkowo wiedzieć, czym jest wariacyjny autoencoder (jego główne różnice / zalety w stosunku do „tradycyjnych” autoencoderów), a także jakie są główne zadania edukacyjne, do których są wykorzystywane te algorytmy.

2
Regresja kwantowa: funkcja straty
Próbuję zrozumieć regresję kwantową, ale jedną rzeczą, która sprawia, że ​​cierpię, jest wybór funkcji straty. ρτ(u)=u(τ−1{u&lt;0})ρτ(u)=u(τ−1{u&lt;0})\rho_\tau(u) = u(\tau-1_{\{u<0\}}) Wiem, że minimalne oczekiwanie na jest równe kwantile , ale jaki jest intuicyjny powód, aby zacząć od tej funkcji? Nie widzę związku między minimalizowaniem tej funkcji a kwantylem. Czy ktoś może mi …

1
Jak ważny jest empiryczny Bayes?
Właśnie skończyłem czytać świetną książkę Wprowadzenie do Empirical Bayes . Myślałem, że książka jest świetna, ale budowanie priorów z danych wydawało się złe. Zostałem przeszkolony, że opracowujesz plan analizy, następnie gromadzisz dane, a następnie testujesz hipotezę, którą wcześniej określiłeś w swoim planie analizy. Kiedy przeprowadzasz analizę danych, które już zostały …

2
Czy modele mieszane są przydatne jako modele predykcyjne?
Jestem trochę zdezorientowany co do zalet mieszanych modeli w zakresie modelowania predykcyjnego. Ponieważ modele predykcyjne mają zwykle przewidywać wartości wcześniej nieznanych obserwacji, wydaje mi się oczywiste, że jedynym sposobem, w jaki model mieszany może być użyteczny, jest jego zdolność do przewidywania na poziomie populacji (to znaczy bez dodawania żadnych efektów …

2
Ciągłe uogólnianie ujemnego rozkładu dwumianowego
Ujemny rozkład dwumianowy (NB) jest zdefiniowany na nieujemnych liczbach całkowitych i ma funkcję masy prawdopodobieństwa fa( k ; r , p ) = ( k + r - 1k) pk( 1 - p )r.f(k;r,p)=(k+r−1k)pk(1−p)r.f(k;r,p)={\binom {k+r-1}{k}}p^{k}(1-p)^{r}.Czy ma sens rozważenie ciągłego rozkładu na liczbach rzeczywistych nieujemnych zdefiniowanych przez tę samą formułę (zastępując …

3
Historia wcześniejszej nieinformacyjnej teorii
Piszę krótki esej teoretyczny na kurs statystyki bayesowskiej (w mgr ekonomii) na temat nieinformacyjnych priorów i staram się zrozumieć, jakie są etapy rozwoju tej teorii. Do tej pory moja oś czasu składa się z trzech głównych kroków: zasada obojętności Laplace'a (1812), priory non-invariant (Jeffreys (1946)), odniesienie Bernardo przed (1979). Z …

2
Kto wynalazł drzewo decyzyjne?
Próbuję ustalić, kto wynalazł strukturę danych i algorytm drzewa decyzyjnego. We wpisie w Wikipedii dotyczącym uczenia się drzewa decyzyjnego jest twierdzenie, że „ID3 i CART zostały wynalezione niezależnie mniej więcej w tym samym czasie (między 1970 a 1980)”. ID3 został zaprezentowany później w: Quinlan, JR 1986. Indukcja drzew decyzyjnych. Mach. …
24 cart  history 


3
Jaki jest powód, dla którego Adam Optimizer jest uważany za odporny na wartość swoich hiper parametrów?
Czytałem o optymalizatorze Adama do głębokiego uczenia się i natknąłem się na następujące zdanie w nowej książce Deep Learning autorstwa Bengio, Goodfellow i Courville: Adam jest ogólnie uważany za dość odpornego na wybór hiper parametrów, chociaż szybkość uczenia się czasami trzeba zmienić w stosunku do sugerowanego domyślnego. jeśli to prawda, …

3
Co można wnioskować na temat danych, gdy średnia arytmetyczna jest bardzo zbliżona do średniej geometrycznej?
Czy jest coś istotnego w średniej geometrycznej i średniej arytmetycznej, które są bardzo blisko siebie, powiedzmy ~ 0,1%? Jakie są domysły na temat takiego zbioru danych? Pracowałem nad analizą zestawu danych i zauważam, że jak na ironię wartości są bardzo, bardzo bliskie. Nie do końca, ale blisko. Szybka kontrola rozsądności …

3
Dlaczego od samego początku nie stosuje się wielu poprawek hipotez we wszystkich eksperymentach?
Wiemy, że musimy zastosować korekty podobne do Benjaminiego Hochberga do testowania wielu hipotez w eksperymentach opartych na jednym zestawie danych, w celu kontroli częstotliwości fałszywych odkryć, w przeciwnym razie wszystkie eksperymenty, które dadzą pozytywny wynik, mogą być fałszywe. Ale dlaczego nie stosujemy tej samej zasady do wszystkich eksperymentów od samego …

7
Zalecenia dotyczące nietechnicznych, ale głębokich artykułów w statystyce
Inspiracja do tego pytania pochodzi z dobrze znanego artykułu Leo-Breimana znanego z artykułu Modelowanie statystyczne: Dwie kultury (dostępny otwarty dostęp). Autor porównuje to, co widzi jako dwa odmienne podejścia do analizy danych, dotykające kluczowych pomysłów w klasycznej statystyce i uczeniu maszynowym. Jednak artykuł jest zrozumiały dla szerokiego grona odbiorców - …
24 references 

4
ANOVA a wielokrotna regresja liniowa? Dlaczego ANOVA jest tak często stosowana w badaniach eksperymentalnych?
ANOVA a wielokrotna regresja liniowa? Rozumiem, że obie te metody wydają się wykorzystywać ten sam model statystyczny. Jednak w jakich okolicznościach powinienem skorzystać z której metody? Jakie są zalety i wady tych metod w porównaniu? Dlaczego ANOVA jest tak często stosowana w badaniach eksperymentalnych i rzadko znajduję badanie regresji?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.