Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Teraz, gdy odrzuciłem hipotezę zerową, co dalej?
Raz po raz odrzucałem lub nie odrzucałem hipotezy zerowej. W przypadku braku odrzucenia sprawy dochodzisz do wniosku, że nie ma wystarczających dowodów na odrzucenie, i „kontynuujesz” (tj. Albo gromadzisz więcej danych, kończę eksperyment itp.) Ale kiedy „odrzucasz” hipotezę zerową, dostarczając pewnych dowodów na alternatywną hipotezę, nie możesz tak naprawdę „udowodnić”, …

1
Czy analiza mocy a priori jest zasadniczo bezużyteczna?
W zeszłym tygodniu uczestniczyłem w spotkaniu Towarzystwa Osobowości i Psychologii Społecznej, gdzie widziałem przemówienie Uri Simonsohna z założeniem, że zastosowanie analizy mocy a priori w celu ustalenia wielkości próby było zasadniczo bezużyteczne, ponieważ jej wyniki są tak wrażliwe na założenia. Oczywiście, twierdzenie to jest sprzeczne z tym, czego nauczono mnie …

2
Konsekwencje modelowania niestacjonarnego procesu przy użyciu ARiMR?
Rozumiem, że powinniśmy używać ARIMA do modelowania niestacjonarnych szeregów czasowych. Ponadto wszystko, co czytam, mówi, że ARMA powinna być używana tylko do stacjonarnych szeregów czasowych. Próbuję zrozumieć, co dzieje się w praktyce, kiedy błędnie klasyfikujesz model i zakładasz, d = 0że szereg czasowy jest niestacjonarny? Na przykład: controlData <- arima.sim(list(order …

2
CHAID vs CRT (lub CART)
Korzystam z klasyfikacji drzewa decyzyjnego za pomocą SPSS na zestawie danych z około 20 predyktorami (kategorycznie z kilkoma kategoriami). CHAID (chi-kwadrat automatyczne wykrywanie interakcji) i CRT / CART (drzewa klasyfikacji i regresji) dają mi różne drzewa. Czy ktoś może wyjaśnić względne zalety CHAID vs CRT? Jakie są konsekwencje korzystania z …
23 spss  cart 

1
Statystyka walidacji krzyżowej (CV) i ogólne statystyki walidacji krzyżowej (GCV)
Znalazłem potencjalnie sprzeczne definicje dla statystyki walidacji krzyżowej (CV) i statystyki uogólnionej walidacji krzyżowej (GCV) związanej z modelem liniowym (z normalnym, homoscedastycznym wektorem błędu \ boldsymbol \ varepsilon ).εY=Xβ+εY=Xβ+εY = X\boldsymbol\beta + \boldsymbol\varepsilonεε\boldsymbol\varepsilon Z jednej strony Golub, Heath i Wahba definiują oszacowanie GCV λ^λ^\hat{\lambda} jako (s. 216) minimalizator V(λ)V(λ)V\left(\lambda\right) podany …

2
Stabilność tematu w modelach tematycznych
Pracuję nad projektem, w którym chcę wyodrębnić trochę informacji o zawartości serii esejów otwartych. W tym konkretnym projekcie 148 osób napisało eseje o hipotetycznej organizacji studenckiej w ramach większego eksperymentu. Chociaż w mojej dziedzinie (psychologia społeczna) typowym sposobem analizy tych danych byłoby ręczne kodowanie esejów, chciałbym to zrobić ilościowo, ponieważ …


4
Co jest nie tak z (niektórymi) pseudolosami?
Natknąłem się na badanie, w którym pacjenci w wieku powyżej 50 lat byli pseudolosowi losowo według roku urodzenia. Jeśli rok urodzenia był liczbą parzystą, zwykła opieka, jeśli liczba nieparzysta, interwencja. Łatwiej jest go wdrożyć, trudniej jest go obalić (łatwo sprawdzić, jakie leczenie powinien otrzymać pacjent), łatwo go zapamiętać (zadanie trwało …

3
Student t jako mieszanka gaussa
Używanie rozkład t-Studenta z stopni swobody, parametr położenia i parametr skali o gęstościl sk>0k>0k > 0lllsss Γ(k+12)Γ(k2kπs2−−−−√){1+k−1(x−ls)}−(k+1)/2,Γ(k+12)Γ(k2kπs2){1+k−1(x−ls)}−(k+1)/2,\frac{\Gamma \left(\frac{k+1}{2}\right)}{\Gamma\left(\frac{k}{2}\sqrt{k \pi s^2}\right)} \left\{ 1 + k^{-1}\left( \frac{x-l}{s}\right)\right\}^{-(k+1)/2}, jak pokazać, że rozkład Studenta można zapisać jako mieszaninę rozkładów Gaussa, pozwalając , i całkowanie gęstości celu uzyskania gęstości brzeżnej ? Jakie są parametry wynikowej …

2
Jak poradzić sobie z różnicą między rozkładem zestawu testowego i zestawu treningowego?
Myślę, że jednym z podstawowych założeń uczenia maszynowego lub szacowania parametrów jest to, że niewidoczne dane pochodzą z tego samego rozkładu, co zestaw szkoleniowy. Jednak w niektórych praktycznych przypadkach rozkład zestawu testowego będzie prawie różny od zestawu szkoleniowego. Powiedz o wielkoskalowym problemie wielu klasyfikacji, który próbuje sklasyfikować opisy produktów do …

2
Średnia batejskiego mrugnięcia przed
Chciałem zadać pytanie inspirowane doskonałą odpowiedzią na pytanie dotyczące intuicji w dystrybucji beta. Chciałem lepiej zrozumieć wyprowadzenie dla wcześniejszego rozkładu dla średniej mrugnięcia. Wygląda na to, że David wycofuje parametry ze średniej i zakresu. Zakładając, że średnia wynosi 0.270.270.27 a odchylenie standardowe wynosi , czy możesz wycofać i , rozwiązując …
23 bayesian  prior 

2
Wykres rozrzutu z nakładką konturową / cieplną
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Widziałem ten wykres w suplemencie do ostatniego artykułu i chciałbym móc go odtworzyć za pomocą R. Jest to wykres rozrzutu, ale aby naprawić nadpisywanie, istnieją …



2
Czy techniki uczenia maszynowego są „algorytmami aproksymacyjnymi”?
Niedawno pojawiło się pytanie typu ML dotyczące wymiany stosu cstheory, a ja opublikowałem odpowiedź zalecającą metodę Powella, pochodzenie gradientu, algorytmy genetyczne lub inne „algorytmy aproksymacyjne”. W komentarzu ktoś powiedział mi, że te metody to „heurystyka”, a nie „algorytmy aproksymacyjne” i często nie zbliżały się do teoretycznego optimum (ponieważ „często utknęły …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.