Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Nowoczesne przypadki użycia ograniczonych maszyn Boltzmanna (KMS)?
Tło: Wydaje się, że wiele współczesnych badań w ciągu ostatnich 4 lat (post Alexxnet ) zrezygnowało z generatywnego wstępnego szkolenia sieci neuronowych w celu osiągnięcia najnowszych wyników klasyfikacji. Na przykład, najlepsze wyniki dla mnistera tutaj obejmują tylko 2 artykuły z 50 najlepszych, które wydają się używać modeli generatywnych, z których …

2
Różnica błędów resztkowych standardowych między optym a glm
Staram się odtworzyć z optimwynikami prostej regresji liniowej zaopatrzonej glmlub nawet nlsfunkcje R. Oszacowania parametrów są takie same, ale oszacowanie wariancji rezydualnej i błędy standardowe innych parametrów nie są takie same, szczególnie gdy wielkość próby jest niska. Przypuszczam, że jest to spowodowane różnicami w sposobie obliczania resztkowego błędu standardowego między …

3
Dlatego nie dziełem CLT dla
Wiemy zatem, że suma nnn poissonów o parametrze λλ\lambda jest sama w sobie poissonem o nλnλn\lambda . Tak więc teoretycznie może przyjąć x∼poisson(λ=1)x∼poisson(λ=1)x \sim poisson(\lambda = 1) i powiedzieć, że jest w rzeczywistości ∑n1xi∼poisson(λ=1)∑1nxi∼poisson(λ=1)\sum_1^n x_i \sim poisson(\lambda = 1) , gdzie każdy z xixix_i jest: xi∼poisson(λ=1/n)xi∼poisson(λ=1/n)x_i \sim poisson(\lambda = 1/n) …

2
Dlaczego test F jest tak wrażliwy na założenie normalności?
Dlaczego test F dla różnicy wariancji jest tak wrażliwy na założenie rozkładu normalnego, nawet dla dużego ?NNN Próbowałem przeszukać sieć i odwiedziłem bibliotekę, ale żadna z nich nie dała dobrych odpowiedzi. Mówi, że test jest bardzo wrażliwy na naruszenie założenia normalnej dystrybucji, ale nie rozumiem dlaczego. Czy ktoś ma na …

3
Intuicja za stopą hazardu
Jestem zdezorientowany co do równania, które służy jako definicja współczynnika ryzyka. Rozumiem, jaki jest współczynnik ryzyka, ale po prostu nie widzę, jak równanie wyraża tę intuicję. Jeśli jest zmienną losową, która reprezentuje moment śmierci kogoś w przedziale czasu . Zatem współczynnik ryzyka wynosi:[ 0 , T ]xxx[0,T][0,T][0,T] h(x)=f(x)1−F(x)h(x)=f(x)1−F(x)h(x)=\frac{f(x)}{1-F(x)} Gdzie oznacza …

2
Dynamiczny widok centralnego twierdzenia o granicy?
(Pierwotnie opublikowane na MSE.) Widziałem wiele heurystycznych dyskusji na temat klasycznego centralnego twierdzenia granicznego mówiących o rozkładzie normalnym (lub dowolnym rozkładzie stabilnym) jako „atraktorze” w przestrzeni gęstości prawdopodobieństwa. Weźmy na przykład następujące zdania na początku traktowania Wikipedii : W bardziej ogólnym zastosowaniu, centralnym twierdzeniem granicznym jest dowolny zestaw twierdzeń o …

5
Dodano szóstą opcję odpowiedzi („nie wiem”) do 5-punktowej skali Likerta. Czy dane zostały utracone?
Potrzebuję trochę pomocy w odzyskaniu danych z kwestionariusza. Jeden z moich kolegów zastosował kwestionariusz, ale nieumyślnie, zamiast skorzystać z oryginalnej 5-punktowej skali Likerta (zdecydowanie nie zgadzam się zdecydowanie), wstawił szóstą odpowiedź do skali. I, co gorsza, szósta opcja to… „Nie wiem”. Problemem jest duża część respondentów, którzy w pewnym momencie …


2
Stan wiedzy ogólnej w oparciu o dane z '69
Próbuję zrozumieć kontekst słynnej książki Minsky and Papert „Perceptrons” z 1969 roku, tak krytycznej dla sieci neuronowych. O ile mi wiadomo, nie było jeszcze innych ogólnych algorytmów uczenia nadzorowanego, z wyjątkiem perceptronu: drzewa decyzyjne zaczęły być naprawdę przydatne dopiero pod koniec lat 70., losowe lasy i maszyny SVM to lata …

1
Caret - Wielokrotna walidacja krzyżowa K-zagnieżdżenia w porównaniu z zagnieżdżoną walidacją krzyżową K-krotną, powtórzona n-razy
Daszek pakiet jest genialna biblioteka R do budowy wielu modeli uczenia maszynowego i ma kilka funkcji dla budynku modelu i oceny. Do dostrajania parametrów i treningu modeli pakiet Caret oferuje „repeatcv” jako jedną z metod. Dobrą praktyką jest dostrajanie parametrów za pomocą zagnieżdżonej krzyżowej weryfikacji K-fold, która działa w następujący …


1
Czy do oceny modeli predykcyjnych należy stosować wielokrotną walidację krzyżową?
Zetknąłem się z tym artykułem z 2012 r. Autorstwa Gitte Vanwinckelen i Hendrika Blockeela, który kwestionuje użyteczność wielokrotnej walidacji krzyżowej, która stała się popularną techniką zmniejszania wariancji walidacji krzyżowej. Autorzy wykazali, że chociaż wielokrotne sprawdzanie poprawności krzyżowej zmniejsza wariancję prognoz modelu, ponieważ próbka tego samego zestawu danych jest ponownie próbkowana, …


2
Dlaczego regresja kalenicowa nie zmniejszy niektórych współczynników do zera jak lasso?
Podczas wyjaśniania regresji LASSO często stosuje się schemat rombu i koła. Mówi się, że ponieważ kształt ograniczenia w LASSO jest diamentem, otrzymane rozwiązanie najmniejszych kwadratów może dotykać narożnika diamentu, powodując skurcz jakiejś zmiennej. Jednak w regresji grzbietu, ponieważ jest to okrąg, często nie dotyka osi. Nie mogłem zrozumieć, dlaczego nie …

5
Jak być na bieżąco z najnowszymi badaniami?
Po przeczytaniu tego pytania dotyczącego arXiv i znalezieniu linku do GitXiv, o którym wcześniej nie wiedziałem, zastanawiałem się, z jakich stron / zasobów korzystają ludzie, aby być na bieżąco z najnowszymi badaniami w swojej dziedzinie?
16 academia 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.