Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Testowanie dużego zestawu danych pod kątem normalności - jak i czy jest wiarygodny?
Badam część mojego zestawu danych zawierającą 46840 podwójnych wartości od 1 do 1690 pogrupowanych w dwie grupy. Aby przeanalizować różnice między tymi grupami, zacząłem od zbadania rozkładu wartości w celu wybrania właściwego testu. Po poradniku na temat testowania normalności zrobiłem qqplot, histogram i boxplot. To nie wydaje się być normalnym …

2
Jak przeprowadzić walidację krzyżową dla PCA w celu ustalenia liczby głównych składników?
Próbuję napisać własną funkcję do analizy głównych składników, PCA (oczywiście jest już dużo napisanych, ale jestem zainteresowany tylko implementacją różnych rzeczy). Głównym problemem, jaki napotkałem, jest krok weryfikacji krzyżowej i obliczanie przewidywanej sumy kwadratów (PRASA). Nie ma znaczenia, z której walidacji krzyżowej korzystam, chodzi głównie o teorię, ale zastanów się …

3
Opracowanie odpowiedniego modelu szeregów czasowych do przewidywania sprzedaży na podstawie danych z ostatniego miesiąca
Od dwóch lat prowadzę działalność online, więc mam miesięczne dane dotyczące sprzedaży od około dwóch lat. Na mój biznes na każdy miesiąc z pewnością ma wpływ sezonowa huśtawka (działa lepiej w Boże Narodzenie itp.) I prawdopodobnie kilka innych czynników, których nie jestem świadomy. W celu lepszego przewidywania przyszłej sprzedaży oraz …


2
Metody MCMC - wypalanie próbek?
W metodach MCMC wciąż czytam o burn-inczasie lub liczbie próbek "burn". Co to dokładnie jest i dlaczego jest potrzebne? Aktualizacja: Czy po stabilizacji MCMC pozostaje stabilny? W jaki sposób pojęcie burn-inczasu jest powiązane z czasem mieszania?
12 sampling  mcmc 

4
Wykonywanie PCA tylko z matrycą odległości
Chcę utworzyć klaster ogromnego zestawu danych, dla którego mam tylko pary odległości. Wdrożyłem algorytm k-medoidów, ale jego uruchomienie trwa zbyt długo, dlatego chciałbym zacząć od zmniejszenia wymiaru mojego problemu przez zastosowanie PCA. Jednak jedynym sposobem, w jaki znam tę metodę, jest zastosowanie macierzy kowariancji, której nie mam w swojej sytuacji. …


1
Intuicyjne przykłady ważnego próbkowania
Moje wykształcenie to informatyka. Jestem całkiem nowy w metodach próbkowania Monte Carlo i chociaż rozumiem matematykę, trudno mi znaleźć intuicyjne przykłady ważnego próbkowania. Dokładniej, czy ktoś mógłby podać przykłady: oryginalny rozkład, z którego nie można próbkować, ale można go oszacować rozkład ważności, z którego można pobrać próbki i odpowiedni dla …

2
Najlepsze praktyki tworzenia „uporządkowanych danych”
Hadley Wickham napisał w zeszłym roku w JSS gwiezdny artykuł zatytułowany „Tidy Data” ( link ) na temat manipulacji danymi i doprowadzenia danych do stanu „optymalnego” w celu przeprowadzenia analizy. Zastanawiałem się jednak, jakie były najlepsze praktyki w zakresie prezentacji danych tabelarycznych w środowisku pracy? Powiedzmy, że twój współpracownik prosi …
12 dataset  tables 

1
Dokładny test Fishera i rozkład hipergeometryczny
Chciałem lepiej zrozumieć dokładny test Fishera, więc wymyśliłem następujący przykład zabawki, w którym f i m odpowiada płci męskiej i żeńskiej, a n i y odpowiada takiemu „zużyciu sody”: > soda_gender f m n 0 5 y 5 0 Oczywiście jest to drastyczne uproszczenie, ale nie chciałem, aby kontekst przeszkadzał. …

2
Dlaczego twierdzenie Thomasa Bayesa było tak trudne?
To jest raczej pytanie o historię nauki, ale mam nadzieję, że jest to temat na ten temat. Czytałem, że Thomasowi Bayesowi udało się odkryć twierdzenie Bayesa dotyczące szczególnego przypadku przeora mundurowego, a nawet wtedy najwyraźniej miał z tym problem. Biorąc pod uwagę, jak banalne jest ogólne twierdzenie Bayesa w nowoczesnym …

1
Czy konieczne jest wstępne przetwarzanie przed prognozowaniem przy użyciu FinalModel z RandomForest z pakietem Caret?
Używam pakietu karetki do trenowania obiektu randomForest z 10x10CV. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) Następnie testuję randomForest na testSet (nowe dane) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) Macierz pomieszania pokazuje mi, że model nie jest taki zły. confusionMatrix(data=RF.testSet$Prediction, RF.testSet$Defect) Reference …

3
Normalne przybliżenie do rozkładu Poissona
Tutaj w Wikipedii jest napisane: Dla wystarczająco dużych wartości λλλ (powiedzmy λ>1000λ>1000λ>1000 ) rozkład normalny ze średnią λλλ i wariancją λλλ (odchylenie standardowe λ−−√λ\sqrt{\lambda} ) stanowi doskonałe przybliżenie do rozkładu Poissona. Jeżeli λλλ jest większe niż około 10, to rozkład normalny jest dobrym przybliżeniem, jeśli przeprowadzona jest odpowiednia korekta ciągłości, …

3
Kiedy należy wybrać modele poprzez zminimalizowanie AIC?
Jest dobrze ustalone, przynajmniej wśród statystyków pewnego wyższego kalibru, że modele z wartościami statystyki AIC mieszczącymi się w pewnym progu wartości minimalnej należy uznać za odpowiednie jako model minimalizujący statystyki AIC. Na przykład w [1, s. 221] znajdujemy Wtedy modele z małym GCV lub AIC będą uważane za najlepsze. Oczywiście …

2
Intuicja stojąca za nazwami „częściowe” i „marginalne” korelacje
Czy ktoś ma pojęcie o tym, dlaczego korelacja warunkowa między 2 zmiennymi jest nazywana korelacją „częściową”, a prosta korelacja między nimi (a więc gdy nie jest uwarunkowana żadną inną zmienną) jest nazywana korelacją „marginalną”? Jaka jest intuicja za słowami „częściowy” i „marginalny”? Co robią z „częściami” lub „marginesami”? Dobrze byłoby …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.