Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Naciśnij i uruchom MCMC
Próbuję wdrożyć algorytm MCMC, ale mam trochę problemów ze zrozumieniem, jak sobie z tym poradzić. Ogólna idea jest następująca: Aby wygenerować skok propozycji w MH, my: Wygeneruj kierunek z rozkładu na powierzchni kuli jednostkowej OdddOO\mathcal{O} Wygeneruj podpisaną odległość wzdłuż ograniczonej przestrzeni.λλ\lambda Nie mam jednak pojęcia, jak powinienem zaimplementować to w …
16 r  bayesian  mcmc 

1
Regresja logistyczna - obawy / pułapki związane z wielokoliniowością
Czy w logistycznej regresji trzeba być tak samo zaniepokojonym wielokoliniowością, jak w przypadku regresji OLS? Na przykład, w przypadku regresji logistycznej, w której występuje wielokoliniowość, czy trzeba być ostrożnym (podobnie jak w przypadku regresji OLS) przy wyciąganiu wniosków ze współczynników Beta? W przypadku regresji OLS jedną „poprawką” wysokiej wielokoliniowości jest …



3
Interpretowanie wyników PCA
Czy ktoś może mi pomóc w interpretacji wyników PCA? Moje dane pochodzą z kwestionariusza dotyczącego stosunku do niedźwiedzi. Zgodnie z ładunkami zinterpretowałem jeden z moich głównych elementów jako „strach przed niedźwiedziami”. Czy wyniki tego głównego składnika byłyby powiązane ze sposobem, w jaki każdy respondent ocenia ten główny składnik (czy ocenia …
16 pca 


7
Jaka jest definicja „najlepszego” w znaczeniu „najlepszego dopasowania” i weryfikacji krzyżowej?
Jeśli dopasujesz funkcję nieliniową do zestawu punktów (zakładając, że dla każdej odciętej jest tylko jedna rzędna), wynikiem może być: bardzo złożona funkcja z małymi resztkami bardzo prosta funkcja z dużymi resztkami Krzyżowa walidacja jest powszechnie stosowana w celu znalezienia „najlepszego” kompromisu między tymi dwoma skrajnościami. Ale co znaczy „najlepszy”? Czy …

5
Sprawdzanie założeń ANOVA
Kilka miesięcy temu opublikowałem pytanie dotyczące testów homoscedastyczności w R na SO, a Ian Fellows odpowiedział na to (sparafrazuję jego odpowiedź bardzo luźno): Testy homoscedastyczności nie są dobrym narzędziem do testowania dopasowania modelu. Przy małych próbkach nie masz wystarczającej mocy, aby wykryć odstępstwa od homoscedastyczności, podczas gdy przy dużych próbkach …

5
Algorytm online dla średniego bezwzględnego odchylenia i dużego zestawu danych
Mam mały problem, który doprowadza mnie do szału. Muszę napisać procedurę dla procesu akwizycji online wielowymiarowych szeregów czasowych. Za każdym razem (na przykład 1 sekundę) otrzymuję nową próbkę, która jest w zasadzie wektorem zmiennoprzecinkowym o rozmiarze N. Operacja, którą muszę wykonać, jest nieco trudna: Dla każdej nowej próbki obliczam wartości …

3
A nieparametryczna Anova wielokrotnych pomiarów wielokrotnego działania w R?
Poniższe pytanie jest dla mnie jednym z tych świętych Graali. Mam nadzieję, że ktoś może udzielić dobrej porady. Chciałbym wykonać nieparametryczne powtarzane pomiary wielokierunkowe anova przy użyciu R. Od pewnego czasu szukam i czytam online i do tej pory udało mi się znaleźć rozwiązania tylko w niektórych przypadkach: test Friedmana …

5
Porównanie wariancji sparowanych obserwacji
Mam sparowanych obserwacji ( , ) zaczerpniętych ze wspólnego nieznanego rozkładu, który ma skończony pierwszy i drugi moment i jest symetryczny wokół średniej.NNNXiXiX_iYiYiY_i Niech odchylenie standardowe (bezwarunkowe dla ), a to samo dla Y. Chciałbym przetestować hipotezę σXσX\sigma_XXXXYYYσYσY\sigma_Y H0H0H_0 :σX=σYσX=σY\sigma_X = \sigma_Y H1H1H_1 :σX≠σYσX≠σY\sigma_X \neq \sigma_Y Czy ktoś wie o …

1
EM, czy istnieje intuicyjne wyjaśnienie?
Dla niewtajemniczonych procedura EM wydaje się mniej więcej czarną magią. Oszacuj parametry HMM (na przykład) przy użyciu nadzorowanych danych. Następnie zdekoduj nieoznaczone dane, używając „wstecz” do „zliczania” zdarzeń tak, jakby dane były oznaczone mniej więcej. Dlaczego to sprawia, że ​​model jest lepszy? Wiem coś o matematyce, ale wciąż pragnę jakiegoś …

4
Kompleksowy przegląd funkcji strat?
Próbuję uzyskać globalną perspektywę na niektóre z podstawowych pomysłów w uczeniu maszynowym i zastanawiałem się, czy istnieje kompleksowe podejście do różnych pojęć utraty (kwadrat, log, zawias, proxy itp.). Zastanawiałem się nad bardziej kompleksową, formalną prezentacją doskonałego postu Johna Langforda na temat Lant Function Semantics .


5
Interpretacja nieistotnych wyników jako „trendów”
Niedawno dwaj różni współpracownicy użyli pewnego rodzaju argumentu na temat różnic między warunkami, które wydają mi się nieprawidłowe. Obaj współpracownicy używają statystyk, ale nie są statystykami. Jestem nowicjuszem w statystyce. W obu przypadkach argumentowałem, że ponieważ nie było znaczącej różnicy między dwoma warunkami w eksperymencie, błędne było ogólne twierdzenie o …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.