Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



3
Właściwy sposób radzenia sobie z 3-poziomową tabelą awaryjną
Mam trzypoziomową tabelę zdarzeń awaryjnych, z danymi zliczeń dla kilku gatunków, rośliny żywicielskiej, z której zostały zebrane, oraz tego, czy zbiór ten miał miejsce w deszczowy dzień (to naprawdę ma znaczenie!). Przy użyciu R fałszywe dane mogą wyglądać mniej więcej tak: count <- rpois(8, 10) species <- rep(c("a", "b"), 4) …

3
Przejście od używania oprogramowania statystycznego do zrozumienia równań matematycznych?
Kontekst: Jestem doktorantem psychologii. Podobnie jak wielu doktorantów psychologii, wiem, jak wykonywać różne analizy statystyczne za pomocą oprogramowania statystycznego, aż po takie techniki, jak PCA, drzewa klasyfikacyjne i analiza skupień. Ale to nie jest naprawdę satysfakcjonujące, ponieważ chociaż potrafię wyjaśnić, dlaczego przeprowadziłem analizę i co oznaczają wskaźniki, nie potrafię wyjaśnić, …

2
Jak szybko próbkować X, jeśli exp (X) ~ Gamma?
Mam prosty problem z próbkowaniem, w którym moja wewnętrzna pętla wygląda następująco: v = sample_gamma(k, a) gdzie sample_gammapróbki z rozkładu gamma tworzą próbkę Dirichleta. Działa dobrze, ale w przypadku niektórych wartości k / a niektóre z niższych obliczeń są niedopełnione. Dostosowałem go do używania zmiennych przestrzeni dziennika: v = log(sample_gamma(k, …



1
Ogólny błąd typu I podczas wielokrotnego testowania gromadzących dane
Mam pytanie dotyczące grupowych metod sekwencyjnych . Według Wikipedii: W randomizowanym badaniu z dwiema grupami leczenia stosuje się klasyczne sekwencyjne badanie grupowe w następujący sposób: Jeśli dostępnych jest n osobników w każdej grupie, przeprowadzana jest analiza tymczasowa na 2 osobach. Analizę statystyczną przeprowadza się w celu porównania dwóch grup, a …

1
Online, skalowalne metody statystyczne
Inspiracją do tego była wydajna regresja liniowa online , która była dla mnie bardzo interesująca. Czy są jakieś teksty lub zasoby poświęcone obliczeniom statystycznym na dużą skalę, w których obliczenia z zestawami danych są zbyt duże, aby zmieściły się w pamięci głównej, a być może zbyt zróżnicowane, aby skutecznie podpróbować. …


2
GLM po wyborze lub legalizacji modelu
Chciałbym zadać to pytanie w dwóch częściach. Oba dotyczą uogólnionego modelu liniowego, ale pierwszy dotyczy wyboru modelu, a drugi dotyczy regularyzacji. Tło: Używam modeli GLM (liniowych, logistycznych, regresji gamma) zarówno do prognozowania, jak i do opisu. Kiedy odnoszę się do „ normalnych rzeczy, które robi się z regresją ”, mam …

5
Najlepsza miara odległości do użycia
Kontekst Mam dwa zestawy danych, które chcę porównać. Każdy element danych w obu zestawach to wektor zawierający 22 kąty (wszystkie między i ). Kąty odnoszą się do danej konfiguracji ułożenia człowieka, więc ułożenie jest określone przez 22 kąty stawów.π−π−π-\piππ\pi Ostatecznie staram się ustalić „bliskość” dwóch zestawów danych. Tak więc dla …

2
Skąd mam wiedzieć, którą metodę szacowania parametrów wybrać?
Istnieje wiele metod szacowania parametrów. MLE, UMVUE, MoM, teoretyka decyzyjna i inne wydają się mieć dość logiczne uzasadnienie, dlaczego są przydatne do szacowania parametrów. Czy jakakolwiek metoda jest lepsza od innych, czy może to tylko kwestia tego, jak zdefiniujemy, czym jest „najlepiej dopasowany” estymator (podobny do tego, w jaki sposób …

4
Analiza danych wiatru za pomocą R.
Cześć, analizuję dane dotyczące wiatru w celu oszacowania energii z turbiny wiatrowej. Wziąłem 10 lat danych wiatrowych i wykreśliłem histogram; moim drugim etapem było dopasowanie rozkładu Weibulla do danych. Użyłem R z pakietem lmomdo obliczenia kształtu i skali Weibula. Użyłem tego kodu: >library(lmom) wind.moments<-samlmu(as.numeric(pp$WS)) moments<-pelwei(wind.moments) x.wei<-rweibull(n=length(pp$WS), shape=moments["delta"], scale=moments["beta"]) hist(as.numeric(pp$WS), freq=FALSE) …
12 r  distributions 

4
Konfiguracja Sweave, R, Latex, Eclipse StatET [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 3 lata temu . Kilka dni temu widziałem post, jak skonfigurować SweaveR, który pozwoliłby użytkownikowi na bezpośrednie eksportowanie rzeczy takich jak tabele, wykresy itp. Do …
12 r 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.