Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Programowanie kwadratowe i Lasso
Próbuję wykonać regresję lasso, która ma następującą postać: Minimalizuj w( Y - X w ) ′ ( Y - X w ) + λwww( Y- Xw )′( Y- Xw ) + λ| w |1(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 Biorąc pod uwagę , doradzono mi, aby znaleźć optymalne …

1
James-Stein Estimator z nierównymi wariancjami
Każde stwierdzenie, które znajduję w estymatorze Jamesa-Steina zakłada, że ​​oszacowane zmienne losowe mają tę samą wariancję (i jednostkę). Ale wszystkie te przykłady wspominają również, że estymator JS może być używany do szacowania ilości, nie mając ze sobą nic wspólnego. Przykład wikipedia jest prędkością światła, spożycie herbaty w Tajwanie i wagi …


1
Modelowanie bayesowskie przy użyciu wielowymiarowej normalnej z kowariantem
Załóżmy, że masz zmienną objaśniającą gdzie oznacza daną współrzędną. Masz również zmienną odpowiedzi . Teraz możemy połączyć obie zmienne jako:X=(X(s1),…,X(sn))X=(X(s1),…,X(sn)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right)sssY=(Y(s1),…,Y(sn))Y=(Y(s1),…,Y(sn)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) W(s)=(X(s)Y(s))∼N(μ(s),T)W(s)=(X(s)Y(s))∼N(μ(s),T){\bf{W}}({\bf{s}}) = \left( \begin{array}{ccc}X(s) \\ Y(s) \end{array} \right) \sim N(\boldsymbol{\mu}(s), T) W takim przypadku wybieramy po prostu μ(s)=(μ1μ2)Tμ(s)=(μ1μ2)T\boldsymbol{\mu}(s) = \left( \mu_{1} \; \; \mu_{2}\right)^{T} a TTT …

2
Co to jest lme4 :: lmer odpowiednik ANOVA z powtarzanymi pomiarami w trzech kierunkach?
Moje pytanie opiera się na tej odpowiedzi, która wykazała, który lme4::lmermodel odpowiada dwukierunkowej ANOVA z powtarzanymi pomiarami: require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), d[d$c == …

2
Oczekiwanie kwadratu Gamma
Jeśli rozkład gamma jest sparametryzowany za pomocą i β , to:αα\alphaββ\beta mi( Γ ( α , β) ) = αβE(Γ(α,β))=αβ E(\Gamma(\alpha, \beta)) = \frac{\alpha}{\beta} Chciałbym obliczyć oczekiwaną kwadratową gamma, to znaczy: mi( Γ ( α , β)2)) = ?E(Γ(α,β)2)=? E(\Gamma(\alpha, \beta)^2) = ? Myślę, że to jest: mi( Γ ( …


1
Wiele porównań w teście nieparametrycznym
Pracuję z zestawem danych, który jest nieparametryczny i zawiera 12 zabiegów. Przeprowadziłem test Kruskala-Wallisa i uzyskałem znaczącą wartość , a teraz chciałbym przeprowadzić procedurę wielokrotnych porównań, aby zobaczyć, które z zabiegów znacznie się różnią. Jest wiele informacji na ten temat, ale nie znalazłem niczego, co konkretnie rozwiązałoby ten problem. Jakieś …

1
Kiedy korygować wartości p w wielu porównaniach?
Obawiam się, że powiązane pytania nie odpowiedziały na moje. Oceniamy wyniki> 2 klasyfikatorów (uczenie maszynowe). Nasza hipoteza zerowa mówi, że wyniki nie różnią się. Aby ocenić tę hipotezę, wykonujemy testy parametryczne (ANOVA) i nieparametryczne (Friedman). Jeśli są znaczące, chcemy dowiedzieć się, którzy klasyfikatorzy różnią się w zadaniu post-hoc. Moje pytanie …

3
GLM z ciągłymi danymi zgromadzonymi na zerze
Próbuję uruchomić model, aby oszacować, w jaki sposób katastrofalne choroby, takie jak gruźlica, AIDS itp. Wpływają na wydatki na hospitalizację. Mam „na koszt hospitalizacji” jako zmienną zależną i różne indywidualne markery jako zmienne niezależne, z których prawie wszystkie są obojętne, takie jak płeć, głowa gospodarstwa domowego, stan ubóstwa i oczywiście …

1
Wybór modelu w nauczaniu offline a nauczanie online
Ostatnio próbuję dowiedzieć się więcej na temat uczenia się online (to absolutnie fascynujące!), A jednym z tematów, którego nie byłem w stanie dobrze zrozumieć, jest sposób myślenia o wyborze modelu w kontekście offline i online. Konkretnie, załóżmy, szkolimy klasyfikator w trybie offline, na podstawie pewnego ustalonego zbioru danych . Powiedzmy, …



1
Solidne oszacowanie kurtozy?
Używam zwykłego estymatora kurtozy, , ale zauważam, że nawet małe „odstające” w moim rozkładzie empirycznym , tj. małe szczyty daleko od centrum, wpływają na to ogromnie. Czy istnieje estymator kurtozy, który jest bardziej niezawodny?K^=μ^4σ^4K^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}

1
Jaka jest różnica między „ładunkami” a „ładunkami korelacyjnymi” w PCA i PLS?
Podczas wykonywania głównej analizy składowej (PCA) powszechną rzeczą do zrobienia jest wykreślenie dwóch obciążeń względem siebie w celu zbadania zależności między zmiennymi. W pracy dołączonej do pakietu PLS R do wykonywania regresji głównej składowej i regresji PLS istnieje inny wykres, zwany wykresem ładunków korelacyjnych (patrz rysunek 7 i strona 15 …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.