Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Jaka jest różnica między próbkowaniem Metropolis Hastings, Gibbs, Znaczenie i odrzuceniem?
Próbowałem nauczyć się metod MCMC i natknąłem się na próbkowanie Metropolis Hastings, Gibbs, Ważność i Odrzucenie. Chociaż niektóre z tych różnic są oczywiste, tj. Jak Gibbs jest szczególnym przypadkiem Metropolis Hastings, gdy mamy pełne warunki warunkowe, inne są mniej oczywiste, na przykład gdy chcemy użyć MH w próbniku Gibbs itp. …

6
Jak naukowcy odkryli kształt funkcji gęstości prawdopodobieństwa rozkładu normalnego?
To prawdopodobnie pytanie amatorskie, ale interesuje mnie, w jaki sposób naukowcy wymyślili kształt funkcji gęstości prawdopodobieństwa rozkładu normalnego? Zasadniczo to, co mnie wkurza, to fakt, że dla kogoś może być bardziej intuicyjne, że funkcja prawdopodobieństwa normalnie rozłożonych danych ma kształt trójkąta równoramiennego, a nie krzywej dzwonowej, i jak udowodniłbyś takiej …

1
Kiedy zagnieżdżona weryfikacja krzyżowa jest naprawdę potrzebna i może mieć praktyczny wpływ?
Korzystając z walidacji krzyżowej w celu dokonania wyboru modelu (np. Strojenia hiperparametrów) i oceny wydajności najlepszego modelu, należy zastosować zagnieżdżoną walidację krzyżową . Pętla zewnętrzna służy do oceny wydajności modelu, a pętla wewnętrzna służy do wyboru najlepszego modelu; model jest wybierany na każdym zewnętrznym zestawie treningowym (przy użyciu wewnętrznej pętli …

6
Dlaczego mianownik estymatora kowariancji nie powinien być n-2, a nie n-1?
Mianownik (obiektywnego) estymatora wariancji jest ponieważ istnieje obserwacji i szacowany jest tylko jeden parametr.n−1n−1n-1nnn V(X)=∑ni=1(Xi−X¯¯¯¯)2n−1V(X)=∑i=1n(Xi−X¯)2n−1 \mathbb{V}\left(X\right)=\frac{\sum_{i=1}^{n}\left(X_{i}-\overline{X}\right)^{2}}{n-1} Z tego samego powodu zastanawiam się, dlaczego mianownik kowariancji nie powinien wynosić n−2n−2n-2 gdy szacuje się dwa parametry? Cov(X,Y)=∑ni=1(Xi−X¯¯¯¯)(Yi−Y¯¯¯¯)n−1Cov(X,Y)=∑i=1n(Xi−X¯)(Yi−Y¯)n−1 \mathbb{Cov}\left(X, Y\right)=\frac{\sum_{i=1}^{n}\left(X_{i}-\overline{X}\right)\left(Y_{i}-\overline{Y}\right)}{n-1}

2
Jak wiarygodne są przedziały ufności dla mniejszych obiektów dzięki pakietowi efektów?
EffectsPakiet zapewnia bardzo szybki i wygodny sposób kreślenia wyników liniowego modelu efektu mieszanego uzyskanego przez lme4pakiet . Te effectprzedziały ufności oblicza funkcyjne (CIS) bardzo szybko, ale jak wiarygodne są te przedziały ufności? Na przykład: library(lme4) library(effects) library(ggplot) data(Pastes) fm1 <- lmer(strength ~ batch + (1 | cask), Pastes) effs <- …

2
Regresja logistyczna a LDA jako klasyfikatory dwuklasowe
Próbuję owinąć głowę wokół różnicy statystycznej między liniową analizą dyskryminacyjną a regresją logistyczną . Czy słusznie rozumiem, że w przypadku problemu klasyfikacji dwóch klas LDA przewiduje dwie funkcje gęstości normalnej (po jednej dla każdej klasy), które tworzą granicę liniową w miejscu ich przecięcia, podczas gdy regresja logistyczna przewiduje jedynie funkcję …


4
Jak interpretować współczynniki z dopasowania modelu wielomianowego?
Próbuję utworzyć wielomian dopasowania drugiego rzędu do niektórych danych, które mam. Powiedzmy, że knuję to dopasowanie z ggplot(): ggplot(data, aes(foo, bar)) + geom_point() + geom_smooth(method="lm", formula=y~poly(x, 2)) Dostaję: Tak więc dopasowanie drugiego rzędu działa całkiem dobrze. Obliczam to za pomocą R: summary(lm(data$bar ~ poly(data$foo, 2))) I dostaję: lm(formula = data$bar …

5
Czy wartość p jest zasadniczo bezużyteczna i niebezpieczna w użyciu?
Ten artykuł „ Kursy, ciągle aktualizowane” z NY Times przykuł moją uwagę. Krótko mówiąc, stwierdza to [Statystyka bayesowska] okazuje się szczególnie przydatna w podejściu do skomplikowanych problemów, w tym wyszukiwań takich jak ta przeprowadzona przez Straż Przybrzeżną w 2013 r. W celu odnalezienia zaginionego rybaka, Johna Aldridge'a (choć jak dotąd …


10
Dlaczego zakłada się, że czasy przeżycia rozkładają się wykładniczo?
Uczę się analizy przeżycia z tego postu na UCLA IDRE i potknąłem się w sekcji 1.2.1. Samouczek mówi: ... jeśli wiadomo, że czasy przeżycia są rozkładane wykładniczo , to prawdopodobieństwo zaobserwowania czasu przeżycia ... Dlaczego zakłada się, że czasy przeżycia rozkładają się wykładniczo? Wydaje mi się to bardzo nienaturalne. Dlaczego …

5
Znaczenie „dodatniej zależności” jako warunek zastosowania zwykłej metody kontroli FDR
Benjamini i Hochberg opracowali pierwszą (i nadal chyba najczęściej stosowaną) metodę kontrolowania wskaźnika fałszywych odkryć (FDR). Chcę zacząć od szeregu wartości P, z których każda służy do innego porównania, i zdecydować, które są wystarczająco niskie, aby nazwać je „odkryciem”, kontrolując FDR do określonej wartości (powiedzmy 10%). Jednym z założeń zwykłej …


2
Wielomianowa regresja logistyczna a regresja binarna logistyczna jeden na jeden
Powiedzmy, że mamy zmienną zależną z kilkoma kategoriami i zestawem zmiennych niezależnych. YYY Jakie są zalety wielomianowej regresji logistycznej w porównaniu z zestawem binarnych regresji logistycznych (tj. Schemat jeden do reszty )? Przez zestaw binarnej regresji logistycznej rozumiem, że dla każdej kategorii budujemy osobny binarny model regresji logistycznej z celem …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.