Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Dystrybucja opisująca różnicę między ujemnymi zmiennymi dwumianowymi rozproszonymi?
Skellam Dystrybucja opisuje różnicę pomiędzy dwiema zmiennymi, które mają rozkład Poissona. Czy istnieje podobny rozkład opisujący różnicę między zmiennymi występującymi po ujemnych rozkładach dwumianowych? Moje dane są wytwarzane w procesie Poissona, ale zawierają sporo hałasu, co prowadzi do nadmiernej dyspersji w dystrybucji. Dlatego modelowanie danych z ujemnym rozkładem dwumianowym (NB) …

2
Jaki jest prawidłowy sposób testowania znaczących różnic między współczynnikami?
Mam nadzieję, że ktoś pomoże mi rozwiązać problem zamieszania. Powiedzmy, że chcę przetestować, czy 2 zestawy współczynników regresji różnią się znacznie od siebie, z następującą konfiguracją: yi=α+βxi+ϵiyi=α+βxi+ϵiy_i = \alpha + \beta x_i + \epsilon_i , z 5 niezależnymi zmiennymi. 2 grupy o mniej więcej równych rozmiarach n1,n2n1,n2n_1, n_2 (choć może …

2
Dlaczego testy chi-kwadrat używają oczekiwanej liczby jako wariancji?
W testach , jaka jest podstawa zastosowania pierwiastka kwadratowego z oczekiwanych zliczeń jako odchyleń standardowych (tj. Oczekiwanych zliczeń jako wariancji) każdej z rozkładów normalnych? Jedyne, co mogłem znaleźć, omawiając to w ogóle, to http://www.physics.csbsju.edu/stats/chi-square.html , i tylko wspomina o rozkładach Poissona.χ2χ2\chi^2 Jako prostą ilustrację mojego zamieszania, co gdybyśmy testowali, czy …

2
Ograniczone wzajemne informacje ograniczają się do punktowej wzajemnej informacji
Załóżmy, że mam dwa zbiory XXX i oraz łączny rozkład prawdopodobieństwa dla tych zbiorów . Niech i oznaczają brzegowe rozkładu ponad i odpowiednio.YYYp(x,y)p(x,y)p(x,y)p(x)p(x)p(x)p(y)p(y)p(y)XXXYYY Wspólna informacja między i jest zdefiniowana jako: XXXYYYI(X;Y)=∑x,yp(x,y)⋅log(p(x,y)p(x)p(y))I(X;Y)=∑x,yp(x,y)⋅log⁡(p(x,y)p(x)p(y))I(X; Y) = \sum_{x,y}p(x,y)\cdot\log\left(\frac{p(x,y)}{p(x)p(y)}\right) tzn. jest to średnia wartość punktowej wzajemnej informacji pmi .(x,y)≡log(p(x,y)p(x)p(y))(x,y)≡log⁡(p(x,y)p(x)p(y))(x,y) \equiv \log\left(\frac{p(x,y)}{p(x)p(y)}\right) Załóżmy, że znam górną …


4
Obliczanie wymaganej wielkości próby, dokładności oszacowania wariancji?
tło Mam zmienną o nieznanym rozkładzie. Mam 500 próbek, ale chciałbym zademonstrować dokładność, z jaką mogę obliczyć wariancję, np. Aby argumentować, że wielkość próbki 500 jest wystarczająca. Interesuje mnie również znajomość minimalnej wielkości próby, która byłaby wymagana do oszacowania wariancji z dokładnością .X%X%X\% pytania Jak mogę obliczyć precyzja mojego oszacowania …

2
James-Stein Estymator: Jak Efron i Morris oblicz
Mam pytanie dotyczące obliczania współczynnika James-Stein Kurczenie w 1977 Scientific American papierze Bradley Efron i Carl Morris, "Paradox Steina w Statistics" . Zebrałem dane dla graczy baseballowych i jest podany poniżej: Name, avg45, avgSeason Clemente, 0.400, 0.346 Robinson, 0.378, 0.298 Howard, 0.356, 0.276 Johnstone, 0.333, 0.222 Berry, 0.311, 0.273 Spencer, …



4
Jeśli chcę modelu możliwego do interpretacji, czy istnieją metody inne niż regresja liniowa?
Spotkałem niektórych statystyk, którzy nigdy nie używają modeli innych niż regresja liniowa do przewidywania, ponieważ uważają, że „modele ML”, takie jak losowy wzrost lasu lub zwiększenie gradientu, są trudne do wyjaśnienia lub „niemożliwe do interpretacji”. W regresji liniowej, biorąc pod uwagę, że zestaw założeń jest weryfikowany (normalność błędów, homoskedastyczność, brak …

2
Czy ktoś może mi wyjaśnić NUTS po angielsku?
Moje rozumienie algorytmu jest następujące: No U-Turn Sampler (NUTS) to hamiltonowska metoda Monte Carlo. Oznacza to, że nie jest to metoda łańcucha Markowa, a zatem algorytm ten omija część chodzenia losowego, która często uważana jest za nieefektywną i powolną do zbieżności. Zamiast wykonywać losowy spacer, NUTS wykonuje skoki o długości …

3
Korzystanie z regularyzacji podczas wnioskowania statystycznego
Wiem o zaletach regularyzacji przy budowaniu modeli predykcyjnych (uprzedzenie vs. wariancja, zapobieganie nadmiernemu dopasowaniu). Zastanawiam się jednak, czy dobrym pomysłem jest również regularyzacja (lasso, kalenica, siatka elastyczna), gdy głównym celem modelu regresji jest wnioskowanie o współczynnikach (sprawdzenie, które predyktory są istotne statystycznie). Chciałbym usłyszeć ludzkie myśli, a także linki do …

2
Jak wykonać test post-hoc na modelu Lmer?
Oto moja ramka danych: Group <- c("G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3") Subject <- c("S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15") Value <- c(9.832217741,13.62390117,13.19671612,14.68552076,9.26683366,11.67886655,14.65083473,12.20969772,11.58494621,13.58474896,12.49053635,10.28208078,12.21945867,12.58276212,15.42648969,9.466436017,11.46582655,10.78725485,10.66159358,10.86701127,12.97863424,12.85276916,8.672953949,10.44587257,13.62135205,13.64038394,12.45778874,8.655142642,10.65925259,13.18336949,11.96595556,13.5552118,11.8337142,14.01763101,11.37502161,14.14801305,13.21640866,9.141392359,11.65848845,14.20350364,14.1829714,11.26202565,11.98431285,13.77216009,11.57303893) data <- data.frame(Group, Subject, Value) Następnie uruchamiam model efektów mieszanych liniowo, aby porównać różnicę 3 grup w „wartości”, gdzie „podmiot” jest czynnikiem losowym: library(lme4) library(lmerTest) model <- lmer (Value~Group + (1|Subject), data = data) summary(model) Wyniki są …
18 r  lme4-nlme  post-hoc 

1
złożoność obliczeniowa k-NN
Jaka jest złożoność czasowa algorytmu k -NN z naiwnym podejściem wyszukiwania (bez drzewa kd lub podobnych)? Interesuje mnie jego złożoność czasowa, biorąc pod uwagę również hiperparametr k . Znalazłem sprzeczne odpowiedzi: O (nd + kn), gdzie n jest licznością zbioru treningowego, a d jest wymiarem każdej próbki. [1] O (ndk), …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.