Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Znalezienie pierwiastka dla funkcji stochastycznej
Załóżmy, że mamy funkcję , którą możemy obserwować tylko przez pewien hałas. Nie możemy obliczyć bezpośrednio, tylko gdzie to jakiś losowy szum. (W praktyce: obliczam przy użyciu metody Monte Carlo.)f(x)f(x)f(x)f(x)f(x)f(x)f(x)+ηf(x)+ηf(x) + \etaηη\etaf(x)f(x)f(x) Jakie metody są dostępne do znalezienia pierwiastków , tj. Obliczenia , aby ?fffxxxf(x)=0f(x)=0f(x) = 0 Szukam metod, które …

2
Czy test statystyczny może zwrócić wartość p wynoszącą zero?
Nie mam na myśli wartości bliskiej zeru (zaokrąglonej do zera przez niektóre oprogramowanie statystyczne), ale raczej dosłownie zero. Jeśli tak, to czy oznaczałoby to, że prawdopodobieństwo uzyskania uzyskanych danych przy założeniu prawdziwości hipotezy zerowej wynosi również zero? Jakie są (niektóre przykłady) testy statystyczne, które mogą zwrócić tego rodzaju wyniki? Edytowano …

2
Interpretacja porządkowej regresji logistycznej
Uruchomiłem tę porządkową regresję logistyczną w R: mtcars_ordinal <- polr(as.factor(carb) ~ mpg, mtcars) Mam to podsumowanie modelu: summary(mtcars_ordinal) Re-fitting to get Hessian Call: polr(formula = as.factor(carb) ~ mpg, data = mtcars) Coefficients: Value Std. Error t value mpg -0.2335 0.06855 -3.406 Intercepts: Value Std. Error t value 1|2 -6.4706 1.6443 …

3
Czy „statystyka testowa” jest wartością czy zmienną losową?
Jestem teraz studentem pierwszego kursu statystyki. Jestem zdezorientowany terminem „statystyki testowe”. Poniżej (widziałem to w niektórych podręcznikach), wydaje się być konkretną wartością obliczoną na podstawie konkretnej próbki. t = ¯ x - μ 0tttt = x¯¯¯- μ0s / n--√t=x¯-μ0s/n t=\frac{\overline{x} - \mu_0}{s / \sqrt{n}} Jednak w dalszej części (widziałem to …

1
Czy wartość R-kwadrat jest odpowiednia do porównywania modeli?
Staram się znaleźć najlepszy model do przewidywania cen samochodów, korzystając z cen i funkcji dostępnych na stronach ogłoszeń samochodowych. Do tego wykorzystałem kilka modeli z biblioteki scikit-learn oraz modele sieci neuronowej z pybrain i neurolabu. Podejście, które do tej pory stosowałem, polega na przepuszczeniu stałej ilości danych przez niektóre modele …

9
Obliczanie indeksu Rand
Próbuję wymyślić, jak obliczyć Indeks Rand algorytmu klastra, ale utknąłem w punkcie, w jaki sposób obliczyć prawdziwe i fałszywe negatywy. W tej chwili korzystam z przykładu z książki An Introduction to Information Retrieval (Manning, Raghavan & Schütze, 2009). Na stronie 359 mówią o tym, jak obliczyć indeks Rand. W tym …
17 clustering 


1
Czy autokorelowane wzorce resztkowe pozostają nawet w modelach z odpowiednimi strukturami korelacji i jak wybrać najlepsze modele?
Kontekst To pytanie używa R, ale dotyczy ogólnych problemów statystycznych. Analizuję wpływ czynników umieralności (% umieralności z powodu chorób i pasożytnictwa) na tempo wzrostu populacji ćmy w czasie, gdy populacje larw pobierano z 12 miejsc raz w roku przez 8 lat. Dane dotyczące tempa wzrostu populacji pokazują wyraźny, ale nieregularny …


1
Do czego służą „efekty” funkcji w R?
Nie rozumiem wyjaśnienia w Rpliku pomocy dla efektów () : Dla modelu liniowego dopasowanego przez lmlubaov , efektami są nieskorelowane wartości pojedynczego stopnia swobody uzyskane przez rzutowanie danych na kolejne ortogonalne podprzestrzenie generowane przez rozkład QR podczas procesu dopasowania. Czy ktoś może wyjaśnić, co to oznacza? Czy ortogonalne podprzestrzenie odnoszą …
17 r  regression 

2
Jakościowe kodowanie zmiennych w regresji prowadzi do „osobliwości”
Mam niezależną zmienną o nazwie „jakość”; ta zmienna ma 3 tryby odpowiedzi (zła jakość; średnia jakość; wysoka jakość). Chcę wprowadzić tę zmienną niezależną do mojej wielokrotnej regresji liniowej. Kiedy mam binarną zmienną niezależną (zmienną fikcyjną, mogę kodować 0/ 1), łatwo jest wprowadzić ją do modelu wielokrotnej regresji liniowej. Ale przy …

1
Jakie są wydajne algorytmy do obliczania dekompozycji wartości pojedynczej (SVD)?
Artykuł w Wikipedii na temat analizy głównych komponentów stwierdza, że Istnieją wydajne algorytmy do obliczania SVD bez konieczności formowania macierzy , więc obliczanie SVD jest obecnie standardowym sposobem obliczania analizy głównych składników z macierzy danych, chyba że wymagana jest tylko garść składników.XXXXTXXTXX^TX Czy ktoś mógłby mi powiedzieć, o jakich skutecznych …
17 pca  algorithms  svd  numerics 

3
Analogia korelacji Pearsona dla 3 zmiennych
Interesuje mnie, czy „korelacja” trzech zmiennych jest czymś, a jeśli tak, co by to było? Współczynnik korelacji momentu Pearsona E{(X−μX)(Y−μY)}Var(X)Var(Y)−−−−−−−−−−−−√E{(X−μX)(Y−μY)}Var(X)Var(Y)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)\}}{\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)}} Teraz pytanie dotyczące 3 zmiennych: Is E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)−−−−−−−−−−−−−−−−−−√E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)(Z-\mu_Z)\}} {\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)\mathrm{Var}(Z)}} byle co? W R wydaje się to czymś możliwym do interpretacji: > a <- rnorm(100); b <- rnorm(100); c <- rnorm(100) > …

2
Jak dopasować rozkład dyskretny do zliczania danych?
Mam następujący histogram danych zliczania. I chciałbym dopasować do niego dyskretny rozkład. Nie jestem pewien, jak powinienem to zrobić. Czy powinienem najpierw nałożyć na histogram rozkład dyskretny, powiedzmy ujemny rozkład dwumianowy, aby uzyskać parametry rozkładu dyskretnego, a następnie uruchomić test Kołmogorowa – Smirnowa, aby sprawdzić wartości p? Nie jestem pewien, …

1
Pytania dotyczące zasady wiarygodności
Obecnie próbuję zrozumieć zasadę wiarygodności i, szczerze mówiąc, wcale jej nie rozumiem. Tak więc napiszę wszystkie moje pytania jako listę, nawet jeśli mogą to być dość podstawowe pytania. Co dokładnie oznacza wyrażenie „wszystkie informacje” w kontekście tej zasady? (ponieważ wszystkie informacje w próbie są zawarte w funkcji prawdopodobieństwa). Czy zasada …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.