Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Co to jest CDF z dwoma próbkami
Próbuję zrozumieć, jak uzyskać wartości dla jednostronnego testu Kołmogorowa-Smirnowa i staram się znaleźć CDF dla i w przypadku dwóch próbek. Poniżej podano w kilku miejscach CDF dla w przypadku jednej próby:pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor n\left(1-x\right)\rfloor}{ \binom{n}{j} \left(\frac{j}{n}+x\right)^{j-1}\left(1 - x - \frac{j}{n}\right)^{n-j}} Co więcej, istnieje …


2
Dlaczego korelacja rang Pearsona jest ważna pomimo założenia normalności?
Obecnie czytam założenia dotyczące korelacji Pearsona. Ważnym założeniem dla następującego testu t wydaje się, że obie zmienne pochodzą z rozkładów normalnych; jeśli nie, to zaleca się stosowanie alternatywnych środków, takich jak rho Spearmana. Korelacja Spearmana jest obliczana jak korelacja Pearsona, przy użyciu tylko rang X i Y zamiast samych X …

2
Szacowanie skorygowanych współczynników ryzyka w danych binarnych przy użyciu regresji Poissona
Jestem zainteresowany oszacowaniem skorygowanego współczynnika ryzyka, analogicznie do tego, jak szacuje się skorygowany iloraz szans za pomocą regresji logistycznej. Niektóre piśmiennictwo (np. To ) wskazuje, że użycie regresji Poissona ze standardowymi błędami Hubera-White'a jest metodą modelową, aby to zrobić Nie znalazłem literatury na temat tego, jak wpływa to na ciągłe …

1
Symulowanie zbieżności prawdopodobieństwa do stałej
Wyniki asymptotyczne nie mogą być udowodnione za pomocą symulacji komputerowej, ponieważ są to stwierdzenia obejmujące pojęcie nieskończoności. Ale powinniśmy być w stanie uzyskać poczucie, że rzeczy rzeczywiście idą tak, jak mówi teoria. Rozważ teoretyczny wynik limn→∞P(|Xn|>ϵ)=0,ϵ>0limn→∞P(|Xn|>ϵ)=0,ϵ>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 gdzie XnXnX_n jest funkcją nnn zmiennych losowych, powiedzmy identycznie …

1
Nadpróbkowanie przy pomocy zmiennych kategorialnych
Chciałbym przeprowadzić kombinację nadpróbkowania i podpróbkowania, aby zrównoważyć mój zestaw danych z około 4000 klientami podzielonymi na dwie grupy, gdzie jedna z grup ma udział około 15%. Zajrzałem do SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) i ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), ale oba tworzą nowe próbki syntetyczne na podstawie istniejących obserwacji i …

3
Walidacja krzyżowa K-hold lub hold-out dla regresji grzbietu za pomocą R.
Pracuję nad weryfikacją krzyżową prognoz moich danych z 200 podmiotami i 1000 zmiennymi. Interesuje mnie regresja grzbietu, ponieważ liczba zmiennych (chcę użyć) jest większa niż liczba próbek. Więc chcę użyć estymatorów skurczu. Oto przykładowe dane: #random population of 200 subjects with 1000 variables M <- matrix(rep(0,200*100),200,1000) for (i in 1:200) …

1
test anova typu III dla GLMM
Dopasowuję glmermodel do lme4pakietu R. Szukam tabeli anova z wyświetloną wartością p, ale nie mogę znaleźć pakietu, który by do niej pasował. Czy można to zrobić w R? Model, który dopasowuję, ma postać: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))

2
Jak znaleźć optymalne wartości parametrów dostrajania w drzewach wzmacniających?
Zdaję sobie sprawę, że w modelu drzew przypominających są 3 parametry dostrajania, tj liczba drzew (liczba iteracji) parametr skurczu liczba podziałów (wielkość każdego drzewa składowego) Moje pytanie brzmi: jak dla każdego parametru dostrajania znaleźć optymalną wartość? I jaką metodę? Zauważ, że: parametr skurczu i parametr liczby drzew działają razem, tj. …

1
Jaki jest związek między miarami niezawodności skali (alfa Cronbacha itp.) A ładunkami składników / czynników?
Załóżmy, że mam zestaw danych z wynikami dla wielu elementów kwestionariusza, które teoretycznie składają się z mniejszej liczby skal, jak w badaniach psychologicznych. Wiem, że powszechnym podejściem jest tutaj sprawdzanie wiarygodności skal za pomocą alfa Cronbacha lub czegoś podobnego, a następnie agregowanie elementów w skalach w celu utworzenia wyników skali …

1
Jak Glmnet radzi sobie z nadmierną dyspersją?
Mam pytanie dotyczące sposobu modelowania tekstu w oparciu o dane zliczania, w szczególności jak mogę wykorzystać tę lassotechnikę do ograniczenia funkcji. Powiedzmy, że mam N artykułów online i liczbę odsłon dla każdego artykułu. Wyodrębniłem 1-gram i 2-gram dla każdego artykułu i chciałem przeprowadzić regresję w stosunku do 1,2-gram. Ponieważ cechy …

5
Regresja logistyczna dużych zbiorów danych
Mam zestaw danych zawierający około 5000 funkcji. Dla tych danych najpierw użyłem testu Chi Square do wyboru funkcji; potem otrzymałem około 1500 zmiennych, które wykazały związek istotności ze zmienną odpowiedzi. Teraz muszę dopasować do tego regresję logistyczną. Używam pakietu glmulti dla R (pakiet glmulti zapewnia efektywny wybór podzbiorów dla vlm), …

4
Pomóc zinterpretować fabułę interakcji?
Mam problem z interpretacją wykresów interakcji, gdy występuje interakcja między dwiema zmiennymi niezależnymi. Poniższe wykresy pochodzą z tej strony: Tutaj i są zmiennymi niezależnymi, a jest zmienną zależną.ZAAAbBBD V.DVDV Pytanie: Występuje interakcja i główny efekt , ale brak głównego efektuZAAAbBB Można zauważyć, że im wyższa wartość , tym wyższa wartość …

1
Moc w proteomice?
Dotacje często wymagają analizy mocy w celu obsługi proponowanej wielkości próby. W proteomice (i większości -omice) istnieje 100 do 1000 cech / zmiennych mierzonych w 10 próbkach (może 100, ale mało prawdopodobne). Wiadomo również, że niektóre z tych jednostek pomiarowych (np. Liczby spektralne białek) nie są normalnie rozłożone, więc do …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.