Próbuję zrozumieć, jak uzyskać wartości dla jednostronnego testu Kołmogorowa-Smirnowa i staram się znaleźć CDF dla i w przypadku dwóch próbek. Poniżej podano w kilku miejscach CDF dla w przypadku jednej próby:pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor n\left(1-x\right)\rfloor}{ \binom{n}{j} \left(\frac{j}{n}+x\right)^{j-1}\left(1 - x - \frac{j}{n}\right)^{n-j}} Co więcej, istnieje …
Moje pytanie jest bardzo proste, ale to są te, które naprawdę mnie dopadają :) Naprawdę nie wiem, jak ocenić, czy konkretny szereg czasowy ma zostać rozłożony za pomocą addytywnej czy multiplikatywnej metody rozkładu. Wiem, że istnieją wizualne wskazówki, które odróżniają je od siebie, ale ich nie rozumiem. Weźmy na przykład …
Obecnie czytam założenia dotyczące korelacji Pearsona. Ważnym założeniem dla następującego testu t wydaje się, że obie zmienne pochodzą z rozkładów normalnych; jeśli nie, to zaleca się stosowanie alternatywnych środków, takich jak rho Spearmana. Korelacja Spearmana jest obliczana jak korelacja Pearsona, przy użyciu tylko rang X i Y zamiast samych X …
Jestem zainteresowany oszacowaniem skorygowanego współczynnika ryzyka, analogicznie do tego, jak szacuje się skorygowany iloraz szans za pomocą regresji logistycznej. Niektóre piśmiennictwo (np. To ) wskazuje, że użycie regresji Poissona ze standardowymi błędami Hubera-White'a jest metodą modelową, aby to zrobić Nie znalazłem literatury na temat tego, jak wpływa to na ciągłe …
Wyniki asymptotyczne nie mogą być udowodnione za pomocą symulacji komputerowej, ponieważ są to stwierdzenia obejmujące pojęcie nieskończoności. Ale powinniśmy być w stanie uzyskać poczucie, że rzeczy rzeczywiście idą tak, jak mówi teoria. Rozważ teoretyczny wynik limn→∞P(|Xn|>ϵ)=0,ϵ>0limn→∞P(|Xn|>ϵ)=0,ϵ>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 gdzie XnXnX_n jest funkcją nnn zmiennych losowych, powiedzmy identycznie …
Chciałbym przeprowadzić kombinację nadpróbkowania i podpróbkowania, aby zrównoważyć mój zestaw danych z około 4000 klientami podzielonymi na dwie grupy, gdzie jedna z grup ma udział około 15%. Zajrzałem do SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) i ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), ale oba tworzą nowe próbki syntetyczne na podstawie istniejących obserwacji i …
Pracuję nad weryfikacją krzyżową prognoz moich danych z 200 podmiotami i 1000 zmiennymi. Interesuje mnie regresja grzbietu, ponieważ liczba zmiennych (chcę użyć) jest większa niż liczba próbek. Więc chcę użyć estymatorów skurczu. Oto przykładowe dane: #random population of 200 subjects with 1000 variables M <- matrix(rep(0,200*100),200,1000) for (i in 1:200) …
Dopasowuję glmermodel do lme4pakietu R. Szukam tabeli anova z wyświetloną wartością p, ale nie mogę znaleźć pakietu, który by do niej pasował. Czy można to zrobić w R? Model, który dopasowuję, ma postać: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))
Zdaję sobie sprawę, że w modelu drzew przypominających są 3 parametry dostrajania, tj liczba drzew (liczba iteracji) parametr skurczu liczba podziałów (wielkość każdego drzewa składowego) Moje pytanie brzmi: jak dla każdego parametru dostrajania znaleźć optymalną wartość? I jaką metodę? Zauważ, że: parametr skurczu i parametr liczby drzew działają razem, tj. …
Załóżmy, że mam zestaw danych z wynikami dla wielu elementów kwestionariusza, które teoretycznie składają się z mniejszej liczby skal, jak w badaniach psychologicznych. Wiem, że powszechnym podejściem jest tutaj sprawdzanie wiarygodności skal za pomocą alfa Cronbacha lub czegoś podobnego, a następnie agregowanie elementów w skalach w celu utworzenia wyników skali …
Mam pytanie dotyczące sposobu modelowania tekstu w oparciu o dane zliczania, w szczególności jak mogę wykorzystać tę lassotechnikę do ograniczenia funkcji. Powiedzmy, że mam N artykułów online i liczbę odsłon dla każdego artykułu. Wyodrębniłem 1-gram i 2-gram dla każdego artykułu i chciałem przeprowadzić regresję w stosunku do 1,2-gram. Ponieważ cechy …
Mam zestaw danych zawierający około 5000 funkcji. Dla tych danych najpierw użyłem testu Chi Square do wyboru funkcji; potem otrzymałem około 1500 zmiennych, które wykazały związek istotności ze zmienną odpowiedzi. Teraz muszę dopasować do tego regresję logistyczną. Używam pakietu glmulti dla R (pakiet glmulti zapewnia efektywny wybór podzbiorów dla vlm), …
Mam problem z interpretacją wykresów interakcji, gdy występuje interakcja między dwiema zmiennymi niezależnymi. Poniższe wykresy pochodzą z tej strony: Tutaj i są zmiennymi niezależnymi, a jest zmienną zależną.ZAAAbBBD V.DVDV Pytanie: Występuje interakcja i główny efekt , ale brak głównego efektuZAAAbBB Można zauważyć, że im wyższa wartość , tym wyższa wartość …
Dotacje często wymagają analizy mocy w celu obsługi proponowanej wielkości próby. W proteomice (i większości -omice) istnieje 100 do 1000 cech / zmiennych mierzonych w 10 próbkach (może 100, ale mało prawdopodobne). Wiadomo również, że niektóre z tych jednostek pomiarowych (np. Liczby spektralne białek) nie są normalnie rozłożone, więc do …
Szukam algorytmu regresji liniowej, który jest najbardziej odpowiedni dla danych, których zmienna niezależna (x) ma stały błąd pomiaru, a zmienna zależna (y) ma błąd zależny od sygnału. Powyższe zdjęcie ilustruje moje pytanie.
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.