Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Badanie odporności regresji logistycznej na naruszenie liniowości logit
Przeprowadzam regresję logistyczną z wynikiem binarnym (start i start). Moja kombinacja predyktorów to zmienne ciągłe lub dychotomiczne. Stosując podejście Box-Tidwell, jeden z moich ciągłych predyktorów potencjalnie narusza założenie liniowości logit. Ze statystyk dotyczących dobroci dopasowania nie wynika, że ​​dopasowanie jest problematyczne. Następnie ponownie uruchomiłem model regresji, zastępując pierwotną zmienną ciągłą: …

3
Prognozowanie funkcji gęstości
Robię badania dotyczące prognozowania szeregów czasowych funkcji gęstości prawdopodobieństwa. Naszym celem jest prognozowanie pliku PDF na podstawie pliku PDF zaobserwowanego w przeszłości (zwykle szacowany). Opracowana przez nas metoda prognozowania sprawdza się całkiem dobrze w badaniach symulacyjnych. Potrzebuję jednak liczbowego przykładu z prawdziwych aplikacji, aby lepiej zilustrować naszą metodę. Czy istnieją …

1
Szacowanie współczynników regresji logistycznej w projekcie sterowania przypadkami, gdy zmienna wynikowa nie ma statusu przypadku / kontroli
Rozważ próbkowanie danych z populacji o wielkości w następujący sposób: DlaNNNk=1,...,Nk=1,...,Nk=1, ..., N Obserwować indywidualne statusu «choroba» „skkk Jeśli mają chorobę, włącz je do próbki z prawdopodobieństwem pk1pk1p_{k1} Jeśli nie chorują, włącz je z prawdopodobieństwem p_ {k0}pk0pk0p_{k0} . Załóżmy, że zaobserwowałeś binarną zmienną wyniku YiYiY_i i wektor predykcyjny XiXi{\bf X}_i …


1
Jak włączyć innowacyjną wartość odstającą przy obserwacji 48 w moim modelu ARIMA?
Pracuję nad zestawem danych. Po zastosowaniu niektórych technik identyfikacji modelu, wyszłam z modelem ARIMA (0,2,1). Użyłem detectIOfunkcji w pakiecie TSAw R do wykrycia innowacyjnej wartości odstającej (IO) przy 48. obserwacji mojego oryginalnego zestawu danych. Jak włączyć tę wartość odstającą do mojego modelu, aby móc jej używać do celów prognozowania? Nie …
10 r  time-series  arima  outliers  hypergeometric  fishers-exact  r  time-series  intraclass-correlation  r  logistic  glmm  clogit  mixed-model  spss  repeated-measures  ancova  machine-learning  python  scikit-learn  distributions  data-transformation  stochastic-processes  web  standard-deviation  r  machine-learning  spatial  similarities  spatio-temporal  binomial  sparse  poisson-process  r  regression  nonparametric  r  regression  logistic  simulation  power-analysis  r  svm  random-forest  anova  repeated-measures  manova  regression  statistical-significance  cross-validation  group-differences  model-comparison  r  spatial  model-evaluation  parallel-computing  generalized-least-squares  r  stata  fitting  mixture  hypothesis-testing  categorical-data  hypothesis-testing  anova  statistical-significance  repeated-measures  likert  wilcoxon-mann-whitney  boxplot  statistical-significance  confidence-interval  forecasting  prediction-interval  regression  categorical-data  stata  least-squares  experiment-design  skewness  reliability  cronbachs-alpha  r  regression  splines  maximum-likelihood  modeling  likelihood-ratio  profile-likelihood  nested-models 

1
Zrozumienie efektu ciągłego czynnika losowego w modelu efektów mieszanych
Rozumiem wpływ kategorycznego efektu losowego na model efektów mieszanych, ponieważ wykonuje on częściowe łączenie obserwacji według poziomu efektu losowego, skutecznie zakładając, że obserwacje same w sobie nie są niezależne, a jedynie ich częściowe pule. Również dla mojego zrozumienia, w takim modelu obserwacje dzielące ten sam poziom efektu losowego, ale różniące …

3
Jak uzyskać przedział ufności dla zmiany r-kwadratowej populacji
Dla prostego przykładu załóżmy, że istnieją dwa modele regresji liniowej 1 Model posiada trzy czynniki prognostyczne, x1a, x2b, ix2c Model 2 ma trzy predyktory z modelu 1 i dwa dodatkowe predyktory x2aorazx2b Istnieje równanie regresji populacji, w którym wyjaśniona wariancja populacji wynosi ρ2(1)ρ(1)2\rho^2_{(1)} dla Modelu 1 i ρ2(2)ρ(2)2\rho^2_{(2)} dla Modelu …



1
Rejestrowałem zmienną zależną, czy mogę używać rozkładu normalnego GLM z funkcją linku LOG?
Mam pytanie dotyczące uogólnionych modeli liniowych (GLM). Moja zmienna zależna (DV) jest ciągła i nie jest normalna. Więc logowałem to przekształciłem (wciąż nie jest normalne, ale poprawiłem). Chcę powiązać DV z dwiema zmiennymi kategorialnymi i jedną ciągłą zmienną zmienną. W tym celu chcę przeprowadzić GLM (używam SPSS), ale nie jestem …

1
Jak interpretować ten dwupłat PCA pochodzący z ankiety na temat obszarów, którymi ludzie są zainteresowani?
Kontekst: Zapytałem setki uczestników ankiety, jak bardzo są zainteresowani wybranymi obszarami (według pięciopunktowej skali Likerta, gdzie 1 wskazuje „nie zainteresowany”, a 5 wskazuje „zainteresowany”). Potem spróbowałem PCA. Poniższy obraz przedstawia dwa pierwsze główne elementy. Kolory są używane dla płci, a strzałki PCA są oryginalnymi zmiennymi (tj. Zainteresowaniami). Zauważyłem to: Kropki …

1
Wybór wag ścieżki w modelach koncepcyjnych SEM dla bliźniąt jednojajowych i braterskich z wykorzystaniem openMx
Przeglądam pakiet R OpenMx do analizy epidemiologii genetycznej, aby dowiedzieć się, jak określać i dopasowywać modele SEM. Jestem w tym nowy, więc znoś mnie. Postępuję zgodnie z przykładem na stronie 59 Podręcznika użytkownika OpenMx . Tutaj rysują następujący model koncepcyjny: Określając ścieżki, ustawiają ciężar utajonego „jednego” węzła dla manifestowanych węzłów …

1
Jak napisać termin błędu w powtarzanych pomiarach ANOVA w R: Błąd (temat) vs Błąd (temat / czas)
Moje pytanie jest bardzo ściśle związane z poprzednim poście Określanie Błąd () termin w ANOVA z powtarzanymi pomiarami w R . Chciałbym jednak uzyskać więcej informacji na temat definiowania terminu błędu. Załóżmy, że mam dwukierunkową powtarzaną ANOVA. Czynnikiem pomiędzy efektami grupowymi jest Leczenie (kontrola vs. placebo), podczas gdy Czas jest …


2
Kilka regresji logistycznych a regresja wielomianowa
Czy wykonalne jest kilka binarnych regresji logistycznych zamiast regresji wielomianowej? Z tego pytania: Wielomianowa regresja logistyczna a binarna regresja logistyczna jeden na jeden spostrzegam, że regresja wielomianowa może mieć niższe błędy standardowe. Jednak pakiet, którego chciałbym użyć, nie został uogólniony na regresję wielomianową ( ncvreg: http://cran.r-project.org/web/packages/ncvreg/ncvreg.pdf ), więc zastanawiałem się, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.