Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
REML lub ML, aby porównać dwa modele efektów mieszanych z różnymi stałymi efektami, ale z tym samym efektem losowym?
Tło: Uwaga: Mój zestaw danych i kod r są zawarte poniżej tekstu Chciałbym użyć AIC do porównania dwóch modeli efektów mieszanych wygenerowanych przy użyciu pakietu lme4 w R. Każdy model ma jeden ustalony efekt i jeden efekt losowy. Efekt stały różni się w zależności od modelu, ale efekt losowy pozostaje …

5
Czy
Wydaje mi się, że pomyliłem się, próbując zrozumieć, czy wartość kwantyfikacji rrr ma również wartość ppp . Jak rozumiem, w korelacji liniowej z zestawem punktów danych rrr może mieć wartość w zakresie od −1−1-1 do a ta wartość, cokolwiek to jest, może mieć wartość która pokazuje, czy jest znacząco różne …


5
Zmienność wyników cv.glmnet
Używam cv.glmnetdo znajdowania predyktorów. Konfiguracja, której używam jest następująca: lassoResults<-cv.glmnet(x=countDiffs,y=responseDiffs,alpha=1,nfolds=cvfold) bestlambda<-lassoResults$lambda.min results<-predict(lassoResults,s=bestlambda,type="coefficients") choicePred<-rownames(results)[which(results !=0)] Aby upewnić się, że wyniki są powtarzalne ja set.seed(1). Wyniki są bardzo zmienne. Uruchomiłem dokładnie ten sam kod 100, aby zobaczyć, jak zmienne były wyniki. W biegach 98/100 zawsze wybierano jeden konkretny predyktor (czasem tylko sam); …

4
Czy synonimy „losowa próbka” i „iid losowa zmienna” są synonimami?
Trudno mi było zrozumieć znaczenie „próbki losowej”, a także „iid zmienna losowa”. Próbowałem znaleźć znaczenie z kilku źródeł, ale coraz bardziej się myliłem. Publikuję tutaj to, co próbowałem i poznałem: Prawdopodobieństwo i statystyki Degroot mówi: Losowe próbki / iid / Sample Size: Rozważ podany rozkład prawdopodobieństwa na linii rzeczywistej, który …

3
Imputacja przed lub po podziale na pociąg i test?
Mam zestaw danych z N ~ 5000 i brakuje mi około 1/2 co najmniej jednej ważnej zmiennej. Główną metodą analityczną będą proporcjonalne zagrożenia Coxa. Planuję zastosować wielokrotne przypisanie. Podzielę się również na pociąg i zestaw testowy. Czy należy podzielić dane, a następnie przypisać osobno, czy przypisać, a następnie podzielić? Jeżeli …



2
Oblicz współczynniki w regresji logistycznej z R
W wielokrotnej regresji liniowej można znaleźć współczynnik za pomocą następującego wzoru. b = ( X′X)- 1( X′) Yb=(X′X)-1(X′)Yb = (X'X)^{-1}(X')Y beta = solve(t(X) %*% X) %*% (t(X) %*% Y) ; beta Na przykład: > y <- c(9.3, 4.8, 8.9, 6.5, 4.2, 6.2, 7.4, 6, 7.6, 6.1) > x0 <- c(1,1,1,1,1,1,1,1,1,1) …

1
MCMC w ograniczonej przestrzeni parametrów?
Próbuję zastosować MCMC do problemu, ale moje priorytety (w moim przypadku są to α∈[0,1],β∈[0,1]α∈[0,1],β∈[0,1]\alpha\in[0,1],\beta\in[0,1] )) są ograniczone do obszaru? Czy mogę użyć normalnego MCMC i zignorować próbki, które wypadną poza strefę ograniczoną (która w moim przypadku wynosi [0,1] ^ 2), tj. Funkcja przejścia do ponownego wykorzystania, gdy nowe przejście wypadnie …

3
Co oznacza „normalizacja” i jak sprawdzić, czy próbka lub rozkład są znormalizowane?
Mam pytanie, w którym prosi się o sprawdzenie, czy rozkład jednolity ( Uniform(a,b)Unjafaorm(za,b){\rm Uniform}(a,b) ) jest znormalizowany. Po pierwsze, co to znaczy znormalizować dowolny rozkład? I po drugie, jak przejść do sprawdzenia, czy rozkład jest znormalizowany? Rozumiem, obliczając otrzymujemy znormalizowane dane , ale tutaj prosi się o sprawdzenie, czy rozkład …


2
Wykrywanie anomalii za pomocą funkcji manekina (i innych funkcji dyskretnych / kategorialnych)
tl; dr Jaki jest zalecany sposób postępowania z discretedanymi podczas wykrywania nieprawidłowości? Jaki jest zalecany sposób postępowania categoricaldanymi podczas wykrywania nieprawidłowości? Ta odpowiedź sugeruje użycie dyskretnych danych tylko do filtrowania wyników. Być może zastąpisz wartość kategorii procentową szansą obserwacji? Wprowadzenie To jest mój pierwszy post tutaj, więc proszę, jeśli coś …

2
użycie ciężarów w svyglm vs glm
Chciałbym wiedzieć, jak różni się sposób traktowania ciężarów między svyglmiglm Używam twangpakietu w R do tworzenia ocen skłonności, które są następnie używane jako wagi, w następujący sposób (ten kod pochodzi z twangdokumentacji): library(twang) library(survey) set.seed(1) data(lalonde) ps.lalonde <- ps(treat ~ age + educ + black + hispan + nodegree + …
18 r  survey 

1
Podstawowe pytania dotyczące dyskretnej analizy przeżycia czasowego
Próbuję przeprowadzić dyskretną analizę przeżycia czasowego przy użyciu modelu regresji logistycznej i nie jestem pewien, czy całkowicie rozumiem ten proces. Byłbym bardzo wdzięczny za pomoc w kilku podstawowych pytaniach. Oto konfiguracja: Patrzę na członkostwo w grupie w ciągu pięciu lat. Każdy członek ma miesięczny zapis członkostwa za każdy miesiąc, gdy …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.