Andrew Gelman w jednym ze swoich najnowszych postów na blogu mówi: Nie sądzę, aby scenariusz Simpsona wymagał działania alternatywnego lub potencjalnych wyników. Mówię to, ponieważ można skonfigurować paradoks Simpsona ze zmiennymi, których nie można manipulować lub dla których manipulacje nie są bezpośrednio interesujące. Paradoks Simpsona jest częścią bardziej ogólnego problemu, …
Mam pół-małą macierz funkcji binarnych o wymiarze 250k x 100. Każdy wiersz to użytkownik, a kolumny to binarne „tagi” niektórych zachowań użytkownika, np. „Like_cats”. user 1 2 3 4 5 ... ------------------------- A 1 0 1 0 1 B 0 1 0 1 0 C 1 0 0 1 0 …
Wykonuję regresję logistyczną elastycznej sieci dla zestawu danych opieki zdrowotnej, używając glmnetpakietu w R, wybierając wartości lambda na siatce od 0 do 1. Mój skrócony kod znajduje się poniżej:αα\alpha alphalist <- seq(0,1,by=0.1) elasticnet <- lapply(alphalist, function(a){ cv.glmnet(x, y, alpha=a, family="binomial", lambda.min.ratio=.001) }) for (i in 1:11) {print(min(elasticnet[[i]]$cvm))} która wyprowadza średni …
Niedawno czytałem o teście U Manna-Whitneya. Okazuje się, że aby przeprowadzić ten test w R, trzeba przeprowadzić test Wilcoxona! Moje pytanie: czy statystyka W wilcox.testw R jest identyczna ze statystyką U?
Rozumiem, że test Walda dla współczynników regresji oparta jest na następujących nieruchomości, które posiada asymptotycznie (np Wasserman (2006): Wszystko statystyk , stron 153, 214-215): gdzieβoznacza oszacowany współczynnik regresji,^se(β)oznacza błąd standardowy współczynnik regresji iβ0jest wartością zainteresowania (β0zazwyczaj wynosi 0 aby sprawdzić, czy współczynnik różni się znacznie od 0). ZatemtestαWaldwielkości: odrzucajH0,gdy| W| …
Chcę lepiej zrozumieć pakiety R Larsi Glmnetużywane do rozwiązania problemu Lasso: (dla zmiennych i próbek , patrz www.stanford.edu/~hastie/Papers/glmnet.pdf na stronie 3)m i n( β0β) ∈ Rp + 1[ 12)N.∑ja = 1N.( yja- β0- xT.jaβ)2)+ λ | |β| |l1]mjan(β0β)∈Rp+1[12)N.∑ja=1N.(yja-β0-xjaT.β)2)+λ||β||l1]min_{(\beta_0 \beta) \in R^{p+1}} \left[\frac{1}{2N}\sum_{i=1}^{N}(y_i-\beta_0-x_i^T\beta)^2 + \lambda||\beta ||_{l_{1}} \right]pppN.N.N Dlatego zastosowałem je oba …
Chcę wykonać K-oznacza grupowanie obiektów, które mam, ale obiekty te nie są opisywane jako punkty w przestrzeni, tj. Przez objects x featureszestaw danych. Jestem jednak w stanie obliczyć odległość między dowolnymi dwoma obiektami (jest ona oparta na funkcji podobieństwa). Pozbywam się macierzy odległości objects x objects. Wcześniej zaimplementowałem K-średnich, ale …
Po zagraniu zbyt dużej ilości Angry Birds zacząłem obserwować własne strategie. Okazuje się, że opracowałem bardzo specyficzne podejście do uzyskania 3 gwiazdek na każdym poziomie. To sprawiło, że zastanawiałem się nad wyzwaniami związanymi z opracowaniem systemu uczenia maszynowego, który byłby w stanie grać w Angry Birds. Interakcja z grą i …
Załóżmy, że mam pewien pomiar dla każdego przedmiotu w każdej witrynie. Dwie zmienne, przedmiot i miejsce, są interesujące pod względem obliczania wartości korelacji wewnątrzklasowej (ICC). Zazwyczaj używałbym funkcji lmerz pakietu R lme4i uruchamiał się lmer(measurement ~ 1 + (1 | subject) + (1 | site), mydata) Wartości ICC można uzyskać …
Jestem zupełnie nowy w tej kwestii R, ale nie jestem pewien, który model wybrać. Zrobiłem stopniowe naprzód regresji wybranie każdej zmiennej opartej na najniższym AIC. Wymyśliłem 3 modele, które nie jestem pewien, który jest „najlepszy”. Model 1: Var1 (p=0.03) AIC=14.978 Model 2: Var1 (p=0.09) + Var2 (p=0.199) AIC = 12.543 …
Muszę od razu wyjaśnić, że jestem praktykującym programistą, a nie statystykiem, a moja klasa statystyk z college'u była bardzo dawno temu… To powiedziawszy, chciałbym wiedzieć, czy istnieje metoda gromadzenia zestawu statystyk opisowych, które można by następnie wykorzystać do stworzenia wykresu pudełkowego, który nie pociąga za sobą przechowywania wielu pojedynczych próbek? …
Mam dwie grupy danych. Każda z innym rozkładem wielu zmiennych. Próbuję ustalić, czy rozkłady tych dwóch grup różnią się w sposób istotny statystycznie. Mam dane zarówno w postaci surowej, jak i podzielone na grupy, aby łatwiej było sobie radzić z dyskretnymi kategoriami z liczeniem częstotliwości w każdej. Jakich testów / …
Współczynnik korelacji zapisuje się zwykle dużą literą ale czasem nie. Zastanawiam się, czy naprawdę istnieje różnica między i ? Czy może oznaczać coś innego niż współczynnik korelacji?r 2 R 2 rRRRr2r2r^2R2R2R^2rrr
Nie jestem pewien, dlaczego musimy tłumić zmienne kategorialne. Na przykład, jeśli mam zmienną kategorialną o czterech możliwych wartościach 0,1,2,3, mogę ją zastąpić dwoma wymiarami. Gdyby zmienna miała wartość 0, miałaby 0,0 w dwóch wymiarach, gdyby miała 3, miałaby 1,1 w dwóch wymiarach i tak dalej. Nie jestem pewien, dlaczego musimy …
Jestem trochę zdezorientowany, jakie są założenia regresji liniowej. Do tej pory sprawdziłem, czy: wszystkie zmienne objaśniające korelowały liniowo ze zmienną odpowiedzi. (Tak było) między zmiennymi objaśniającymi była jakakolwiek kolinearność. (była niewielka kolinearność). odległości Cooka od punktów danych mojego modelu są mniejsze niż 1 (tak jest, wszystkie odległości są mniejsze niż …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.