Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Czy jakakolwiek właściwość ilościowa populacji jest „parametrem”?
Stosunkowo znam rozróżnienie między terminami statystyki i parametru. Widzę statystykę jako wartość uzyskaną z zastosowania funkcji do przykładowych danych. Jednak większość przykładów parametrów dotyczy definiowania rozkładu parametrycznego. Typowym przykładem jest średnia i odchylenie standardowe do parametryzacji rozkładu normalnego lub współczynników i wariancji błędu do parametryzacji regresji liniowej. Istnieje jednak wiele …

4
Odpowiednik Boxplot dla dystrybucji o grubych ogonach?
W przypadku normalnie dystrybuowanych danych wykresy pudełkowe są świetnym sposobem na szybką wizualizację mediany i rozprzestrzeniania się danych, a także obecności jakichkolwiek wartości odstających. Jednak w przypadku bardziej ciężkich rozkładów wiele punktów jest pokazanych jako wartości odstające, ponieważ wartości odstające są zdefiniowane jako znajdujące się poza stałym współczynnikiem IQR, i …

3
Kiedy odpowiednia jest transformata Z Fishera?
Chcę przetestować korelację próbki kątem istotności, stosując wartości p, to znaczyrrr H.0: ρ = 0 ,H.1: ρ ≠ 0.H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. Zrozumiałem, że mogę użyć transformacji Z Fishera, aby to obliczyć zo b s= n - 3-----√2)ln( 1 + r1 - r)zobs=n−32ln⁡(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) i …


2
Regresja liniowa a nieliniowa
Mam zestaw wartości i , które są teoretycznie związanych wykładniczo:xxxyyy y=axby=axby = ax^b Jednym ze sposobów uzyskania współczynników jest zastosowanie logarytmów naturalnych po obu stronach i dopasowanie modelu liniowego: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] Innym sposobem uzyskania tego jest regresja nieliniowa, biorąc pod …

1
Czy podczas budowania modelu regresji przy użyciu oddzielnych zestawów modelowania / sprawdzania poprawności należy „ponownie wprowadzić do obiegu” dane sprawdzania poprawności?
Załóżmy, że mam podział 80/20 między obserwacjami modelowania / walidacji. Dopasowałem model do zestawu danych modelowania i czuję się dobrze z błędem, który widzę w zestawie danych sprawdzania poprawności. Przed wdrożeniem mojego modelu do oceny przyszłych obserwacji, czy właściwe jest połączenie weryfikacji z powrotem z danymi modelowania, aby uzyskać zaktualizowane …

3
Wybór testu statystycznego na podstawie wyniku innego (np. Normalności)
Słyszałem więc, że powiedziano, że wybór jednego testu statystycznego na podstawie wyniku innego nie jest dobrym pomysłem. Wydaje mi się to jednak dziwne. Na przykład ludzie często wybierają test nieparametryczny, gdy niektóre inne testy sugerują, że reszty nie są normalnie rozłożone. To podejście wydaje się dość powszechnie akceptowane, ale nie …


1
Znormalizowana zmienna zależna w grupie w modelach danych panelowych?
Czy standaryzacja zmiennej zależnej w grupie identyfikacyjnej ma sens? Poniższy dokument roboczy (Spowolnienie wylesiania w legalnej Amazonii; Ceny czy zasady ?, pdf ) wykorzystuje znormalizowaną zmienną zależną do analizy wpływu ogólnej zmiany polityki w Brazylii na wylesianie. Standaryzacja odbywa się w następujący sposób: Ynewit=Yit−Yi¯¯¯¯¯sd(Yit)Yitnew=Yit−Yi¯sd(Yit) Y^{new}_{it} = \frac{Y_{it} - \overline{Y_i}}{sd(Y_{it})} Autorzy …

4
Dopasowywanie wyniku skłonności do danych panelowych
Mam podłużny zestaw danych osób, a niektóre z nich zostały poddane leczeniu, a inne nie. Wszystkie osoby są w próbie od urodzenia do 18 roku życia, a leczenie odbywa się w pewnym wieku pomiędzy tym zakresem. Wiek leczenia może się różnić w zależności od przypadku. Korzystając z dopasowywania wyników skłonności, …

2
Kiedy rejestrować / wyeksponować zmienne podczas korzystania z losowych modeli lasu?
Wykonuję regresję przy użyciu Losowych lasów do przewidywania cen na podstawie kilku atrybutów. Kod jest napisany w Pythonie przy użyciu Scikit-learn. Jak zdecydować, czy należy przekształcić zmienne za pomocą exp/ logprzed użyciem, aby dopasować je do modelu regresji? Czy jest to konieczne, gdy stosuje się podejście Ensemble, takie jak Losowy …

4
Interpolacja danych dotyczących grypy, która oszczędza tygodniową średnią
Edytować Znalazłem artykuł opisujący dokładnie procedurę, której potrzebuję. Jedyna różnica polega na tym, że papier interpoluje średnie dane miesięczne do dziennych, przy jednoczesnym zachowaniu średnich miesięcznych. Mam problem z wdrożeniem tego podejścia R. Wszelkie wskazówki są mile widziane. Oryginalny Na każdy tydzień mam następujące dane zliczania (jedna wartość na tydzień): …

3
Jak obliczyć główne składniki obrócone varimax w R?
Uruchomiłem PCA na 25 zmiennych i wybrałem 7 najlepszych komputerów za pomocą prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) Następnie wykonałem obrót varimax na tych elementach. varimax7 <- varimax(prc$rotation[,1:7]) A teraz chcę varimax obrócić dane obrócone PCA (ponieważ nie jest to część obiektu varimax - tylko macierz obciążeń i macierz …
13 r  pca  factor-rotation 

1
Przewidywanie modeli mieszanych: co zrobić z efektami losowymi?
Rozważmy ten hipotetyczny zestaw danych: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) możemy użyć lmedo modelowania odpowiedzi za pomocą modelu efektu losowego: require(nlme) model <- lme(response …

1
Duża próba asymptotyczna / teoria - po co się tym przejmować?
Mam nadzieję, że to pytanie nie zostanie oznaczone jako „zbyt ogólne” i mam nadzieję, że rozpocznie się dyskusja, która przyniesie korzyści wszystkim. W statystykach poświęcamy dużo czasu na naukę teorii dużych próbek. Jesteśmy głęboko zainteresowani oceną asymptotycznych właściwości naszych estymatorów, w tym tego, czy są one asymptotycznie bezstronne, asymptotycznie wydajne, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.