Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Jaki jest rozkład zaokrąglonej w dół średniej losowych zmiennych Poissona?
Jeśli mam zmienne losowe X1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_n które są rozkładem Poissona z parametrami λ1,λ2,…,λnλ1,λ2,…,λn\lambda_1, \lambda_2,\ldots, \lambda_n , jaki jest rozkład Y=⌊∑ni=1Xin⌋Y=⌊∑i=1nXin⌋Y=\left\lfloor\frac{\sum_{i=1}^n X_i}{n}\right\rfloor(tj. całkowita liczba średnia)? Suma Poissonów jest również Poissonem, ale nie jestem wystarczająco pewna w statystykach, aby ustalić, czy jest taka sama w powyższym przypadku.

2
Wykreślanie przedziałów ufności dla przewidywanych prawdopodobieństw z regresji logistycznej
Ok, mam regresję logistyczną i wykorzystałem tę predict()funkcję do opracowania krzywej prawdopodobieństwa na podstawie moich oszacowań. ## LOGIT MODEL: library(car) mod1 = glm(factor(won) ~ as.numeric(bid), data=mydat, family=binomial(link="logit")) ## PROBABILITY CURVE: all.x <- expand.grid(won=unique(won), bid=unique(bid)) y.hat.new <- predict(mod1, newdata=all.x, type="response") plot(bid<-000:1000,predict(mod1,newdata=data.frame(bid<-c(000:1000)),type="response"), lwd=5, col="blue", type="l") To świetnie, ale jestem ciekawy, jak wykreślić …

3
Czy algorytm MIC do wykrywania korelacji nieliniowych można wyjaśnić intuicyjnie?
Niedawno przeczytałem dwa artykuły. Pierwszy dotyczy historii korelacji, a drugi nowej metody o nazwie Maksymalny współczynnik informacyjny (MIC). Potrzebuję twojej pomocy w zrozumieniu metody MIC w celu oszacowania nieliniowych korelacji między zmiennymi. Ponadto instrukcje dotyczące jego używania w języku R można znaleźć na stronie internetowej autora (w części Pliki do …

2
Sparowany test t jako specjalny przypadek liniowego modelowania z mieszanym efektem
Wiemy, że sparowany test t jest tylko specjalnym przypadkiem jednokierunkowej ANOVA z powtarzanymi pomiarami (lub wewnątrz podmiotu), a także liniowym modelem mieszanego efektu, który można zademonstrować za pomocą funkcji lme () pakiet nlme w języku R jak pokazano niżej. #response data from 10 subjects under two conditions x1<-rnorm(10) x2<-1+rnorm(10) # …

1
Jakie jest zastosowanie wiersza utworzonego przez qqline () w R?
Funkcja qqnorm()R wytwarza normalny wykres QQ i qqline()dodaje linię, która przechodzi przez pierwszy i trzeci kwartyl. Jakie jest pochodzenie tej linii? Czy sprawdzanie normalności jest pomocne? To nie jest klasyczna linia (przekątna prawdopodobnie po skalowaniu liniowym).y= xy=xy=x Oto przykład. Najpierw porównuję funkcję rozkładu empirycznego z teoretyczną funkcją rozkładu : Teraz …

2
Budujesz model liniowy dla stosunku vs procent?
Załóżmy, że chcę zbudować model, aby przewidzieć pewien stosunek lub procent. Na przykład, powiedzmy, że chcę przewidzieć liczbę chłopców w porównaniu z dziewczynami, którzy wezmą udział w imprezie, a cechami imprezy, których mogę użyć w modelu, są między innymi ilość reklamy na imprezę, wielkość miejsca, czy to tam na przyjęciu …

3
Kiedy należy stosować regresję wielokrotną z kodowaniem fikcyjnym a ANCOVA?
Niedawno przeanalizowałem eksperyment, w którym manipulowano 2 zmiennymi kategorycznymi i jedną zmienną ciągłą za pomocą ANCOVA. Jednak recenzent zasugerował, że regresja wielokrotna ze zmienną kategorialną zakodowaną jako zmienne pozorne jest bardziej odpowiednim testem dla eksperymentów ze zmiennymi kategorycznymi i ciągłymi. Kiedy należy zastosować ANCOVA vs. regresję wielokrotną ze zmiennymi fikcyjnymi …

2
Kolejność zmiennych w ANOVA ma znaczenie, prawda?
Czy słusznie rozumiem, że kolejność, w której zmienne są określone w wieloczynnikowej ANOVA, robi różnicę, ale że kolejność nie ma znaczenia przy wykonywaniu wielokrotnej regresji liniowej? Zakładając wynik, taki jak zmierzona utrata krwi y i dwie kategoryczne zmienne metoda adenoidektomii a , metoda wycięcia migdałków b . Model y~a+bróżni się …



4
Analiza przeżycia: czas ciągły vs dyskretny
Nie jestem pewien, jak zdecydować, czy traktować czas jako ciągły czy dyskretny w analizie przeżycia. W szczególności chcę użyć analizy przeżycia, aby zidentyfikować zmienne na poziomie dziecka i gospodarstwa domowego, które mają największą rozbieżność w ich wpływie na przeżycie chłopców i dziewcząt (do 5 roku życia). Mam zestaw danych dotyczących …
20 survival  ties 


7
Jakie są alternatywy dla fabuły?
Pracuję nad stworzeniem strony internetowej, która wyświetla dane ze spisu dla wybranego przez użytkownika wielokąta i chciałbym graficznie pokazać rozkład różnych parametrów (jeden wykres na parametr). Dane zwykle mają następujące właściwości: Wielkość próby jest zwykle duża (powiedzmy około 10 000 punktów danych) Zakres wartości wydaje się być dość duży (na …


9
Ile opóźnień użyć w teście Ljung-Boxa szeregu czasowego?
Po dopasowaniu modelu ARMA do szeregów czasowych często sprawdza się resztki za pomocą testu Portmanteau Ljunga-Boxa (między innymi testami). Test Ljunga-Boxa zwraca wartość ap. Ma parametr h , który jest liczbą opóźnień do przetestowania. Niektóre teksty zalecają użycie h = 20; inni zalecają użycie h = ln (n); większość nie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.