Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Nazwa „paradoksu” zgłoszonego przez Gelmana
W książce Andrew Gelmana „Red State, Blue State” analizuje fakt, że bogaci ludzie w poszczególnych stanach mają tendencję do głosowania bardziej republikańscy niż biedni, ale zamożne państwa głosują bardziej demokratycznie niż biedne. Czy istnieje nazwa tego paradoksu? Wydaje mi się, że jest związany, ale nie identyczny, z paradoksem ekologicznym.
12 paradox 

2
Kiedy dane mają rozkład gaussowski, ile próbek je scharakteryzuje?
Dane gaussowskie rozmieszczone w jednym wymiarze wymagają dwóch parametrów do jego scharakteryzowania (średnia, wariancja), a plotka głosi, że około 30 losowo wybranych próbek jest zwykle wystarczających do oszacowania tych parametrów z dość dużą pewnością. Ale co się stanie, gdy liczba wymiarów wzrośnie? W dwóch wymiarach (np. Wysokość, waga) potrzeba 5 …


2
Jak przetestować nadmierną dyspersję w Poisson GLMM z lmer () w R?
Mam następujący model: > model1<-lmer(aph.remain~sMFS1+sAG1+sSHDI1+sbare+season+crop +(1|landscape),family=poisson) ... a to jest podsumowanie. > summary(model1) Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS1 + sAG1 + sSHDI1 + sbare + season + crop + (1 | landscape) AIC BIC logLik deviance 4057 4088 -2019 4039 Random effects: …


3
Naiwne cechy Bayesa mają prawdopodobieństwo: czy powinienem podwójnie liczyć słowa?
Prototypuję własny model słów Naive Bayes i miałem pytanie dotyczące obliczania prawdopodobieństw cech. Powiedzmy, że mam dwie klasy, po prostu używam spamu i nie-spamu, ponieważ wszyscy tego używają. Weźmy jako przykład słowo „viagra”. W moim zestawie szkoleniowym jest 10 e-maili, 5 spamu i 5 spamu. „viagra” pojawia się we wszystkich …



3
Czy procedura stałych efektów Mundlak ma zastosowanie do regresji logistycznej z manekinami?
Mam zestaw danych z 8000 klastrami i 4 milionami obserwacji. Niestety moje oprogramowanie statystyczne, Stata, działa dość wolno, gdy używa swojej funkcji danych panelowych do regresji logistycznej: xtlogitnawet z podpróbką 10%. Jednak w przypadku korzystania z logitfunkcji niepanelowej wyniki pojawiają się znacznie wcześniej. Dlatego mogę korzystać ze logitzmodyfikowanych danych uwzględniających …


5
Czy magia liczby 20?
Mam referencje, które zalecały rozważenie wielkości próby wynoszącej co najmniej 20 dla dystrybucji dopasowania danych. Czy ma to jakiś sens? dzięki


2
Wykres QQ nie pasuje do histogramu
Mam histogram, gęstość jądra i dopasowany normalny rozkład zwrotów z dziennika finansowego, które są przekształcane w straty (znaki są zmieniane), i normalny wykres QQ tych danych: Wykres QQ pokazuje wyraźnie, że ogony nie są prawidłowo dopasowane. Ale jeśli spojrzę na histogram i dopasowany rozkład normalny (niebieski), nawet wartości około 0,0 …

3
Krzywa ROC przekraczająca przekątną
W tej chwili prowadzę klasyfikator binarny. Kiedy wykreślam krzywą ROC, na początku uzyskuję dobry skok, a następnie zmienia ona kierunek i przecina przekątną, a następnie oczywiście z powrotem w górę, tworząc krzywą w kształcie litery S. Jaka może być interpretacja / wyjaśnienie tego efektu? Dzięki
12 roc 

1
Uzgadnianie notacji dla modeli mieszanych
Znam notacje takie jak: yij=β0+βixij+uj+eij=β0j+βixij+eijyij=β0+βixij+uj+eij=β0j+βixij+eij\begin{align} y_{ij} &= \beta_0 + \beta_i x_{ij} + u_j + e_{ij}\\ &= \beta_{0j} + \beta_i x_{ij} + e_{ij} \end{align} gdzie iβ0j=β0+ujβ0j=β0+uj\beta_{0j}=\beta_{0}+u_j yij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eijyij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eij\begin{align} y_{ij} &= \beta_0 + \beta_1 x_{ij} + u_{0j} + u_{1j} x_{ij} + e_{ij} \\ &= \beta_{0j} + \beta_{1j} x_{ij} + e_{ij} \end{align} gdzie iβ0j=β0+u0jβ0j=β0+u0j\beta_{0j}=\beta_{0}+u_{0j}β1j=β1+u1jβ1j=β1+u1j\beta_{1j}=\beta_1+u_{1j} …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.