Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy stopnie swobody testu Welcha są zawsze niższe niż współczynnik DF testu grupowego?
Prowadzę kurs z podstaw statystyki i przeprowadzamy test t dla dwóch niezależnych próbek o nierównych wariancjach (test Welcha). W przykładach, które widziałem, skorygowane stopnie swobody zastosowane w teście Welcha są zawsze mniejsze lub równe . n1+ n2)- 2n1+n2−2n_1+n_2-2 Czy tak jest zawsze? Czy test Welcha zawsze zmniejsza (lub pozostawia niezmieniony) …

5
Jeśli nie jest Poissonem, to co to za dystrybucja?
Mam zestaw danych zawierający liczbę działań wykonanych przez osoby w ciągu 7 dni. Konkretne działanie nie powinno być istotne dla tego pytania. Oto kilka statystyk opisowych dla zestawu danych: RangeMeanVarianceNumber of observations0−77218.22791696Range0−772Mean18.2Variance2791Number of observations696 \begin{array}{|c|c|} \hline \text{Range} & 0 - 772 \\ \hline \text{Mean} & 18.2 \\ \hline \text{Variance} & …

1
Rao-Blackwellization sekwencyjnych filtrów Monte Carlo
W zasadniczym artykule „Rao-Blackwellised Particle Filtering for Dynamic Bayesian Networks” A. Douceta i in. glin. zaproponowano sekwencyjny filtr Monte Carlo (filtr cząstek), który wykorzystuje liniową podkonstrukcję w procesie Markowa x k = ( x L k , x N k ) . Przez marginalizacji tej liniowej struktury filtru może być …

3
Znaczenie zmiennych w regresji logistycznej
Prawdopodobnie mam do czynienia z problemem, który prawdopodobnie został rozwiązany sto razy wcześniej, ale nie jestem pewien, gdzie znaleźć odpowiedź. Przy użyciu regresji logistycznej, biorąc pod uwagę wiele cech i próbując przewidzieć binarną wartość kategorialną y , jestem zainteresowany wyborem podzbioru cech, który dobrze prognozuje y .x1, . . . …

2
Miary separowalności klas w problemach klasyfikacyjnych
Przykładem dobrej miary separowalności klasowej u uczących się z dyskryminacją liniową jest liniowy współczynnik dyskryminacji Fishera. Czy istnieją inne przydatne wskaźniki pozwalające ustalić, czy zestawy funkcji zapewniają dobrą separację klas między zmiennymi docelowymi? W szczególności jestem zainteresowany znalezieniem dobrych wielowymiarowych atrybutów wejściowych dla maksymalizacji separacji klas docelowych i byłoby miło …

2
Pobieranie próbek z zamianą w R randomForest
Implementacja randomForest nie pozwala na pobieranie próbek poza liczbę obserwacji, nawet w przypadku pobierania próbek z wymianą. Dlaczego to? Działa w porządku: rf <- randomForest(Species ~ ., iris, sampsize=c(1, 1, 1), replace=TRUE) rf <- randomForest(Species ~ ., iris, sampsize=3, replace=TRUE) Co chcę robić: rf <- randomForest(Species ~ ., iris, sampsize=c(51, …


2
Analiza wzbogacania według poziomu duplikacji genów
Tło biologiczne Z czasem niektóre gatunki roślin mają tendencję do powielania całych genomów, uzyskując dodatkową kopię każdego genu. Z powodu niestabilności tej konfiguracji wiele z tych genów jest następnie usuwanych, a genom układa się ponownie i stabilizuje, gotowy do powtórzenia. Te zdarzenia duplikacji są powiązane ze specjacjami i inwazjami, a …

1
System głosowania, który wykorzystuje dokładność każdego wyborcy i związaną z tym niepewność
Powiedzmy, że mamy proste pytanie „tak / nie”, na które chcemy poznać odpowiedź. I jest N głosujących na poprawną odpowiedź. Każdy wyborca ​​ma historię - listę 1 i 0, pokazującą, czy w przeszłości mieli rację, czy nie. Jeśli założymy, że historia jest rozkładem dwumianowym, możemy znaleźć średnią wydajność wyborców w …



1
Modele wielokrotne porównań mieszanych dla interakcji między predyktorem ciągłym i kategorycznym
Chciałbym użyć, lme4aby dopasować regresję efektów mieszanych i multcompobliczyć porównania parami. Mam złożony zestaw danych z wieloma ciągłymi i kategorycznymi predyktorami, ale moje pytanie można zademonstrować na podstawie wbudowanego ChickWeightzestawu danych jako przykładu: m <- lmer(weight ~ Time * Diet + (1 | Chick), data=ChickWeight, REML=F) Timejest ciągły i Dietma …

3
Jakie są założenia analizy czynnikowej?
Chcę sprawdzić, czy naprawdę zrozumiałem [klasyczną, liniową] analizę czynnikową (FA), zwłaszcza założenia przyjęte przed (i być może po) FA. Niektóre dane powinny być początkowo skorelowane i istnieje między nimi możliwa liniowa zależność. Po przeprowadzeniu analizy czynnikowej dane są zwykle rozkładane (rozkład dwuwymiarowy dla każdej pary) i nie ma korelacji między …

1
Dirichlet posterior
Mam pytanie dotyczące tylnej dystrybucji Dirichleta. Biorąc pod uwagę wielomianu funkcję wiarogodności Wiadomo, że tylny jest , gdzie jest kilka razy widzieliśmy spostrzeżenie.N I i T hD i r ( αja+ Nja)Dir(αi+Ni)Dir({\alpha_i + N_i})N.jaNiN_ijat godzithi^{th} Co się stanie, jeśli zaczniemy zmniejszać dla danych stałych ? Z formy tylnej wydaje się, …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.