Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jakiego testu statystycznego użyć do testu A / B?
Mamy dwie kohorty po 1000 próbek każda. Mierzymy 2 wielkości dla każdej kohorty. Pierwszy to zmienna binarna. Druga to liczba rzeczywista, która następuje po rozkładzie ciężkiego ogona. Chcemy ocenić, która grupa najlepiej sprawdza się w przypadku każdej metryki. Do wyboru jest wiele testów statystycznych: ludzie sugerują test z, inni używają …
12 ab-test 

3
Wykładnicza górna granica
Załóżmy, że mamy losowe zmienne IID z rozkładem . Będziemy obserwować próbkę „s w następujący sposób: niech być niezależny zmiennymi losowymi, załóżmy, że wszystkie ” S i „s są niezależne i określają wielkość próby . W „s wskazują, które z ” s są w próbce, i chcemy studiować część sukcesów …

1
Dlaczego nie zawsze używać elementów CI bootstrap?
Zastanawiałem się, jak CI bootstrap (i BCa w układzie dwubiegunowym) działają na normalnie dystrybuowanych danych. Wydaje się, że dużo pracy analizuje ich wydajność w różnych typach dystrybucji, ale nie można znaleźć niczego w normalnie dystrybuowanych danych. Ponieważ najpierw wydaje się rzeczą oczywistą studiowanie, przypuszczam, że dokumenty są po prostu za …

3
Jak znormalizować dane o nieznanej dystrybucji
Staram się znaleźć najbardziej odpowiedni charakterystyczny rozkład danych z powtarzanych pomiarów określonego rodzaju. Zasadniczo w mojej gałęzi geologii często używamy datowania radiometrycznego minerałów z próbek (kawałków skały), aby dowiedzieć się, jak dawno temu wydarzenie miało miejsce (skała schłodziła się poniżej temperatury progowej). Zazwyczaj z każdej próbki zostanie wykonanych kilka (3-10) …

1
Model Lmer nie jest zbieżny
Moje dane są opisane tutaj Co może powodować, że „Model błędu () jest pojedynczym błędem” w aov przy dopasowywaniu ANOVA z powtarzanymi pomiarami? Próbuję zobaczyć efekt interakcji przy użyciu, lmerwięc mój podstawowy przypadek to: my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) my.model <- lmer(value ~ Condition*Scenario+ (1|Player)+(1|Trial), …
12 r  lme4-nlme 

5
Jak wykonać przypisanie wartości w bardzo dużej liczbie punktów danych?
Mam bardzo duży zestaw danych i brakuje około 5% wartości losowych. Te zmienne są ze sobą skorelowane. Poniższy przykładowy zestaw danych R jest tylko zabawkowym przykładem z fałszywymi skorelowanymi danymi. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- paste ("M", …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 



1
Raportowanie wyników liniowego modelu efektów mieszanych
Liniowe modele efektów mieszanych nie są powszechnie stosowane w moim kącie biologii i muszę zgłosić test statystyczny, którego użyłem w artykule, który próbuję napisać. Wiem, że świadomość modelowania wielopoziomowego zaczyna pojawiać się w niektórych obszarach nauk biologicznych ( Rozwiązanie zależności: używanie analizy wielopoziomowej w celu dostosowania danych zagnieżdżonych ), ale …

2
Interpretacja macierzy wariancji-kowariancji
Załóżmy, że mamy model liniowy Model1i vcov(Model1)daje następującą macierz: (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 W tym przykładzie, co faktycznie wyświetla ta macierz? Jakie założenia możemy bezpiecznie przyjąć dla naszego modelu i …

2
Dlaczego ta dystrybucja jest jednolita?
Badamy bayesowskie testy statystyczne i natrafiliśmy na dziwne (przynajmniej dla mnie) zjawisko. Rozważ następujący przypadek: interesuje nas pomiar, która populacja, A lub B, ma wyższy współczynnik konwersji. Dla kontroli poczytalności ustawiamy , to znaczy prawdopodobieństwo konwersji jest równe w obu grupach. Generujemy sztuczne dane przy użyciu modelu dwumianowego, np.pA=pBpA=pBp_A = …

1
Jak wykonać test ładowania początkowego, aby porównać średnie z dwóch próbek?
Mam dwie mocno wypaczone próbki i próbuję użyć ładowania początkowego w celu porównania ich średnich za pomocą statystyki t. Jaka jest poprawna procedura, aby to zrobić? Proces, którego używam Niepokoi mnie właściwość zastosowania standardowego błędu oryginalnych / zaobserwowanych danych w ostatnim etapie, gdy wiem, że nie jest to normalnie rozpowszechniane. …

2
Kwadratowa ocena inteligencji i określenie zwycięzcy
Istnieje podcast NPR o nazwie Intelligence Squared. Każdy odcinek jest transmisją debaty na żywo na temat kontrowersyjnego stwierdzenia, takiego jak „Druga poprawka nie ma już znaczenia” lub „Akcja afirmatywna na kampusach uniwersyteckich wyrządza więcej szkody niż pożytku”. Debata czterech przedstawicieli - dwóch za wnioskiem i dwóch przeciw. Aby ustalić, która …
12 bayesian  rating 

2
Sprawdzanie resztek normalności w uogólnionych modelach liniowych
W pracy wykorzystano uogólnione modele liniowe (zarówno dwumianowe, jak i ujemne dwumianowe rozkłady błędów) do analizy danych. Ale w sekcji metod analizy statystycznej znajduje się następujące stwierdzenie: ... i po drugie poprzez modelowanie danych obecności za pomocą modeli regresji logistycznej oraz danych czasu poszukiwania za pomocą uogólnionego modelu liniowego (GLM). …

1
Jak szkolić HMM do klasyfikacji?
Rozumiem więc, że kiedy trenujesz HMM do klasyfikacji, standardowe podejście to: Rozdziel swoje zestawy danych na zestawy danych dla każdej klasy Wytrenuj jeden HMM na klasę Na zestawie testowym porównaj prawdopodobieństwo każdego modelu w celu sklasyfikowania każdego okna Ale jak mam trenować HMM w każdej klasie? Czy po prostu łączę …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.