Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jaka jest hipoteza NULL dla interakcji w dwustronnej ANOVA?
Powiedzmy, że mamy dwa czynniki (A i B), każdy z dwoma poziomami (A1, A2 i B1, B2) i zmienną odpowiedzi (y). Podczas wykonywania dwukierunkowej ANOVA typu: y~A+B+A*B Testujemy trzy hipotezy zerowe: Nie ma różnicy w średnich współczynnika A. Nie ma różnicy w średnich ze współczynnika B. Nie ma interakcji między …

4
Algorytmy Metropolis-Hastings stosowane w praktyce
Czytałem dziś blog Christiana Roberta i całkiem podobał mi się nowy algorytm Metropolis-Hastings, o którym rozmawiał. Wydawało się proste i łatwe do wdrożenia. Ilekroć koduję MCMC, mam tendencję do trzymania się bardzo podstawowych algorytmów MH, takich jak niezależne ruchy lub losowe spacery na skali dziennika. Z jakich algorytmów MH ludzie …

3
Jaka jest suma kwadratowych zmiennych t?
Niech zostanie narysowany na podstawie rozkładu t Studenta z stopniami swobody, dla średniej wielkości (powiedzmy mniej niż 100). Zdefiniuj Czy rozłożone prawie jak chi-kwadrat o stopniach swobody? Czy istnieje coś takiego jak Centralne Twierdzenie Graniczne dla sumy kwadratowych zmiennych losowych?titit_innnnnnT=∑1≤i≤kt2iT=∑1≤i≤kti2T = \sum_{1\le i \le k} t_i^2TTTkkk

2
Dostosowanie do zmiennych towarzyszących w analizie krzywej ROC
To pytanie dotyczy oceny wyników granicznych w wielowymiarowym kwestionariuszu przesiewowym w celu przewidzenia binarnego punktu końcowego w obecności skorelowanych skal. Zapytano mnie o zainteresowanie kontrolowaniem powiązanych wyników przy opracowywaniu punktów odcięcia dla każdego wymiaru skali pomiarowej (cechy osobowości), które mogłyby być wykorzystane do badań alkoholizmu. Oznacza to, że w tym …
20 epidemiology  roc 

6
Dobry zasób, aby zrozumieć ANOVA i ANCOVA?
Prowadzę eksperymenty na papierze i szukam interesującej książki / strony internetowej, aby właściwie zrozumieć, jak działają ANOVA i ANCOVA. Mam dobre doświadczenie matematyczne, więc niekoniecznie potrzebuję wulgarnych wyjaśnień. Chciałbym również wiedzieć, jak ustalić, kiedy użyć ANOVA zamiast ANCOVA.

3
Jak połączyć przedziały ufności dla komponentu wariancji modelu z efektami mieszanymi, gdy używana jest wielokrotna imputacja
Logiką wielokrotnej imputacji (MI) jest przypisywanie brakujących wartości nie jeden raz, ale kilka razy (zwykle M = 5) razy, co skutkuje M zakończonymi zestawami danych. M zakończonych zestawów danych jest następnie analizowanych metodami kompletnych danych, na podstawie których szacunki M i ich błędy standardowe są łączone przy użyciu wzorów Rubina …

3
Stosujesz „sztuczkę jądra” do metod liniowych?
Trik jądro jest stosowana w kilku modelach uczenia maszynowego (np SVM ). Po raz pierwszy został wprowadzony w artykule „Teoretyczne podstawy metody funkcji potencjalnej w uczeniu się rozpoznawania wzorców” w 1964 r. Definicja wikipedia mówi, że tak sposób zastosowania algorytmu klasyfikatora liniowego do rozwiązania problemu nieliniowego poprzez odwzorowanie pierwotnych obserwacji …

14
Oprogramowanie do łatwej, ale niezawodnej eksploracji danych
W moich próbach walki z chaosem w arkuszach kalkulacyjnych często ewangelicznie staram się uzyskać bardziej niezawodne narzędzia, takie jak prawdziwe oprogramowanie statystyczne (R, Stata i tym podobne). Ostatnio zostałem zakwestionowany przez ten pogląd przez kogoś, kto stanowczo stwierdził, że po prostu nie nauczy się programować. Chciałbym zapewnić im narzędzia do …


6
Czy mój meteorolog jest dokładny?
Pytanie, które martwiło mnie przez jakiś czas, na które nie wiem jak odpowiedzieć: Każdego dnia mój meteorolog daje procentową szansę na deszcz (załóżmy, że obliczono go na 9000 cyfr i nigdy nie powtórzył żadnej liczby). Każdego dnia pada albo nie pada. Mam lata danych - procent szans względem deszczu czy …


5
Kiedy można użyć kryteriów opartych na danych, aby określić model regresji?
Słyszałem, że gdy wiele specyfikacji modelu regresji (powiedzmy w OLS) jest rozważanych jako możliwości zestawu danych, powoduje to wiele problemów z porównaniem, a wartości p i przedziały ufności nie są już wiarygodne. Jednym z ekstremalnych przykładów jest regresja stopniowa. Kiedy mogę użyć samych danych, aby pomóc w określeniu modelu, a …

4
Jakie są prawidłowe wartości precyzji i przywołania w przypadkach krawędzi?
Precyzja jest zdefiniowana jako: p = true positives / (true positives + false positives) Czy jest to prawidłowe, że, jak true positivesi false positivespodejście 0, precyzja zbliża 1? To samo pytanie do przypomnienia: r = true positives / (true positives + false negatives) Obecnie wdrażam test statystyczny, w którym muszę …
20 precision-recall  data-visualization  logarithm  references  r  networks  data-visualization  standard-deviation  probability  binomial  negative-binomial  r  categorical-data  aggregation  plyr  survival  python  regression  r  t-test  bayesian  logistic  data-transformation  confidence-interval  t-test  interpretation  distributions  data-visualization  pca  genetics  r  finance  maximum  probability  standard-deviation  probability  r  information-theory  references  computational-statistics  computing  references  engineering-statistics  t-test  hypothesis-testing  independence  definition  r  censoring  negative-binomial  poisson-distribution  variance  mixed-model  correlation  intraclass-correlation  aggregation  interpretation  effect-size  hypothesis-testing  goodness-of-fit  normality-assumption  small-sample  distributions  regression  normality-assumption  t-test  anova  confidence-interval  z-statistic  finance  hypothesis-testing  mean  model-selection  information-geometry  bayesian  frequentist  terminology  type-i-and-ii-errors  cross-validation  smoothing  splines  data-transformation  normality-assumption  variance-stabilizing  r  spss  stata  python  correlation  logistic  logit  link-function  regression  predictor  pca  factor-analysis  r  bayesian  maximum-likelihood  mcmc  conditional-probability  statistical-significance  chi-squared  proportion  estimation  error  shrinkage  application  steins-phenomenon 

5
Post-hocs dla testów przedmiotowych?
Jaka jest preferowana metoda przeprowadzania post-hoców w ramach testów przedmiotowych? Widziałem opublikowane prace, w których stosuje się HSD Tukeya, ale przegląd Keppela i Maxwella i Delaneya sugeruje, że prawdopodobne naruszenie kulistości w tych projektach powoduje, że termin błędu jest niepoprawny, a takie podejście jest problematyczne. Maxwell i Delaney podają podejście …

4
Czy model jest dopasowany do danych, czy dane są dopasowane do modelu?
Czy istnieje różnica koncepcyjna lub proceduralna między dopasowaniem modelu do danych a dopasowaniem danych do modelu? Przykład pierwszego sformułowania można znaleźć w https://courses.washington.edu/matlab1/ModelFitting.html , a drugiego w https://reference.wolfram.com/applications/eda/FittingDataToLinearModelsByLeast-SquaresTechniques.html .

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.