Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Dlaczego nikt nie korzysta z bayesowskiego wielomianowego klasyfikatora Naive Bayes?
Tak więc w (nienadzorowanym) modelowaniu tekstu Latent Dirichlet Allocation (LDA) to bayesowska wersja probabilistycznej latentnej analizy semantycznej (PLSA). Zasadniczo LDA = PLSA + Dirichlet przed jego parametrami. Rozumiem, że LDA jest teraz algorytmem referencyjnym i jest zaimplementowany w różnych pakietach, podczas gdy PLSA nie powinna już być używana. Ale w …

4
Pułapki, których należy unikać podczas przekształcania danych?
Osiągnąłem silną liniową zależność między moją zmienną XXX i YYY po podwójnej transformacji odpowiedzi. Model to Y∼XY∼XY\sim X ale przekształciłem go w YX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X} poprawyR2R2R^2od .19 do .76. Najwyraźniej zrobiłem porządną operację związaną z tym związkiem. Czy ktoś może dyskutować o pułapkach takich działań, takich jak niebezpieczeństwo nadmiernych przekształceń lub …

2
Czy rozkłady próbkowania są uzasadnione do wnioskowania?
Niektórzy Bayesianie atakują wnioskowanie częstych stwierdzając, że „nie ma unikalnego rozkładu próbkowania”, ponieważ zależy to od intencji badacza (Kruschke, Aguinis i Joo, 2012, s. 733). Powiedzmy na przykład, że badacz rozpoczyna zbieranie danych, ale jego finansowanie zostało niespodziewanie zmniejszone po 40 uczestnikach. W jaki sposób zdefiniowano by tutaj rozkłady próbkowania …

1
Jak osiągnąć ściśle pozytywne prognozy?
Pracuję nad szeregiem czasowym, którego wartości są ściśle pozytywne . Pracując z różnymi modelami, w tym AR, MA, ARMA itp., Nie mogłem znaleźć łatwego sposobu na osiągnięcie ściśle pozytywnych prognoz. Używam R do robienia moich prognoz, a wszystko, co mogłem znaleźć, to Prognoza.hts {hts}, który ma dodatni parametr opisany tutaj: …

1
Jaka intuicja kryje się za wymiennymi próbkami pod hipotezą zerową?
Testy permutacyjne (zwane również testem randomizacji, testem ponownej randomizacji lub testem dokładnym) są bardzo przydatne i przydają się, gdy t-testnie jest spełnione założenie o rozkładzie normalnym wymagane na przykład i gdy transformacja wartości przez ranking test nieparametryczny, Mann-Whitney-U-testktóry prowadziłby do utraty większej ilości informacji. Jednak nie należy zapominać o jednym …
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 


2
Szacowanie ARIMA ręcznie
Próbuję zrozumieć, w jaki sposób parametry są szacowane w modelowaniu ARIMA / Box Jenkins (BJ). Niestety żadna z książek, które napotkałem, nie opisuje szczegółowo procedury szacowania, takiej jak procedura szacowania wiarygodności logarytmicznej. Znalazłem stronę internetową / materiały dydaktyczne, które były bardzo pomocne. Poniżej znajduje się równanie ze źródła wymienionego powyżej. …

4
Jak przeprowadzić regresję danych nienormalnych, które po przekształceniu pozostają nienormalne?
Mam pewne dane (158 przypadków), które pochodzą z odpowiedzi w skali Likerta na 21 pozycji kwestionariusza. Naprawdę chcę / muszę przeprowadzić analizę regresji, aby zobaczyć, które pozycje w kwestionariuszu przewidują odpowiedź na ogólny element (zadowolenie). Odpowiedzi nie są normalnie dystrybuowane (zgodnie z testami KS) i przekształciłem je pod każdym względem, …


3
Zrozumienie teorii separacji d w przyczynowych sieciach bayesowskich
Próbuję zrozumieć logikę d-separacji w przyczynowych sieciach bayesowskich. Wiem, jak działa algorytm, ale nie do końca rozumiem, dlaczego „przepływ informacji” działa zgodnie z tym, co podano w algorytmie. Na przykład na powyższym wykresie, zastanówmy się, że podano nam tylko X i nie zaobserwowano żadnej innej zmiennej. Następnie zgodnie z zasadami …

1
Jak rozumieć formułę współczynnika korelacji?
Czy ktoś może mi pomóc zrozumieć formułę korelacji Pearsona? próbka rrr = średnia z produktów standardowych punktów zmiennych i .YXXXYYY Rozumiem, dlaczego muszą znormalizować i , ale jak zrozumieć produkty obu wyników Z? YXXXYYY Ta formuła jest również nazywana „współczynnikiem korelacji produktu z momentem”, ale jakie jest uzasadnienie działania produktu? …

1
Interpretacja wykresów zmiennych LASSO
Jestem nowy w glmnetpakiecie i nadal nie jestem pewien, jak interpretować wyniki. Czy ktoś mógłby mi pomóc przeczytać poniższy wykres śledzenia? Wykres uzyskiwano, wykonując następujące czynności: library(glmnet) return <- matrix(ret.ff.zoo[which(index(ret.ff.zoo)==beta.df$date[2]), ]) data <- matrix(unlist(beta.df[which(beta.df$date==beta.df$date[2]), ][ ,-1]), ncol=num.factors) model <- cv.glmnet(data, return, standardize=TRUE) op <- par(mfrow=c(1, 2)) plot(model$glmnet.fit, "norm", label=TRUE) plot(model$glmnet.fit, …

2
Płaski, koniugatowy i hiper-priory. Czym oni są?
Obecnie czytam o Bayesian Methods in Computation Molecular Evolution autorstwa Yang. W rozdziale 5.2 mówi o priory, a konkretnie nieinformacyjne / płaskie / niejasne / rozproszone, sprzężone i hiper-priory. Może to wymagać uproszczenia, ale czy ktoś mógłby wyjaśnić po prostu różnicę między tego rodzaju priorytetami i jak to wpływa na …
15 bayesian  prior 


2
Dokładne znaczenie i porównanie między wpływowym punktem, wysokim punktem dźwigni i wartością odstającą?
Z Wikipedii Obserwacje wpływowe to te obserwacje, które mają stosunkowo duży wpływ na przewidywania modelu regresji. Z Wikipedii Punkty dźwigni to ewentualne obserwacje dokonane przy ekstremalnych lub odległych wartościach zmiennych niezależnych, tak że brak obserwacji sąsiednich oznacza, że ​​dopasowany model regresji przejdzie blisko tej konkretnej obserwacji. Dlaczego poniższe porównanie z …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.