Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak generować prognozy za pomocą rjagów?
Użyłem rjags do uruchomienia MCMC na modelu określonym w języku JAGS. Czy istnieje dobry sposób na wyodrębnienie tego modelu i wykonanie z nim prognoz (przy użyciu tylnych rozkładów moich parametrów)? Mogę ponownie określić model w R i podłączyć tryby moich parametrów tylnych; Zastanawiam się tylko, czy istnieje mniej zbędny sposób …
12 r  jags 

2
Automatycznie określ rozkład prawdopodobieństwa na podstawie zestawu danych
Podany zestaw danych: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. Chciałbym określić najbardziej odpowiedni rozkład prawdopodobieństwa (gamma, beta, normalny, wykładniczy, Poissona, chi-kwadrat itp.) Z oszacowaniem parametrów. Jestem już świadomy pytania pod następującym linkiem, w którym rozwiązanie jest dostarczane za pomocą R: /programming/2661402/given-a-set-of-random-numbers-drawn-from-a- ciągła-jednoczynnikowa-dystrybucja-f najlepiej zaproponowane rozwiązanie jest następujące: > library(MASS) > fitdistr(x, 't')$loglik …

1
Czy istnieje związek między empirycznymi Bayesami a efektami losowymi?
Niedawno przeczytałem o empirycznym Bayesie (Casella, 1985, Wprowadzenie do empirycznej analizy danych Bayesa) i wyglądało to bardzo podobnie do modelu efektów losowych; w tym, że oba szacunki skurczyły się do średniej globalnej. Ale nie przeczytałem go do końca ... Czy ktoś ma wgląd w podobieństwo i różnice między nimi?

3
Ustal, czy proces rozproszenia ciężkiego ogona znacznie się poprawił
Obserwuję czasy przetwarzania procesu przed i po zmianie, aby dowiedzieć się, czy proces poprawił się przez zmianę. Proces poprawił się, jeśli czas przetwarzania został skrócony. Rozkład czasu przetwarzania jest gruby, dlatego porównanie na podstawie średniej nie jest rozsądne. Zamiast tego chciałbym wiedzieć, czy prawdopodobieństwo zaobserwowania krótszego czasu przetwarzania po zmianie …

1
Różnice między PROC Mixed i lme / lmer w R - stopnie swobody
Uwaga: to pytanie jest repost, ponieważ moje poprzednie pytanie musiało zostać usunięte ze względów prawnych. Porównując PROC MIXED z SAS z funkcją lmez nlmepakietu w R, natknąłem się na pewne dość mylące różnice. Mówiąc dokładniej, stopnie swobody w różnych testach różnią się między PROC MIXEDi lmezastanawiałem się, dlaczego. Zacznij od …
12 r  mixed-model  sas  degrees-of-freedom  pdf  unbiased-estimator  distance-functions  functional-data-analysis  hellinger  time-series  outliers  c++  relative-risk  absolute-risk  rare-events  regression  t-test  multiple-regression  survival  teaching  multiple-regression  regression  self-study  t-distribution  machine-learning  recommender-system  self-study  binomial  standard-deviation  data-visualization  r  predictive-models  pearson-r  spearman-rho  r  regression  modeling  r  categorical-data  data-visualization  ggplot2  many-categories  machine-learning  cross-validation  weka  microarray  variance  sampling  monte-carlo  regression  cross-validation  model-selection  feature-selection  elastic-net  distance-functions  information-theory  r  regression  mixed-model  random-effects-model  fixed-effects-model  dataset  data-mining 


2
Jak wyjaśnić różnicę między ryzykiem względnym a ryzykiem bezwzględnym?
Pewnego dnia miałem konsultację z epidemiologiem. Jest doktorem medycyny ze stopniem zdrowia publicznego w dziedzinie epidemiologii i ma dużą wiedzę statystyczną. Doradza swoim pracownikom badawczym i rezydentom oraz pomaga im w kwestiach statystycznych. Całkiem dobrze rozumie testowanie hipotez. Miała typowy problem z porównaniem dwóch grup, aby sprawdzić, czy istnieje różnica …



1
Jak wybierać zmienne w modelu regresji?
Tradycyjne podejście do wyboru zmiennych polega na znalezieniu zmiennych, które najbardziej przyczyniają się do przewidywania nowej odpowiedzi. Ostatnio dowiedziałem się o alternatywie. W modelowaniu zmiennych, które określają efekt leczenia - jak na przykład w badaniu klinicznym farmaceutyka - mówi się, że zmienna oddziałuje jakościowoz leczeniem, jeśli pozostawiając inne rzeczy naprawione, …

3
Wybór alternatywy dla regresji Poissona dla danych zliczonych w rozproszeniu
Obecnie analizuję dane z serii eksperymentów behawioralnych, które wykorzystują następującą miarę. Uczestnicy tego eksperymentu proszeni są o wybranie wskazówek, które (fikcyjne) inne osoby mogłyby wykorzystać do rozwiązania serii 10 anagramów. Uczestnicy są przekonani, że ci inni ludzie albo zyskają, albo stracą pieniądze, w zależności od ich wyników w rozwiązywaniu anagramów. …

3
Jak najlepiej komunikować niepewność?
Ogromnym problemem w przekazywaniu wyników obliczeń statystycznych mediom i opinii publicznej jest sposób komunikowania niepewności. Z pewnością większość środków masowego przekazu wydaje się lubić twardą i szybką liczbę, chociaż z wyjątkiem stosunkowo niewielkiej liczby przypadków liczby zawsze mają pewną niepewność. Jak więc my, jako statystycy (lub naukowcy opisujący pracę statystyczną), …


2
Korelowanie szeregów czasowych objętości
Rozważ następujący wykres: Czerwona linia (lewa oś) opisuje wolumen obrotu pewnymi akcjami. Niebieska linia (prawa oś) opisuje głośność wiadomości na Twitterze dla tego towaru. Na przykład 9 maja (05-09) dokonano około 1.100 milionów transakcji i 4.000 tweetów. Chciałbym obliczyć, czy istnieje korelacja między przedziałami czasowymi, tego samego dnia lub z …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.