Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Krzyżowa walidacja GAM w celu przetestowania błędu prognozowania
Moje pytania dotyczą GAM w pakiecie mgcv R. Ze względu na niewielki rozmiar próbki chcę określić błąd prognozy za pomocą weryfikacji krzyżowej z pominięciem jednego z nich. Czy to rozsądne? Czy istnieje pakiet lub kod, jak to zrobić? errorest()Funkcja w IPRED pakietu nie działa. Prosty testowy zestaw danych to: library(mgcv) …
10 r  cross-validation  gam  mgcv 

1
Obliczanie przedziałów predykcji podczas korzystania z weryfikacji krzyżowej
Czy szacunkowe odchylenia standardowe są obliczane za pomocą: sN.=1N.∑N.i = 1(xja-x¯¯¯)2)-------------√.sN.=1N.∑ja=1N.(xja-x¯)2). s_N = \sqrt{\frac{1}{N} \sum_{i=1}^N (x_i - \overline{x})^2}. ( http://en.wikipedia.org/wiki/Standard_deviation#Sample_standard_deviation ) dla dokładności prognoz z 10-krotnej walidacji krzyżowej? Obawiam się, że dokładność prognozy obliczana między poszczególnymi zakładkami zależy od znacznego nakładania się zestawów treningowych (chociaż zestawy prognoz są niezależne). Wszelkie …

4
Wariancja rezystorów równolegle
Załóżmy, że masz zestaw rezystorów R, z których wszystkie są rozmieszczone ze średnią μ i wariancją σ. Rozważ odcinek obwodu o następującym układzie: (r) || (r + r) || (r + r + r). Równoważny opór każdej części to r, 2r i 3r. Wariancja każdej sekcji wynosiłaby wtedy σ2σ2σ^2 , …


3
Jak znaleźć podobieństwa między szeregami czasowymi?
W poniższym przykładzie mam ramkę danych, która składa się z szeregu czasowego pomiarów temperatury wody zarejestrowanych na 5 głębokościach w oceanie, gdzie każda wartość Tempodpowiada dacie DateTimei głębokości Depth. set.seed(1) Temp <- rnorm(43800,sd=20) AirT <- rnorm(8760,sd=20) Depth <- c(1:5) DateTime = seq(from=as.POSIXct("2010-01-01 00:00"), to=as.POSIXct("2010-12-31 23:00"), length=8760) Time <- as.POSIXct(DateTime, format …

3
Możliwy zakres
Załóżmy, że są to trzy szeregi czasowe, , iX1X1X_1X2X2X_2YYY Działa zwykły regresję liniową w ~ ( ), otrzymujemy . Zwyczajne regresji liniowej ~ uzyskać . Załóżmy, żeYYYX1X1X_1Y=bX1+b0+ϵY=bX1+b0+ϵY = b X_1 + b_0 + \epsilonR2=UR2=UR^2 = UYYYX2X2X_2R2=VR2=VR^2 = VU&lt;VU&lt;VU < V Jakie są minimalne i maksymalne możliwe wartości przy regresji ~ …

1
Jak uzyskać prognozę dla określonej zmiennej w WinBUGS?
Jestem nowym użytkownikiem WinBUGS i mam jedno pytanie do twojej pomocy. Po uruchomieniu następującego kodu uzyskałem parametry beta0through beta4(statystyki, gęstość), ale nie wiem, jak uzyskać prognozę ostatniej wartości h, którą ustawiłem NAdo modelowania w kodzie. Czy ktoś może mi podpowiedzieć? Wszelkie porady będą mile widziane. model { for(i in 1: …

2
Znaczenie standardowych błędów 2.04? Znacząco różne sposoby, kiedy przedziały ufności często się pokrywają?
Zdjęcie poniżej pochodzi z tego artykułu w Psychological Science . Kolega wskazał na dwie niezwykłe rzeczy: Zgodnie z podpisem paski błędów pokazują „błędy standardowe ± 2,04, przedział ufności 95%”. Widziałem tylko ± 1,96 SE używanego dla 95% CI i nie mogę znaleźć niczego na temat używania 2.04 SE do jakiegokolwiek …

2
Regresja procesu Gaussa dla zestawów danych wielowymiarowych
Chciałem tylko sprawdzić, czy ktoś ma jakiekolwiek doświadczenie w stosowaniu regresji procesu Gaussa (GPR) w zestawach danych o dużych wymiarach. Zajmuję się niektórymi z różnych rzadkich metod GPR (np. Rzadkie pseudo-wejściowe GPR), aby zobaczyć, co może zadziałać w przypadku zestawów danych o dużych wymiarach, w których wybór cech jest idealnie …

1
Czy dopuszczalne jest uruchomienie dwóch modeli liniowych na tym samym zestawie danych?
Czy w przypadku regresji liniowej z wieloma grupami (grupy naturalne zdefiniowane z góry) dopuszczalne jest uruchomienie dwóch różnych modeli na tym samym zbiorze danych, aby odpowiedzieć na dwa następujące pytania? Czy każda grupa ma niezerowe nachylenie i niezerowe przechwytywanie i jakie są parametry dla każdej regresji wewnątrz grupy? Czy istnieje …


4
Jak mogę obliczyć Pearsona
Wskaźnik prawdopodobieństwa (inaczej dewiacja) Statystyka i test braku dopasowania (lub dobroci dopasowania) jest dość prosty do uzyskania dla modelu regresji logistycznej (dopasowanie przy użyciu funkcji) w R. Jednak może być łatwe jest, aby niektóre liczby komórek były wystarczająco niskie, aby test był niewiarygodny. Jednym ze sposobów weryfikacji wiarygodności testu współczynnika …

1
R regresja liniowa zmienna kategorialna „ukryta” wartość
To tylko przykład, na który natknąłem się kilka razy, więc nie mam żadnych przykładowych danych. Uruchamianie modelu regresji liniowej w R: a.lm = lm(Y ~ x1 + x2) x1jest zmienną ciągłą. x2jest kategoryczny i ma trzy wartości, np. „Niska”, „Średnia” i „Wysoka”. Jednak dane wyjściowe podane przez R byłyby mniej …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

1
Na jakie problemy należy zwrócić uwagę przy łączeniu wielu szeregów czasowych?
Powiedzmy, że mam szereg szeregów czasowych, np. Kilka rekordów temperatury z różnych stacji w regionie. Chcę uzyskać pojedynczy rekord temperatury dla całego regionu, z którym mógłbym opisać aspekty klimatu regionalnego. Intuicyjnym podejściem może być po prostu uśrednianie wszystkich stacji w każdym czasie, ale mój statystyczny zmysł pająka (z którym zdecydowanie …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.