Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Wykorzystanie dekompozycji wartości pojedynczej do obliczenia macierzy kowariancji wariancji z modelu regresji liniowej
Mam macierz projektową regresorów p, n obserwacji i próbuję obliczyć przykładową macierz wariancji-kowariancji parametrów. Próbuję bezpośrednio obliczyć to za pomocą svd. Używam R, gdy biorę svd macierzy projektowej, otrzymuję trzy składniki: macierz która jest , macierz która jest (przypuszczalnie wartości własne), i macierz która jest . Przekątnąłem , dzięki czemu …
9 r  regression 

1
Regresja najmniejszego kąta utrzymuje korelacje monotonicznie malejące i powiązane?
Próbuję rozwiązać problem regresji najmniejszego kąta (LAR). Jest to problem, 3,23 , na stronie 97 w Hastie wsp. Elementy Statistical Learning, 2nd. wyd. (Piąty druk) . Rozważ problem regresji ze wszystkimi zmiennymi i odpowiedzią mającą średnie zero i odchylenie standardowe jeden. Załóżmy również, że każda zmienna ma identyczną absolutną korelację …

2
Ważysz system oceniania, aby faworyzować produkty ocenione wysoko przez większą liczbę osób niż produkty ocenione wysoko przez mniej osób?
Z góry dziękuję za kontakt ze mną, nie jestem żadnym statystykiem i nie wiem, jak opisać to, co sobie wyobrażam, więc Google mi tu nie pomaga ... Dołączam system oceniania do aplikacji internetowej, nad którą pracuję. Każdy użytkownik może ocenić każdy element dokładnie raz. Wyobraziłem sobie skalę z 4 wartościami: …
9 scales  rating 

2
Ocena znaczenia korelacji
Mam dwie zmienne i mogę obliczyć np. Korelację Pearsona między nimi, ale chciałbym wiedzieć coś analogicznego do tego, co dałby mi test t (tj. Pewne pojęcie o tym, jak istotna jest korelacja). Czy coś takiego istnieje?

1
Jakie są praktyczne i interpretacyjne różnice między alternatywami a regresją logistyczną?
Niedawne pytanie o alternatywy dla regresji logistycznej w R przyniosło wiele odpowiedzi, w tym losowe modele Forest, GBM, Rpart, Bayesglm i uogólnione modele addytywne. Jakie są praktyczne i interpretacyjne różnice między tymi metodami a regresją logistyczną? Jakie założenia przyjmują (lub nie przyjmują) w odniesieniu do regresji logistycznej? Czy są odpowiednie …

1
Czy powinienem ponownie przetasować swoje dane?
Mamy zestaw próbek biologicznych, których uzyskanie było dość drogie. Przekazujemy te próbki przez serię testów w celu wygenerowania danych, które są wykorzystywane do budowy modelu predykcyjnego. W tym celu podzieliliśmy próbki na zestawy szkoleniowe (70%) i testowe (30%). Z powodzeniem stworzyliśmy model i zastosowaliśmy go na zestawie testowym, aby odkryć, …

2
R: dynamicznie aktualizuj wykres [zamknięty]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 8 miesięcy temu . To jest pytanie dotyczące wizualizacji danych. Mam bazę danych, która zawiera niektóre dane, które są stale aktualizowane (aktualizacja online). Jaki jest …

1
Wielkość próby dla proporcji w powtarzanych pomiarach
Próbuję pomóc naukowcowi w opracowaniu badania dotyczącego występowania drobnoustrojów salmonelli. Chciałby porównać eksperymentalny preparat przeciwdrobnoustrojowy z chlorem (wybielaczem) na fermach drobiu. Ponieważ częstości występowania salmonelli w tle różnią się w czasie, planuje on zmierzyć% drobiu w / salmonelli przed leczeniem i po leczeniu. Zatem pomiar będzie różnicą przed / po% …

2
Nauka przyrostowa dla modelu szeregów czasowych LOESS
Obecnie pracuję nad danymi z szeregów czasowych, wiem, że mogę używać modelu LOESS / ARIMA. Dane są zapisywane w wektorze, którego długość wynosi 1000, co jest kolejką, aktualizowaną co 15 minut, W ten sposób stare dane wyskoczą, a nowe dane wepchną wektor. Mogę ponownie uruchomić cały model na harmonogramie, np. …

2
Wymuszanie zestawu liczb do gaussowskiej krzywej dzwonowej
( Odnosi się to do mojego pytania programowego dotyczącego przepełnienia stosu : algorytm gaussowski krzywej dzwonowej (Python i / lub C #) .) Na Answers.com znalazłem ten prosty przykład: Znajdź średnią arytmetyczną (średnią) => Suma wszystkich wartości w zestawie, podzielona przez liczbę elementów w zestawie Znajdź sumę kwadratów wszystkich wartości …

3
Jak ponownie próbkować szeregi czasowe XTS w R?
Mam nieregularnie rozmieszczone XTSszeregi czasowe (z POSIXctwartościami typu indeksu). Jak mogę zbudować nową serię czasową próbkowaną z, powiedzmy, 10-minutowym interwałem, ale z każdym momentem próbki dopasowanym do rundy (13:00:00, 13:10:00, 13:20:00, ...) . Jeśli moment ponownego próbkowania nie spadnie dokładnie na oryginalną wartość serii, chcę wziąć poprzednią.

4
Jakie są założenia zastosowania modelu regresji Tobit?
Moja (bardzo podstawowa) wiedza na temat modelu regresji Tobiasza nie pochodzi z klasy, tak jak wolałbym. Zamiast tego zbierałem tu i ówdzie informacje przez kilka wyszukiwań w Internecie. Moje najlepsze przypuszczenia dotyczące założeń regresji skróconej są takie, że są one bardzo podobne do zwykłych założeń dotyczących najmniejszych kwadratów (OLS). Nie …

2
Oblicz krzywą ROC dla danych
Mam więc 16 prób, w których próbuję uwierzytelnić osobę z cechy biometrycznej za pomocą Hamminga. Mój próg jest ustawiony na 3,5. Moje dane są poniżej i tylko próba 1 jest prawdziwie pozytywna: Trial Hamming Distance 1 0.34 2 0.37 3 0.34 4 0.29 5 0.55 6 0.47 7 0.47 8 …
9 mathematical-statistics  roc  classification  cross-validation  pac-learning  r  anova  survival  hazard  machine-learning  data-mining  hypothesis-testing  regression  random-variable  non-independent  normal-distribution  approximation  central-limit-theorem  interpolation  splines  distributions  kernel-smoothing  r  data-visualization  ggplot2  distributions  binomial  random-variable  poisson-distribution  simulation  kalman-filter  regression  lasso  regularization  lme4-nlme  model-selection  aic  r  mcmc  dlm  particle-filter  r  panel-data  multilevel-analysis  model-selection  entropy  graphical-model  r  distributions  quantiles  qq-plot  svm  matlab  regression  lasso  regularization  entropy  inference  r  distributions  dataset  algorithms  matrix-decomposition  regression  modeling  interaction  regularization  expected-value  exponential  gamma-distribution  mcmc  gibbs  probability  self-study  normality-assumption  naive-bayes  bayes-optimal-classifier  standard-deviation  classification  optimization  control-chart  engineering-statistics  regression  lasso  regularization  regression  references  lasso  regularization  elastic-net  r  distributions  aggregation  clustering  algorithms  regression  correlation  modeling  distributions  time-series  standard-deviation  goodness-of-fit  hypothesis-testing  statistical-significance  sample  binary-data  estimation  random-variable  interpolation  distributions  probability  chi-squared  predictor  outliers  regression  modeling  interaction 

2
Pobieranie próbek z rozkładu dwuwymiarowego o znanej gęstości za pomocą MCMC
Próbowałem symulować z dwuwymiarowej gęstości p ( x , y)p(x,y)p(x,y)używając algorytmów Metropolis w R i nie miał szczęścia. Gęstość można wyrazić jako p ( y| x)p(x)p(y|x)p(x)p(y|x)p(x), gdzie p ( x )p(x)p(x) jest dystrybucją Singh-Maddala p ( x ) =qxa - 1bza( 1 + (xb)za)1 + qp(x)=aqxa−1ba(1+(xb)a)1+qp(x)=\dfrac{aq x^{a-1}}{b^a (1 + (\frac{x}{b})^a)^{1+q}} …

2
Jak sprawdzić, czy nachylenia w modelu liniowym są równe stałej wartości?
Załóżmy, że mamy prosty model regresji liniowej Z= a X+ b YZ=aX+bYZ = aX + bY i chciałby przetestować hipotezę zerową H.0: a = b =12)H0:a=b=12H_0: a=b=\frac{1}{2} przeciwko ogólnej alternatywie. Myślę, że można użyć oszacowania i a następnie zastosować test aby uzyskać przedział ufności wokół . Czy to jest ok?za^a^\hat{a}S.mi(za^)SE(a^)SE(\hat{a})ZZZ12)12\frac{1}{2} …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.