Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Jakie są niebezpieczeństwa związane z naruszeniem założenia homoscedastyczności dla regresji liniowej?
Jako przykład rozważmy ChickWeightzestaw danych w R. Wariancja oczywiście rośnie z czasem, więc jeśli użyję prostej regresji liniowej, takiej jak: m <- lm(weight ~ Time*Diet, data=ChickWeight) Moje pytania: Które aspekty modelu będą wątpliwe? Czy problemy ograniczają się do ekstrapolacji poza tym Timezakresem? Jak tolerancyjna jest regresja liniowa na naruszenie tego …

4
Miary podobieństwa lub odległości między dwiema macierzami kowariancji
Czy są jakieś miary podobieństwa lub odległości między dwiema symetrycznymi macierzami kowariancji (obie o tych samych wymiarach)? Mam tu na myśli analogie do dywergencji KL dwóch rozkładów prawdopodobieństwa lub odległości euklidesowej między wektorami, z wyjątkiem zastosowanych do macierzy. Wyobrażam sobie, że byłoby całkiem sporo pomiarów podobieństwa. Idealnie chciałbym również przetestować …

3
Co oznaczają „niezależne obserwacje”?
Próbuję zrozumieć, co oznacza założenie niezależnych obserwacji . Niektóre definicje to: „Dwa zdarzenia są niezależne wtedy i tylko wtedy, gdy .” ( Słownik terminów statystycznych )P(a∩b)=P(a)∗P(b)P.(za∩b)=P.(za)∗P.(b)P(a \cap b) = P(a) * P(b) „wystąpienie jednego zdarzenia nie zmienia prawdopodobieństwa innego” ( Wikipedia ). „pobieranie próbek z jednej obserwacji nie wpływa na …


6
Jakie są interesujące i dobrze napisane artykuły dotyczące statystyki stosowanej?
Jakie są dobre artykuły opisujące zastosowania statystyk, które byłyby zabawne i pouczające? Żeby było jasne, tak naprawdę nie szukam prac opisujących nowe metody statystyczne (np. Artykuł o regresji kątowej), ale raczej prac opisujących sposoby rozwiązywania rzeczywistych problemów. Na przykład jeden papier, który pasowałby do tego, czego szukam, to papier klimatyczny …

1
Co kryje się za interfejsem API Google Prediction?
Google Prediction API to usługa w chmurze, w której użytkownik może przesłać dane szkoleniowe, aby wyszkolić tajemniczego klasyfikatora, a następnie poprosić go o klasyfikację danych przychodzących, na przykład w celu wdrożenia filtrów spamu lub przewidzenia preferencji użytkownika. Ale co jest za kulisami?

1
Obliczanie powtarzalności efektów z modelu Lmer
Właśnie natknąłem się na ten artykuł , który opisuje, jak obliczyć powtarzalność (aka niezawodność, aka korelacja wewnątrzklasowa) pomiaru za pomocą modelowania efektów mieszanych. Kod R byłby następujący: #fit the model fit = lmer(dv~(1|unit),data=my_data) #obtain the variance estimates vc = VarCorr(fit) residual_var = attr(vc,'sc')^2 intercept_var = attr(vc$id,'stddev')[1]^2 #compute the unadjusted repeatability …
28 mixed-model  reliability  intraclass-correlation  repeatability  spss  factor-analysis  survey  modeling  cross-validation  error  curve-fitting  mediation  correlation  clustering  sampling  machine-learning  probability  classification  metric  r  project-management  optimization  svm  python  dataset  quality-control  checking  clustering  distributions  anova  factor-analysis  exponential  poisson-distribution  generalized-linear-model  deviance  machine-learning  k-nearest-neighbour  r  hypothesis-testing  t-test  r  variance  levenes-test  bayesian  software  bayesian-network  regression  repeated-measures  least-squares  change-scores  variance  chi-squared  variance  nonlinear-regression  regression-coefficients  multiple-comparisons  p-value  r  statistical-significance  excel  sampling  sample  r  distributions  interpretation  goodness-of-fit  normality-assumption  probability  self-study  distributions  references  theory  time-series  clustering  econometrics  binomial  hypothesis-testing  variance  t-test  paired-comparisons  statistical-significance  ab-test  r  references  hypothesis-testing  t-test  normality-assumption  wilcoxon-mann-whitney  central-limit-theorem  t-test  data-visualization  interactive-visualization  goodness-of-fit 

7
Jak generować liczby na podstawie arbitralnej dystrybucji dyskretnej?
Jak generować liczby na podstawie dowolnego dyskretnego rozkładu? Na przykład mam zestaw liczb, które chcę wygenerować. Powiedzmy, że są oznaczone od 1-3 w następujący sposób. 1: 4%, 2: 50%, 3: 46% Zasadniczo odsetki to prawdopodobieństwa, że ​​pojawią się na wyjściu generatora liczb losowych. Mam generator liczb pesudorandom, który wygeneruje jednolity …

3
Obliczanie wartości p za pomocą bootstrap z R
Korzystam z pakietu „boot”, aby obliczyć przybliżoną 2-stronną wartość p ładowania początkowego, ale wynik jest zbyt daleko od wartości p użycia t.test. Nie mogę zrozumieć, co zrobiłem źle w moim kodzie R. Czy ktoś może mi dać na to wskazówkę time = c(14,18,11,13,18,17,21,9,16,17,14,15, 12,12,14,13,6,18,14,16,10,7,15,10) group=c(rep(1:2, each=12)) sleep = data.frame(time, group) …




6
Problemy z wykresami kołowymi
Wydaje się, że rośnie liczba dyskusji na temat wykresów kołowych. Głównymi argumentami przeciwko temu wydają się: Obszar jest postrzegany z mniejszą mocą niż długość. Wykresy kołowe mają bardzo niski stosunek danych do punktu pikseli Myślę jednak, że mogą one być w jakiś sposób przydatne przy przedstawianiu proporcji. Zgadzam się używać …



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.