Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Rozkłady na podzbiory ?
Zastanawiam się, czy istnieją jakieś standardowe rozkłady na podzbiorach liczb całkowitych . Równolegle możemy to wyrazić jako rozkład na wektor długości wyników binarnych, np. Jeśli to odpowiada wektorowi .{1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = 5{1,3,5}{1,3,5}\{1, 3, 5\}(1,0,1,0,1)(1,0,1,0,1)(1, 0, 1, 0, 1) Idealnie szukam jakiejś dystrybucji , pochodzącej z rodziny indeksowanej skończonym …

3
Przedziały ufności a wielkość próby?
Jestem całkowicie nowy w statystykach i zakresie przedziałów ufności. Może to być bardzo trywialne lub nawet głupie. Byłbym wdzięczny, gdybyś mógł pomóc mi zrozumieć lub wskazać mi literaturę / tekst / blog, który wyjaśnia to lepiej. Widzę na różnych serwisach informacyjnych, takich jak CNN, wiadomości Fox, Politico itp., O ich …

1
Odnośniki do statystyk dla osób dobrze zaznajomionych ze współczesną teorią prawdopodobieństwa
Biorąc pod uwagę rygorystyczne podstawy analizy i współczesną teorię prawdopodobieństwa, uważam, że statystyki bayesowskie są proste i łatwe do zrozumienia, a statystyki częstokrzyskie są niezwykle mylące i nieintuicyjne. Wydaje się, że częstokroć naprawdę robią statystyki bayesowskie, z wyjątkiem „tajnych priorów”, które nie są dobrze umotywowane ani dokładnie zdefiniowane. Z drugiej …

2
Problemy z obliczaniem, interpretacją podzestawów i ogólne pytania dotyczące procedury wyboru modelu
Chcę wybrać modele za pomocą regsubsets(). Mam ramkę danych o nazwie olympiadaten (dane przesłane: http://www.sendspace.com/file/8e27d0 ). Najpierw dołączam tę ramkę danych, a następnie zaczynam analizować, mój kod to: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty + PopTotal + …

3
Porównywanie współczynników zapadalności
Chcę porównać do częstości występowania między dwiema grupami (jedną bez choroby i drugą z). Planowałem obliczyć współczynnik częstości występowania (IRR), tj. Wskaźnik częstości występowania grupy B / wskaźnik częstości występowania grupy A, a następnie sprawdzić, czy wskaźnik ten wynosi 1, i na koniec obliczyć przedziały 95% CI dla IRR. Znalazłem …

2
Określenie największego współpracownika w grupie
Nie znam się na statystykach, więc trzymaj się mnie. Powiedzmy, że mam zestaw 1000 pracowników. Chcę dowiedzieć się, kto jest najcięższym pracownikiem, ale mogę tylko zmierzyć ilość pracy wykonywanej w grupach 1-100 w ciągu godziny pracy. Zakładając, że każdy pracownik zawsze wykonuje taką samą ilość pracy, czy w ramach dużej …

1
Rozkład błędów dla regresji liniowej i logistycznej
Przy ciągłych danych regresja liniowa zakłada, że ​​termin błędu jest rozproszony N (0, )Y=β1+β2)X2)+ uY=β1+β2X2+uY=\beta_1+\beta_2X_2+uσ2)σ2\sigma^2 1) Czy zakładamy, że Var (Y | x) jest również ~ N (0, )?σ2)σ2\sigma^2 2) Czym jest ten rozkład błędów w regresji logistycznej? Gdy dane mają postać 1 rekordu na przypadek, gdzie „Y” wynosi 1 …

1
Przedziały ufności i prognozy modelu regresji liniowej
Okej, więc próbuję zrozumieć regresję liniową. Mam zestaw danych i wszystko wygląda całkiem dobrze, ale jestem zdezorientowany. Oto moje podsumowanie modelu liniowego: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ …
9 r  regression 


3
Losowe zadanie: po co zawracać sobie głowę?
Losowe przydzielanie jest cenne, ponieważ zapewnia niezależność leczenia od potencjalnych wyników. W ten sposób prowadzi do obiektywnych oszacowań średniego efektu leczenia. Ale inne schematy przydziału mogą również systematycznie zapewniać niezależność leczenia od potencjalnych wyników. Dlaczego więc potrzebujemy losowego przydziału? Innymi słowy, jaka jest przewaga losowego przypisywania nad nielosowymi schematami przypisywania, …

1
Kontrolowanie częstotliwości fałszywych odkryć na etapach
Mam trójwymiarową tabelę o rozmiarze . Każda komórka tabeli jest testem hipotez. Krojenie tabeli w trzecim wymiarze daje zestawów testów hipotez, które są niezależne między zbiorami, ale zależą od nich. Początkowo myślałem, że mogę po prostu kontrolować współczynnik fałszywych odkryć za pomocą procedury Benjamini-Hochberg we wszystkich testach hipotez jednocześnie. Czy …

3
Jak korzystać z R gbm z dystrybucją = „adaboost”?
Dokumentacja mówi, że R gbm z rozkładem = "adaboost" może być użyty do problemu klasyfikacji 0-1. Rozważ następujący fragment kodu: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Można go znaleźć w dokumentacji prognozy.gbm Zwraca wektor prognoz. …
9 r  gbm 

4
Kiedy stosować regresję nieparametryczną?
Używam PROC GLM w SAS, aby dopasować równanie regresji o następującej formie Y=b0+b1X1+b2)X2)+b3)X3)+b4tY=b0+b1X1+b2)X2)+b3)X3)+b4t Y = b_0 + b_1X_1 + b_2X_2 + b_3X_3 + b_4t Wykres QQ powstałych czerwonych reszt wskazuje na odchylenie od normalności. Jakakolwiek transformacja nie jest przydatna w normalizacji reszt.YYY W tym momencie mogę bezpiecznie przejść do metod …

2
Dlaczego ilość wariancji wyjaśniona przez mój pierwszy komputer jest tak bliska średniej korelacji par?
Jaki jest związek między pierwszymi głównymi komponentami i średnią korelacją w macierzy korelacji? Na przykład w aplikacji empirycznej obserwuję, że średnia korelacja jest prawie taka sama jak stosunek wariancji pierwszego głównego składnika (pierwszej wartości własnej) do całkowitej wariancji (suma wszystkich wartości własnych). Czy istnieje związek matematyczny? Poniżej znajduje się wykres …

1
Jak porównać obserwowane i oczekiwane zdarzenia?
Załóżmy, że mam jedną próbkę częstotliwości 4 możliwych zdarzeń: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 i mam spodziewane prawdopodobieństwo wystąpienia moich zdarzeń: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 Dzięki sumie obserwowanych częstotliwości moich czterech zdarzeń (18) mogę obliczyć …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.