Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Dokładność maszyny zwiększającej gradient zmniejsza się wraz ze wzrostem liczby iteracji
Eksperymentuję z algorytmem maszyny do zwiększania gradientu za pośrednictwem caretpakietu w R. Korzystając z małego zestawu danych o przyjęciach na studia, uruchomiłem następujący kod: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- "yes" ### Gradient boosting machine …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

2
Co to znaczy powiedzieć, że wydarzenie „wydarzy się w końcu”?
Rozważmy jednowymiarowy losowy spacer po liczbach całkowitych ZZ\mathbb{Z} o stanie początkowym x∈Zx∈Zx\in\mathbb{Z} : Sn=x+∑i=1nξiSn=x+∑i=1nξi\begin{equation} S_n=x+\sum^n_{i=1}\xi_i \end{equation} gdzie przyrosty ξiξi\xi_i są IID takie, że P{ξi=1}=P{ξi=−1}=12P{ξi=1}=P{ξi=−1}=12P\{\xi_i=1\}=P\{\xi_i=-1\}=\frac{1}{2} . Można udowodnić, że (1) Px{Sn reaches +1 eventually}=1Px{Sn reaches +1 eventually}=1\begin{equation} P^x{\{S_n \text{ reaches +1 eventually}\}} = 1 \end{equation} gdzie indeks dolny oznacza pozycję początkową. …

1
Zapisywanie równania matematycznego dla wielopoziomowego modelu efektów mieszanych
Pytanie CV Próbuję podać (a) szczegółową i zwięzłą matematyczną reprezentację modelu efektów mieszanych. Korzystam z lme4pakietu w języku R. Jaka jest prawidłowa reprezentacja matematyczna dla mojego modelu? Dane, pytanie naukowe i kod R. Mój zestaw danych składa się z gatunków w różnych regionach. Testuję, czy występowanie gatunku zmienia się w …

2
Czym ABC i MCMC różnią się w swoich aplikacjach?
O ile mi wiadomo, przybliżone obliczenia bayesowskie (ABC) i łańcuch Markowa Monte Carlo (MCMC) mają bardzo podobne cele. Poniżej opisuję moje rozumienie tych metod oraz sposób, w jaki postrzegam różnice w ich zastosowaniu do rzeczywistych danych. Przybliżone obliczenia bayesowskie ABC polega na pobraniu próbek parametru θθ\theta z poprzedniego poprzez symulację …

2
Próbkowanie z niewłaściwej dystrybucji (przy użyciu MCMC i innych)
Moje podstawowe pytanie brzmi: w jaki sposób próbowałbyś z niewłaściwej dystrybucji? Czy sens ma nawet próbkowanie z niewłaściwej dystrybucji? Komentarz Xi'ana tutaj w pewnym sensie odpowiada na pytanie, ale szukałem więcej szczegółów na ten temat. Bardziej specyficzne dla MCMC: Mówiąc o MCMC i czytając artykuły, autorzy podkreślają, że uzyskali prawidłowe …

1
Jakie są dobre pytania do rozmowy kwalifikacyjnej dla kandydatów na programistów algorytmów statystycznych?
Przeprowadzam wywiady z ludźmi na temat stanowiska programisty / badacza algorytmów w kontekście statystyki / uczenia maszynowego / eksploracji danych. Szukam pytań, które należy zadać, aby określić, w szczególności znajomość, zrozumienie i płynność kandydata z podstawową teorią, np. Podstawowe właściwości oczekiwania i wariancji, niektóre typowe rozkłady itp. Moje bieżące pytanie …

2
Prognozy z modelu BSTS (w R) zawodzą całkowicie
Po przeczytaniu tego postu na blogu o Bayesowskich modelach strukturalnych szeregów czasowych, chciałem spojrzeć na wdrożenie tego w kontekście problemu, w którym wcześniej korzystałem z ARIMA. Mam pewne dane z niektórymi znanymi (ale hałaśliwymi) komponentami sezonowymi - z pewnością są to komponenty roczne, miesięczne i tygodniowe, a także pewne efekty …
15 r  time-series  bayesian  mcmc  bsts 


2
Błąd braku torby sprawia, że ​​CV w Losowych lasach nie jest konieczne?
Jestem całkiem nowy w losowych lasach. W przeszłości zawsze porównywałem dokładność dopasowania vs test z dopasowaniem vs pociągiem, aby wykryć przeregulowanie. Ale właśnie przeczytałem tutaj, że: „W losowych lasach nie ma potrzeby weryfikacji krzyżowej ani oddzielnego zestawu testowego, aby uzyskać obiektywne oszacowanie błędu zestawu testowego. Jest ono szacowane wewnętrznie podczas …


3
Szacowanie prawdopodobieństwa w procesie Bernoulliego poprzez próbkowanie aż do 10 awarii: czy jest on stronniczy?
Załóżmy, że mamy proces Bernoulliego z prawdopodobieństwem uszkodzenia qqq (który będzie mały, powiedzmy, q≤0.01q≤0.01q \leq 0.01 ), z którego próbkujemy, aż napotkamy 101010 uszkodzeń. W ten sposób, że oszacowania prawdopodobieństwa awarii jak q : = 10 / N , gdzie N jest liczbą próbek.q^:=10/Nq^:=10/N\hat{q}:=10/NNNN Pytanie : Czy q stronniczy oszacowanie …

5
Różnice statystyczne w dwóch formatach kwalifikacyjnych Formuły 1
Właśnie przeczytałem ten artykuł BBC na temat formatu kwalifikacji w Formule 1. Organizatorzy chcą, aby kwalifikacje były mniej przewidywalne, tj. Aby zwiększyć zmienność statystyczną wyniku. Przeglądając kilka nieistotnych szczegółów, w tej chwili kierowcy są klasyfikowani według najlepszego pojedynczego okrążenia z (konkretnie) dwóch prób. Jeden szef F1, Jean Todt, zaproponował, że …
15 variance 

1
Dlaczego ta regresja NIE zawodzi z powodu doskonałej wielokoliniowości, chociaż jedna zmienna jest liniową kombinacją innych?
Dzisiaj bawiłem się małym zestawem danych i wykonałem prostą regresję OLS, która, jak się spodziewałem, zawiodła z powodu doskonałej wielokoliniowości. Jednak tak się nie stało. Oznacza to, że moje rozumienie wielokoliniowości jest błędne. Moje pytanie brzmi: gdzie się mylę? Myślę, że mogę pokazać, że jedna z moich zmiennych jest liniową …

2
Jeśli „Błąd standardowy” i „Przedziały ufności” mierzą precyzję pomiaru, to jakie są pomiary dokładności?
W książce „Biostatystyka manekinów” na stronie 40 czytam: Błąd standardowy (w skrócie SE) jest jednym ze sposobów wskazania, jak dokładna jest twoja ocena lub pomiar czegoś. i Przedziały ufności stanowią kolejny sposób na wskazanie dokładności oszacowania lub pomiaru czegoś. Ale nie ma nic, co wskazywałoby na dokładność pomiaru. Pytanie: Jak …

2
Kiedy przestać udoskonalać model?
Przez ostatnie 3 lata studiowałem statystyki z wielu książek, a dzięki tej stronie wiele się nauczyłem. Niemniej jedno fundamentalne pytanie wciąż pozostaje dla mnie bez odpowiedzi. Może mieć bardzo prostą lub bardzo trudną odpowiedź, ale wiem na pewno, że wymaga dogłębnego zrozumienia statystyki. Przy dopasowywaniu modelu do danych, czy to …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.