Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Różne transformacje gęstości prawdopodobieństwa ze względu na czynnik jakobowski
W Bishop's Pattern Recognition and Machine Learning przeczytałem, co następuje, zaraz po wprowadzeniu gęstości prawdopodobieństwa :p(x∈(a,b))=∫bap(x)dxp(x∈(a,b))=∫abp(x)dxp(x\in(a,b))=\int_a^bp(x)\textrm{d}x Przy nieliniowej zmianie zmiennej gęstość prawdopodobieństwa przekształca się inaczej niż prosta funkcja, ze względu na czynnik jakobowski. Na przykład, jeśli weźmiemy pod uwagę zmianę zmiennych , wówczas funkcja staje się . Rozważmy teraz gęstość …

1
XGBoost może obsłużyć brakujące dane w fazie prognozowania
Niedawno sprawdziłem algorytm XGBoost i zauważyłem, że ten algorytm może obsłużyć brakujące dane (bez konieczności przypisywania) w fazie szkolenia. Zastanawiałem się, czy XGboost może obsłużyć brakujące dane (bez konieczności imputacji), gdy jest używany do prognozowania nowych obserwacji, czy konieczne jest przypisanie brakujących danych. Z góry dziękuję.

3
Losowa regresja lasu nieprzewidywalna na podstawie danych treningowych
Zauważyłem, że przy budowaniu modeli regresji losowej lasu, przynajmniej w R, przewidywana wartość nigdy nie przekracza maksymalnej wartości zmiennej docelowej widocznej w danych treningowych. Jako przykład zobacz poniższy kod. Buduję model regresji do przewidywania mpgna podstawie mtcarsdanych. Buduję OLS i losowe modele leśne i używam ich do przewidywania mpghipotetycznego samochodu, …
12 r  random-forest 

4
Bootstrap vs Monte Carlo, oszacowanie błędu
Czytam artykuł Propagacja błędów metodą Monte Carlo w obliczeniach geochemicznych, Anderson (1976) i jest coś, czego nie do końca rozumiem. Rozważmy niektóre zmierzone dane oraz program, który je przetwarza i zwraca określoną wartość. W artykule program ten służy najpierw do uzyskania najlepszej wartości za pomocą danych (tj .: ).{ A …

2
„Więzy nie powinny być obecne” w teście Kołmgorowa-Smirnowa na jednej próbce w R.
Zamierzam użyć testu Kołmogorowa-Smirnowa, aby przetestować normalność MYDATA w R. To jest przykład tego, co robię ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) Oto wynik R daje mi: data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties should not be present for the Kolmogorov-Smirnov test …

3
Lasso kontra adaptacyjny Lasso
LASSO i adaptacyjne LASSO to dwie różne rzeczy, prawda? (Dla mnie kary wyglądają inaczej, ale sprawdzam tylko, czy coś przegapiłem). Kiedy ogólnie mówisz o elastycznej siatce, to czy w specjalnym etui LASSO czy adaptacyjnym LASSO? Który robi pakiet glmnet, pod warunkiem, że wybierzesz alpha = 1? Adaptacyjny LASSO działa w …

2
Czy modele szeregów czasowych różnic log są lepsze niż stopy wzrostu?
Często widzę, że autorzy oceniają model „logarytmicznej różnicy”, np log(yt)−log(yt−1)=log(yt/yt−1)=α+βxtlog⁡(yt)−log⁡(yt−1)=log⁡(yt/yt−1)=α+βxt\log (y_t)-\log(y_{t-1}) = \log(y_t/y_{t-1}) = \alpha + \beta x_t Zgadzam się, że właściwe jest odniesienie xtxtx_t do zmiany procentowej ytyty_t podczas gdy log(yt)log⁡(yt)\log (y_t) to .I(1)I(1)I(1) Różnica logów jest jednak przybliżeniem i wydaje się, że równie dobrze można oszacować model bez …

1
Próbkowanie z rozkładu krańcowego przy użyciu rozkładu warunkowego?
Chcę próbkować z gęstości jednowymiarowej ale znam tylko związek:faXfXf_X faX( x ) = ∫faX| Y( x | y) fY( y) dy.fX(x)=∫fX|Y(x|y)fY(y)dy.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. Chcę uniknąć używania MCMC (bezpośrednio na reprezentacji całkowej), a ponieważ i są łatwe do próbkowania, myślałem o użyciu następującego próbnika :f Y ( …

3
Różnicą są statystyki podsumowujące: współczynnik Giniego i odchylenie standardowe
Istnieje kilka statystyk podsumowujących. Jeśli chcesz opisać rozkład rozkładu, możesz użyć na przykład odchylenia standardowego lub współczynnika Giniego . Wiem, że odchylenie standardowe opiera się na tendencji centralnej, tj. Odchyleniu od średniej, a współczynnik Gini to ogólny pomiar dyspersji. Wiem również, że współczynnik Giniego ma dolną i górną granicę [0 …



1
Bayesowskie modelowanie czasów oczekiwania pociągów: definicja modelu
To moja pierwsza próba, aby ktoś z obozu dla osób często odwiedzających przeprowadzał analizę danych bayesowskich. Przeczytałem kilka samouczków i kilka rozdziałów z Bayesian Data Analysis autorstwa A. Gelmana. Jako pierwszy mniej lub bardziej niezależny przykład analizy danych, który wybrałem, są czasy oczekiwania na pociąg. Zadałem sobie pytanie: jaki jest …
12 bayesian  pymc 



2
Metody rotacji czynników (varimax, oblimin, itp.) - co oznaczają nazwy i co robią metody?
Analiza czynnikowa ma kilka metod rotacji, takich jak varimax, quartimax, equamax, promax, oblimin, itp. Nie jestem w stanie znaleźć żadnych informacji, które wiązałyby ich nazwy z ich faktycznymi działaniami matematycznymi lub statystycznymi. Dlaczego nazywa się to „equa-max” lub „quarti-max”? W jaki sposób osie lub macierze są obracane, aby miały taką …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.