Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Prognozowanie tematu przy użyciu ukrytego przydziału Dirichleta
Użyłem LDA do zbioru dokumentów i znalazłem kilka tematów. Wynikiem mojego kodu są dwie macierze zawierające prawdopodobieństwa; jedno prawdopodobieństwo doc-temat i drugie prawdopodobieństwo słowo-temat. Ale tak naprawdę nie wiem, jak wykorzystać te wyniki do przewidzenia tematu nowego dokumentu. Korzystam z próbkowania Gibbs. Czy ktoś wie jak? dzięki

1
Wzmacnianie i pakowanie drzew (XGBoost, LightGBM)
Istnieje wiele postów na blogach, filmów na YouTube itp. O pomysłach spakowania lub ulepszenia drzew. Z mojego ogólnego zrozumienia wynika, że ​​pseudo kod dla każdego z nich to: Parcianka: Weź N losowych próbek x% próbek i y% funkcji Dopasuj swój model (np. Drzewo decyzyjne) do każdego z N Przewiduj z …

5
Jaka jest różnica między prognozami „poza próbą” i „poza próbą”?
Nie rozumiem, jaka dokładnie jest różnica między prognozami „w próbie” i „poza próbą”? Prognoza w próbie wykorzystuje podzbiór dostępnych danych do prognozowania wartości poza okresem szacowania. Prognoza poza próbą wykorzystuje zamiast tego wszystkie dostępne dane. Czy są one prawidłowe ? Bardzo dokładnie, czy następująca definicja jest poprawna? Prognoza wewnątrz próby …

2
Jak stosować porządkową regresję logistyczną z efektami losowymi?
W moim badaniu będę mierzyć obciążenie pracą za pomocą kilku wskaźników. Ze zmiennością tętna (HRV), aktywnością elektrodową (EDA) i ze skalą subiektywną (IWS). Po normalizacji IWS ma trzy wartości: Obciążenie pracą niższe niż normalnie Obciążenie pracą jest średnie Nakład pracy jest większy niż zwykle. Chcę zobaczyć, jak dobrze środki fizjologiczne …


2
Definicja naturalnych splajnów sześciennych do regresji
Uczę się o splajnach z książki „Elementy statystycznego uczenia się eksploracji danych, wnioskowania i prognozowania” Hastie i in. Na stronie 145 stwierdziłem, że naturalne splajny sześcienne są liniowe poza sękami granicznymi. W jest węzłów, a o takim podano w książce.KKKξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, \xi_2, ... \xi_K Pytanie 1: W jaki sposób uwolniono 4 …

2
Zrozumienie testu Kołmogorowa-Smirnowa w R.
Próbuję zrozumieć wynik funkcji testowej Kołmogorowa-Smirnowa (dwie próbki, dwustronne). Oto prosty test. x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning message: #In ks.test(x, y) : cannot compute exact …

2
Klasyfikacja ze wzmocnieniem gradientowym: Jak zachować prognozę w [0,1]
Pytanie Staram się zrozumieć, w jaki sposób prognoza jest utrzymywana w przedziale [0,1][0,1][0,1] podczas klasyfikacji binarnej z funkcją wzmocnienia gradientu. Załóżmy, że pracujemy nad problemem klasyfikacji binarnej, a naszą funkcją celu jest utrata logów, −∑yilog(Hm(xi))+(1−yi)log(1−Hm(xi))−∑yilog⁡(Hm(xi))+(1−yi)log⁡(1−Hm(xi))-\sum y_i \log(H_m(x_i)) + (1-y_i) \log(1-H_m(x_i)) , gdzie yyy jest zmienną docelową a jest naszym obecnym …

1
Jak znaleźć / oszacować funkcję gęstości prawdopodobieństwa na podstawie funkcji gęstości w R.
Załóżmy, że mam zmienną Xo nieznanym rozkładzie. W Mathematica, używając SmoothKernelDensityfunkcji, możemy mieć funkcję szacowanej gęstości. Ta szacowana funkcja gęstości może być używana wraz z PDFfunkcją do obliczania funkcji gęstości prawdopodobieństwa wartości takiej jak Xw postaci PDF[density,X]założenia, że ​​„gęstość” jest wynikiem SmoothKernelDensity. Byłoby dobrze, gdyby w R. była taka funkcja. …
17 r  pdf  cdf 

3
Jak wybrać wcześniej w estymacji parametrów bayesowskich
Znam 3 metody szacowania parametrów, ML, MAP i podejście Bayesa. A jeśli chodzi o MAP i podejście Bayesa, musimy wybrać priory dla parametrów, prawda? Powiedzmy, że mam ten model , w którym α , β są parametrami, aby dokonać oszacowania za pomocą MAP lub Bayesa, przeczytałem w książce, że lepiej …

2
Czy byłby możliwy / praktyczny losowy las o wielu wynikach?
Random Forests (RFs) to konkurencyjna metoda modelowania / wyszukiwania danych. Model RF ma jedno wyjście - zmienną wyjściową / predykcyjną. Naiwnym podejściem do modelowania wielu wyjść za pomocą RF byłoby skonstruowanie RF dla każdej zmiennej wyjściowej. Mamy więc N niezależnych modeli i tam, gdzie istnieje korelacja między zmiennymi wyjściowymi, będziemy …

2
Jak radzić sobie z błędem, takim jak „Współczynniki: 14 niezdefiniowane z powodu osobliwości” w R?
Kiedy robisz GLM i pojawia się błąd „nieokreślony z powodu osobliwości” w wyjściu anova, jak można temu przeciwdziałać? Niektórzy sugerują, że jest to spowodowane kolinearnością między zmiennymi towarzyszącymi lub że jeden z poziomów nie jest obecny w zbiorze danych (patrz: interpretacja „nieokreślony z powodu osobliwości” w lm ) Gdybym chciał …

2
Przegląd literatury na temat regresji nieliniowej
Czy ktoś zna dobry artykuł przeglądowy do literatury statystycznej na temat regresji nieliniowej? Interesują mnie przede wszystkim wyniki spójności i asymptotyki. Szczególnie interesujący jest model yit=m(xit,θ)+ϵit,yit=m(xit,θ)+ϵit,y_{it} = m(x_{it},\theta) + \epsilon_{it}, dla danych panelu. Mniej interesujące są metody nieparametryczne. Bardzo mile widziane są również sugestie dotyczące czasopism. W tej chwili czytam …



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.