Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
AIC a walidacja krzyżowa w szeregach czasowych: przypadek małej próbki
Interesuje mnie wybór modelu w ustawieniach szeregów czasowych. Dla konkretności załóżmy, że chcę wybrać model ARMA z puli modeli ARMA o różnych rzędach opóźnień. Ostatecznym celem jest prognozowanie . Wyboru modelu można dokonać za pomocą krzyżowa walidacja, stosowanie kryteriów informacyjnych (AIC, BIC), wśród innych metod. Rob J. Hyndman zapewnia sposób …


2
Dlaczego dowód Wilksa z 1938 r. Nie działa na źle określone modele?
W słynnym artykule z 1938 r. („ Rozkład dużych próbek dla wskaźnika prawdopodobieństwa do testowania hipotez złożonych ”, Annals of Mathematical Statistics, 9: 60-62), Samuel Wilks wyprowadził asymptotyczny rozkład (iloraz ) dla hipotez zagnieżdżonych, przy założeniu, że większa hipoteza jest poprawnie określona. Rozkład ograniczającym jest (Chi-kwadrat) w stopniach swobody, gdzie …

2
Jaka jest funkcja utraty twardej marży SVM?
max(0,1−yi(w⊺xi+b))max(0,1−yi(w⊺xi+b))\max(0,1-y_i(w^\intercal x_i+b))12∥w∥2+C∑imax(0,1−yi(w⊺xi+b))12‖w‖2+C∑imax(0,1−yi(w⊺xi+b)) \frac{1}{2}\|w\|^2+C\sum_i\max(0,1-y_i(w^\intercal x_i+b)) ∥w∥2‖w‖2\|w\|^2max(0,1−yi(w⊺xi+b))max(0,1−yi(w⊺xi+b))\max(0,1-y_i(w^\intercal x_i+b)) Jednak w przypadku SVM z twardym marginesem cała funkcja celu to po prostu 12∥w∥212‖w‖2 \frac{1}{2}\|w\|^2 Czy to oznacza, że ​​SVM z twardym marginesem minimalizuje tylko regularyzator bez funkcji straty? Brzmi bardzo dziwnie. Cóż, jeśli 12∥w∥212‖w‖2)\frac{1}{2}\|w\|^2 jest funkcją straty w tym przypadku, czy możemy ją …

2
Definicja czasu autokorelacji (dla efektywnej wielkości próby)
Znalazłem w literaturze dwie definicje czasu autokorelacji słabo stacjonarnych szeregów czasowych: τza= 1 + 2 ∑k = 1∞ρkprzeciwτb=1 + 2 ∑k = 1∞| ρk|τza=1+2)∑k=1∞ρkprzeciwτb=1+2)∑k=1∞|ρk| \tau_a = 1+2\sum_{k=1}^\infty \rho_k \quad \text{versus} \quad \tau_b = 1+2\sum_{k=1}^\infty \left|\rho_k\right| gdzie to autokorelacja z opóźnieniem . kρk= Cov [ Xt,Xt + h]Var [ Xt]ρk=Cov[Xt,Xt+h]Var[Xt]\rho_k = …

3
Interpretacja statystyczna maksymalnego rozkładu entropii
Użyłem zasady maksymalnej entropii, aby uzasadnić użycie kilku rozkładów w różnych ustawieniach; jednakże muszę jeszcze być w stanie sformułować statystyczną, w przeciwieństwie do teorii informacji, interpretację maksymalnej entropii. Innymi słowy, co maksymalizacja entropii implikuje w statystycznych właściwościach rozkładu? Czy ktoś natknął się lub może odkrył, że statystyczna interpretacja maks. rozkłady …


6
Dokładność testu wyższa niż trening. Jak interpretować?
Mam zestaw danych zawierający maksymalnie 150 przykładów (z podziałem na szkolenia i testy), z wieloma funkcjami (ponad 1000). Muszę porównać klasyfikatory i metody wyboru cech, które dobrze sprawdzają się w danych. Tak więc używam trzech metod klasyfikacji (J48, NB, SVM) i 2 metod wyboru funkcji (CFS, WrapperSubset) z różnymi metodami …

1
Kołmogorow-Smirnov z dyskretnymi danymi: Jakie jest właściwe zastosowanie dgof :: ks.test w R?
Pytania dla początkujących: Chcę przetestować, czy dwa dyskretne zestawy danych pochodzą z tej samej dystrybucji. Zaproponowano mi test Kołmogorowa-Smirnowa. Conover ( Practical Nonparametric Statistics , 3d) wydaje się mówić, że do tego celu można zastosować test Kołmogorowa-Smirnowa, ale jego zachowanie jest „konserwatywne” z dyskretnymi rozkładami i nie jestem pewien, co …

4
Dlaczego badacze stosują 10-krotną walidację krzyżową zamiast testowania na zestawie walidacyjnym?
Przeczytałem wiele artykułów naukowych na temat klasyfikacji sentymentów i pokrewnych tematów. Większość z nich stosuje 10-krotną walidację krzyżową do szkolenia i testowania klasyfikatorów. Oznacza to, że nie przeprowadza się osobnych testów / weryfikacji. Dlaczego? Jakie są zalety / wady tego podejścia, szczególnie dla osób prowadzących badania?

2
Lasy losowe dla regresji wielowymiarowej
Mam problem z regresją wielu wyjść z funkcjami wejściowymi i wyjściowymi d y . Dane wyjściowe mają złożoną, nieliniową strukturę korelacji.dxdxd_xdydyd_y Chciałbym użyć losowych lasów do przeprowadzenia regresji. O ile wiem, losowe lasy do regresji działają tylko z jednym wyjściem, więc musiałbym trenować lasy losowe - jeden dla każdego wyjścia. …

3
Interpretacja numerów AIC i BIC
Szukam przykładów, jak interpretować szacunki AIC (kryterium informacji Akaike) i BIC (kryterium informacji bayesowskiej). Czy ujemną różnicę między kodami BIC można interpretować jako późniejsze szanse jednego modelu na drugi? Jak mogę to wyrazić słowami? Na przykład BIC = -2 może sugerować, że szanse lepszego modelu na drugi model wynoszą w …

4
Wpisywanie brakujących wartości dla PCA
Użyłem tej prcomp()funkcji do wykonania PCA (analiza głównego składnika) w R. Jednak w tej funkcji jest błąd, który na.actionpowoduje, że parametr nie działa. Poprosiłem o pomoc w stosie przepływu ; dwóch użytkowników zaoferowało dwa różne sposoby radzenia sobie z NAwartościami. Problem z obydwoma rozwiązaniami polega jednak na tym, że gdy …

1
Ustawianie węzłów w naturalnych splajnach sześciennych w R.
Mam dane z wieloma skorelowanymi funkcjami i chcę zacząć od ograniczenia funkcji z płynną funkcją podstawową przed uruchomieniem LDA. Próbuję użyć naturalnych splajnów sześciennych w splinespakiecie z nsfunkcją. Jak przejść do przypisywania węzłów? Oto podstawowy kod R: library(splines) lda.pred <- lda(y ~ ns(x, knots=5)) Ale nie mam pojęcia, jak wybrać …
23 r  splines 

4
Biblioteki C ++ do obliczeń statystycznych
Mam określony algorytm MCMC, który chciałbym przenieść do C / C ++. Wiele kosztownych obliczeń jest już napisanych w C przez Cython, ale chcę mieć cały sampler napisany w skompilowanym języku, aby móc po prostu pisać opakowania dla Python / R / Matlab / cokolwiek. Po przeszukiwaniu skłaniam się ku …
23 mcmc  software  c++  computing 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.