Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

6
Dlaczego powinniśmy tasować dane podczas szkolenia sieci neuronowej?
Podczas mini-serii treningu sieci neuronowej usłyszałem, że ważną praktyką jest tasowanie danych treningowych przed każdą epoką. Czy ktoś może wyjaśnić, dlaczego pomieszanie w każdej epoce pomaga? W wyszukiwarce Google znalazłem następujące odpowiedzi: pomaga szybko zbiegać się treningowi zapobiega to stronniczości podczas treningu uniemożliwia modelowi nauczenie się kolejności szkolenia Mam jednak …


1
Jak porównać modele na podstawie AIC?
Mamy dwa modele, które używają tej samej metody do obliczania prawdopodobieństwa logarytmicznego, a AIC dla jednego jest niższy niż drugi. Jednak ten z niższym AIC jest znacznie trudniejszy do interpretacji. Mamy problem z podjęciem decyzji, czy warto wprowadzić trudność, i oceniliśmy to na podstawie różnicy procentowej w AIC. Stwierdziliśmy, że …

1
Dlaczego ważne jest uwzględnienie terminu korekty odchylenia dla optymalizatora Adama w przypadku głębokiego uczenia się?
Czytałem o optymalizatorze Adama do głębokiego uczenia się i natknąłem się na następujące zdanie w nowej książce Głębokie uczenie się autorstwa Begnio, Goodfellow i Courtville: Adam wprowadza korekty błędu wstępnego w szacunkach zarówno momentów pierwszego rzędu (okres pędu), jak i (niecentrowanych) momentów drugiego rzędu, aby uwzględnić ich inicjalizację u źródła. …

1
Czy klątwa wymiarowa działa na niektóre modele bardziej niż na inne?
Miejsca, które czytałem o klątwie wymiarowej, wyjaśniają to przede wszystkim w odniesieniu do kNN, a ogólnie modeli liniowych. Regularnie widzę najlepszych rankingów w Kaggle korzystających z tysięcy funkcji w zbiorze danych, który prawie nie ma 100 000 punktów danych. Używają głównie drzew Boosted i NN. To, że wiele cech wydaje …


2
Dlaczego lrtest () nie pasuje do anova (test = „LRT”)
Szukałem sposobów przeprowadzenia testu współczynnika wiarygodności w R, aby porównać pasowania modeli. Po raz pierwszy zakodowany to sam, a następnie znaleźć zarówno domyślną anova()funkcją, a także lrtest()w lmtestpakiecie. Kiedy jednak sprawdziłem, anova()zawsze produkuje nieco inną wartość p od pozostałych dwóch, mimo że parametr „test” jest ustawiony na „LRT”. Czy anova()faktycznie …


1
Czy regresja logistyczna glmnet może bezpośrednio obsługiwać zmienne czynnikowe (kategoryczne) bez potrzeby zmiennych zastępczych? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 3 lata temu . Buduję regresję logistyczną w R za pomocą metody LASSO z funkcjami cv.glmnetwyboru lambdai glmnetdla ostatecznego modelu. Znam już wszystkie wady związane …

1
Zależność między rozkładem gamma a chi-kwadrat
Jeśli gdzie X i ∼ N ( 0 , σ 2 ) , tj. Wszystkie X i są normalnymi losowymi zmiennymi o średniej zerowej z tymi samymi wariancjami, to Y ∼ Γ ( NY=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2)XiXiX_iY∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Znam rozkład chi-kwadrat jest szczególnym przypadkiem rozkładu gamma, ale nie mógł czerpać …

1
Jak interpretować autokorelację
Obliczyłem autokorelację na danych szeregów czasowych wzorców ruchu ryby na podstawie jej pozycji: X ( x.ts) i Y ( y.ts). Korzystając z R, uruchomiłem następujące funkcje i stworzyłem następujące wykresy: acf(x.ts,100) acf(y.ts,100) Moje pytanie brzmi: jak interpretować te wykresy? Jakie informacje są potrzebne do zgłoszenia jakiegokolwiek wzoru? Przeglądałem internet i …

1
Przekształć dane w pożądaną średnią i odchylenie standardowe
Szukam metody przekształcenia mojego zestawu danych z jego bieżącej średniej i standardowego odchylenia do docelowej średniej i docelowego standardowego odchylenia. Zasadniczo chcę zmniejszyć / rozszerzyć dyspersję i przeskalować wszystkie liczby do średniej. To nie działa, aby wykonać dwie oddzielne transformacje liniowe, jedną dla odchylenia standardowego, a drugą dla średniej. Jakiej …

3
Różnica w stosowaniu znormalizowanego gradientu i gradientu
W ogólnym ustawieniu algorytmu spadku gradientu mamy gdzie jest bieżącym punktem, jest rozmiarem kroku, a jest gradientem oceniono na . xn + 1= xn- η∗ gr a di e n txnxn+1=xn-η∗solrzarejamintxnx_{n+1} = x_{n} - \eta * gradient_{x_n}xnxnx_nηη\etasolr a di e n txnsolrzarejamintxngradient_{x_n}xnxnx_n Widziałem w niektórych algorytmach, ludzie używają znormalizowanego gradientu …


1
logloss vs gini / auc
Przeszkoliłem dwa modele (klasyfikatory binarne przy użyciu h2o AutoML) i chcę wybrać jeden do użycia. Mam następujące wyniki: model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 auci loglosskolumny są metryki cross-validation (tylko krzyż walidacja wykorzystuje dane szkolenie). …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.