Podczas mini-serii treningu sieci neuronowej usłyszałem, że ważną praktyką jest tasowanie danych treningowych przed każdą epoką. Czy ktoś może wyjaśnić, dlaczego pomieszanie w każdej epoce pomaga? W wyszukiwarce Google znalazłem następujące odpowiedzi: pomaga szybko zbiegać się treningowi zapobiega to stronniczości podczas treningu uniemożliwia modelowi nauczenie się kolejności szkolenia Mam jednak …
Co to jest funkcja generowania momentu (MGF)? Czy potrafisz to wytłumaczyć laikiem wraz z prostym i łatwym przykładem? Ogranicz w miarę możliwości formalne notacje matematyczne.
Mamy dwa modele, które używają tej samej metody do obliczania prawdopodobieństwa logarytmicznego, a AIC dla jednego jest niższy niż drugi. Jednak ten z niższym AIC jest znacznie trudniejszy do interpretacji. Mamy problem z podjęciem decyzji, czy warto wprowadzić trudność, i oceniliśmy to na podstawie różnicy procentowej w AIC. Stwierdziliśmy, że …
Czytałem o optymalizatorze Adama do głębokiego uczenia się i natknąłem się na następujące zdanie w nowej książce Głębokie uczenie się autorstwa Begnio, Goodfellow i Courtville: Adam wprowadza korekty błędu wstępnego w szacunkach zarówno momentów pierwszego rzędu (okres pędu), jak i (niecentrowanych) momentów drugiego rzędu, aby uwzględnić ich inicjalizację u źródła. …
Miejsca, które czytałem o klątwie wymiarowej, wyjaśniają to przede wszystkim w odniesieniu do kNN, a ogólnie modeli liniowych. Regularnie widzę najlepszych rankingów w Kaggle korzystających z tysięcy funkcji w zbiorze danych, który prawie nie ma 100 000 punktów danych. Używają głównie drzew Boosted i NN. To, że wiele cech wydaje …
W podstawowym uczeniu maszynowym uczymy się następujących „praktycznych zasad”: a) rozmiar twoich danych powinien być co najmniej 10 razy większy niż rozmiar VC twojego zestawu hipotez. b) sieć neuronowa z połączeniami N ma wymiar VC około N. Kiedy więc sieć neuronowa dogłębnie ucząca się mówi, miliony jednostek, czy to oznacza, …
Szukałem sposobów przeprowadzenia testu współczynnika wiarygodności w R, aby porównać pasowania modeli. Po raz pierwszy zakodowany to sam, a następnie znaleźć zarówno domyślną anova()funkcją, a także lrtest()w lmtestpakiecie. Kiedy jednak sprawdziłem, anova()zawsze produkuje nieco inną wartość p od pozostałych dwóch, mimo że parametr „test” jest ustawiony na „LRT”. Czy anova()faktycznie …
Zgodnie z tym samouczkiem na temat głębokiego uczenia się , odchudzanie (regularyzacja) zwykle nie jest stosowane do terminów stronniczości b dlaczego? Jakie jest za tym znaczenie (intuicja)?
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 3 lata temu . Buduję regresję logistyczną w R za pomocą metody LASSO z funkcjami cv.glmnetwyboru lambdai glmnetdla ostatecznego modelu. Znam już wszystkie wady związane …
Jeśli gdzie X i ∼ N ( 0 , σ 2 ) , tj. Wszystkie X i są normalnymi losowymi zmiennymi o średniej zerowej z tymi samymi wariancjami, to Y ∼ Γ ( NY=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2)XiXiX_iY∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Znam rozkład chi-kwadrat jest szczególnym przypadkiem rozkładu gamma, ale nie mógł czerpać …
Obliczyłem autokorelację na danych szeregów czasowych wzorców ruchu ryby na podstawie jej pozycji: X ( x.ts) i Y ( y.ts). Korzystając z R, uruchomiłem następujące funkcje i stworzyłem następujące wykresy: acf(x.ts,100) acf(y.ts,100) Moje pytanie brzmi: jak interpretować te wykresy? Jakie informacje są potrzebne do zgłoszenia jakiegokolwiek wzoru? Przeglądałem internet i …
Szukam metody przekształcenia mojego zestawu danych z jego bieżącej średniej i standardowego odchylenia do docelowej średniej i docelowego standardowego odchylenia. Zasadniczo chcę zmniejszyć / rozszerzyć dyspersję i przeskalować wszystkie liczby do średniej. To nie działa, aby wykonać dwie oddzielne transformacje liniowe, jedną dla odchylenia standardowego, a drugą dla średniej. Jakiej …
W ogólnym ustawieniu algorytmu spadku gradientu mamy gdzie jest bieżącym punktem, jest rozmiarem kroku, a jest gradientem oceniono na . xn + 1= xn- η∗ gr a di e n txnxn+1=xn-η∗solrzarejamintxnx_{n+1} = x_{n} - \eta * gradient_{x_n}xnxnx_nηη\etasolr a di e n txnsolrzarejamintxngradient_{x_n}xnxnx_n Widziałem w niektórych algorytmach, ludzie używają znormalizowanego gradientu …
Chcę użyć przy dystrybucji do modelowania zwrotów aktywów o krótkich interwałach w modelu bayesowskim. Chciałbym oszacować oba stopnie swobody (wraz z innymi parametrami w moim modelu) dla rozkładu. Wiem, że zwroty z aktywów są dość nietypowe, ale nie wiem zbyt wiele poza tym. Jaka jest odpowiednia, lekko informacyjna wcześniejsza dystrybucja …
Przeszkoliłem dwa modele (klasyfikatory binarne przy użyciu h2o AutoML) i chcę wybrać jeden do użycia. Mam następujące wyniki: model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 auci loglosskolumny są metryki cross-validation (tylko krzyż walidacja wykorzystuje dane szkolenie). …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.