Ostatnio uczyłem się o prawidłowych regułach punktacji dla klasyfikatorów probabilistycznych. Kilka wątków na tej stronie internetowej podkreślało, że dokładność jest niewłaściwą zasadą punktacji i nie należy jej wykorzystywać do oceny jakości prognoz generowanych przez model probabilistyczny, taki jak regresja logistyczna. Jednak wiele artykułów akademickich, które przeczytałem, podało utratę błędnej klasyfikacji …
Chcę zbudować model regresji, który jest średnią z wielu modeli OLS, każdy oparty na podzbiorze pełnych danych. Idea tego opiera się na tym dokumencie . Tworzę k fałd i buduję k modeli OLS, każdy na danych bez jednego z fałd. Następnie uśredniam współczynniki regresji, aby uzyskać ostateczny model. Uderza mnie …
Twierdzenie Halmosa-Savage'a mówi, że dla dominującego modelu statystycznego statystyka jest wystarczający, jeśli (i tylko jeśli) dla wszystkich istnieje wersja pochodnej Radon Nikodym, mierzalna wersja gdzie jest uprzywilejowany środek taki, że do i .(Ω,A,P)(Ω,A,P)(\Omega, \mathscr A, \mathscr P)T:(Ω,A,P)→(Ω′,A′)T:(Ω,A,P)→(Ω′,A′)T: (\Omega, \mathscr A, \mathscr P)\to(\Omega', \mathscr A'){P∈P}{P∈P}\{P \in \mathscr{P} \} TTTdPdP∗dPdP∗\frac{dP}{dP*}dP∗dP∗dP*P∗=∑∞i=1PiciP∗=∑i=1∞PiciP*=\sum_{i=1}^\infty P_i c_i …
Powiedzmy, że obliczam wysokości (w cm), a liczby muszą być większe od zera. Oto przykładowa lista: 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 W tym przykładzie, zgodnie z rozkładem normalnym, 99,7% wartości musi znajdować się między ± 3-krotnością standardowego odchylenia od średniej. Jednak …
Mam podstawową wiedzę na temat działania RNN (a zwłaszcza jednostek LSTM). Mam obrazowe wyobrażenie o architekturze jednostki LSTM, czyli komórki i kilku bramek, które regulują przepływ wartości. Jednak najwyraźniej nie do końca zrozumiałem, w jaki sposób LSTM rozwiązuje problem „znikania i eksplodowania gradientów”, który pojawia się podczas treningu, z wykorzystaniem …
W Ristnieją trzy sposoby, aby sformatować dane wejściowe dla regresji logistycznej z wykorzystaniem glmfunkcji: Dane mogą być w formacie „binarnym” dla każdej obserwacji (np. Y = 0 lub 1 dla każdej obserwacji); Dane mogą być w formacie „Wilkinson-Rogers” (np. y = cbind(success, failure)), Przy czym każdy wiersz reprezentuje jeden zabieg; …
Nauka statystyk bayesowskich po raz pierwszy; zastanawiając się nad kątem MCMC, zastanawiałem się: czy robi coś, czego zasadniczo nie da się zrobić inaczej, czy też robi coś znacznie wydajniejszego niż alternatywy? Dla ilustracji załóżmy, że próbujemy obliczyć prawdopodobieństwo naszych parametrów, biorąc pod uwagę dane biorąc pod uwagę model, który oblicza …
Załóżmy, że nasz zestaw danych zawiera 1 milion przykładów, tj. , i chcemy użyć opadania gradientu, aby przeprowadzić regresję logistyczną lub liniową na tym zestawie danych.x1,…,x106x1,…,x106x_1, \ldots, x_{10^6} Co to jest z metodą opadania gradientu, która sprawia, że jest nieefektywna? Przypomnijmy, że krok opadania gradientu w czasie jest określony przez:ttt …
Nie jestem pewien, czy to jest odpowiednia strona stosu, ale proszę bardzo. Jak działa metoda .similiarity? Wow spaCy jest świetne! Jego model tfidf może być łatwiejszy, ale w2v z tylko jedną linią kodu ?! W swoim 10-liniowym samouczku na temat spaCy andrazhribernik pokazuje nam metodę .similarity, którą można uruchamiać na …
Przechodzę przez kurs DeepAI Cousery (film 3 tygodnia 1 „Przegląd sieci neuronowych”), a Andrew Ng wyjaśnia, w jaki sposób każda warstwa w sieci neuronowej jest kolejną regresją logistyczną, ale nie wyjaśnia, w jaki sposób poprawia to dokładność. W jaki sposób w sieci dwuwarstwowej wielokrotne obliczanie logistyki czyni ją dokładniejszą?
Klasyfikator Naive Bayes jest klasyfikatorem, który przypisuje przedmioty do klasy oparciu o maksymalizację tylnego dla członkostwa w klasie i zakłada, że cechy przedmiotów są niezależne.C P ( C | x )xxxCCCP(C|x)P(C|x)P(C|x) Strata 0-1 to strata, która przypisuje każdej błędnej klasyfikacji stratę „1”, a stratę „0” dowolnej poprawnej klasyfikacji. Często czytam …
Funkcja celu w głównej analizie składników (PCA) polega na minimalizowaniu błędu rekonstrukcji w normie L2 (patrz sekcja 2.12 tutaj . Inny pogląd stara się zmaksymalizować wariancję projekcji. Mamy też doskonały post tutaj: Jaka jest funkcja celu PCA ? ). Moje pytanie brzmi: czy wypukła jest optymalizacja PCA? (Znalazłem tutaj kilka …
Niedawno przeczytałem artykuł Yanna Dauphina i in. Identyfikowanie i atakowanie problemu punktu siodłowego w wielowymiarowej nie wypukłej optymalizacji , w której wprowadzono interesujący algorytm opadania o nazwie Saddle-Free Newton , który wydaje się być dokładnie dostosowany do optymalizacji sieci neuronowej i nie powinien cierpieć z powodu utknięcia w punktach siodłowych …
W „W większości nieszkodliwych ekonometriach: towarzysz empirysty” (Angrist i Pischke, 2009: strona 209) czytam: (...) W rzeczywistości właśnie zidentyfikowana 2SLS (powiedzmy, prosty estymator Wald) jest w przybliżeniu bezstronna . Jest to trudne do formalnego wykazania, ponieważ właśnie zidentyfikowana 2SLS nie ma momentów (tj. Rozkład próbkowania ma ogony tłuszczu). Niemniej jednak, …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.