Kontekst Wielowymiarowy gaussowski pojawia się często w uczeniu maszynowym, a następujące wyniki są używane w wielu książkach i kursach ML bez pochodnych. Biorąc pod uwagę dane w postaci macierzy o wymiarach , jeżeli założymy, że dane są zgodne ze zmiennym rozkładem Gaussa zmiennym o parametrach średnia ( ) i macierz …
Próbuję zrozumieć, jak działa XGBoost. Już rozumiem, w jaki sposób drzewa wzmocnione gradientem działają na sklearn Pythona. Nie jest dla mnie jasne, czy XGBoost działa w ten sam sposób, ale szybciej, czy istnieją fundamentalne różnice między nim a implementacją Pythona. Kiedy czytam ten artykuł http://learningsys.org/papers/LearningSys_2015_paper_32.pdf Wydaje mi się, że wynik …
Jeśli chodzi o żargon sieci neuronowej (y = waga * x + odchylenie), skąd mam wiedzieć, które zmienne są ważniejsze od innych? Mam sieć neuronową z 10 wejściami, 1 ukrytą warstwą z 20 węzłami i 1 warstwą wyjściową, która ma 1 węzeł. Nie jestem pewien, jak się dowiedzieć, które zmienne …
Algorytmy genetyczne są jedną z metod optymalizacji. Często stochastyczne zejście gradientu i jego pochodne są najlepszym wyborem do optymalizacji funkcji, ale algorytmy genetyczne są nadal stosowane. Na przykład antena statku kosmicznego ST5 NASA została stworzona za pomocą algorytmu genetycznego: Kiedy metody optymalizacji genetycznej są lepszym wyborem niż bardziej popularne metody …
Ostatnio zainteresowałem się LSTM i byłem zaskoczony, gdy dowiedziałem się, że wagi są dzielone w czasie. Wiem, że jeśli dzielisz wagi w czasie, to twoje wejściowe sekwencje czasowe mogą mieć zmienną długość. Dzielone ciężary pozwalają trenować o wiele mniej parametrów. Z mojego zrozumienia, powód, dla którego warto przejść na LSTM …
Niech będzie przestrzenią prawdopodobieństwa, biorąc pod uwagę zmienną losową i a -algebra możemy zbudować nową zmienną losową , która jest warunkowym oczekiwaniem.( Ω , F , μ ) (Ω,F,μ)(\Omega,\mathscr{F},\mu)ξ : Ω → Rξ:Ω→R\xi:\Omega \to \mathbb{R} σ σ\sigmaG ⊆ FG⊆F\mathscr{G}\subseteq \mathscr{F} E [ ξ | G ]E[ξ|G]E[\xi|\mathscr{G}] Jaka jest intuicja do …
Jestem nowy w optymalizacji. Ciągle widzę równania, które mają indeks górny 2 i indeks dolny 2 po prawej stronie normy. Na przykład tutaj jest równanie najmniejszych kwadratów min||Ax−b||22||Ax−b||22 ||Ax-b||^2_2 Wydaje mi się, że rozumiem indeks górny 2: oznacza to wyprostowanie wartości normy. Ale czym jest indeks dolny 2? Jak mam …
Podczas gdy te dwa wszechobecne terminy są często używane jako synonimy, czasem wydaje się, że istnieje rozróżnienie. Czy rzeczywiście jest różnica, czy są one dokładnie synonimami?
Jestem zdezorientowany, jak podzielić dane na k-krotnie krzyżową weryfikację uczenia się w zespole. Zakładając, że mam kompletny system uczenia się do klasyfikacji. Moja pierwsza warstwa zawiera modele klasyfikacji, np. Svm, drzewa decyzyjne. Moja druga warstwa zawiera model głosowania, który łączy prognozy z pierwszej warstwy i daje ostateczną prognozę. Jeśli użyjemy …
Usiłuję zrozumieć wyprowadzenie oczekiwanego błędu prognozy na niższy poziom (ESL), szczególnie na podstawie wyprowadzenia 2.11 i 2.12 (warunkowanie, krok w kierunku minimum punktowego). Wszelkie wskazówki lub linki są mile widziane. Poniżej raportuję fragment z ESL str. 18. Pierwsze dwa równania to w kolejności równanie 2.11 i 2.12. Niech oznacza losowy …
„Daleki nadzór” to schemat uczenia się, w którym klasyfikator uczy się, biorąc pod uwagę słabo oznakowany zestaw treningowy (dane treningowe są automatycznie oznaczane na podstawie heurystyki / zasad). Uważam, że zarówno nauczanie nadzorowane, jak i nauczanie częściowo nadzorowane może obejmować taki „zdalny nadzór”, jeśli ich oznaczone dane są heurystycznie / …
Powiedzmy, że mam zestaw danych „cewnika nerkowego”. Próbuję modelować krzywą przeżycia za pomocą modelu Coxa. Jeśli wezmę pod uwagę model Coxa: potrzebuję oszacowania podstawowego zagrożenia. Korzystając z wbudowanej funkcji pakietu R , mogę łatwo to zrobić w następujący sposób:h ( t , Z) = godz0exp( b′Z) ,h(t,Z)=h0exp(b′Z),h(t,Z) = h_0 \exp(b'Z),survivalbasehaz() …
Pracuję nad klasyfikacją etapu snu. Czytałem niektóre artykuły badawcze na ten temat, wiele z nich używało SVM lub metody ensemble. Czy dobrym pomysłem jest użycie splotowej sieci neuronowej do klasyfikacji jednowymiarowego sygnału EEG? Jestem nowy w tego rodzaju pracy. Wybacz mi, jeśli poproszę o coś złego?
Czytam o dwóch popularnych technikach interpretacji modeli post hoc: LIME i SHAP Mam problem ze zrozumieniem kluczowej różnicy w tych dwóch technikach. Aby zacytować Scott Lundberg , mózgiem shap: Wartości SHAP pochodzą z zalet LIME w szacunkach lokalnych czarnej skrzynki, ale także z teoretycznymi gwarancjami spójności i lokalnej dokładności z …
Rozumiem podstawową strukturę wariacyjnego autoencodera i normalnego (deterministycznego) autoencodera oraz matematykę za nimi, ale kiedy i dlaczego wolałbym jeden typ autoencodera od drugiego? Mogę tylko pomyśleć o wcześniejszym rozkładzie ukrytych zmiennych autoencodera wariacyjnego, który pozwala nam próbkować ukryte zmienne, a następnie konstruować nowy obraz. Jaką przewagę ma stochastyczność autokodera wariacyjnego …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.