Myślałem o znaczeniu rodziny o skali lokalizacji. Mi się, że dla każdego XXX członek lokalizacji skalę rodziny z parametrami położenie i b skalę, to dystrybucja Z = ( X - ) / b nie zależy od jakichkolwiek parametrów i jest taka sama dla każdego X należącego do rodzina.aaabbbZ=(X−a)/bZ=(X−a)/bZ =(X-a)/bXXX Moje …
Przede wszystkim: wiem, że do wyszkolenia sieci neuronowej nie jest wymagana ogólna liczba próbek. Zależy to od zbyt wielu czynników, takich jak złożoność zadania, szum danych i tak dalej. Im więcej próbek treningowych mam, tym lepsza będzie moja sieć. Zastanawiałem się jednak: czy teoretycznie jest możliwe trenowanie sieci neuronowej z …
Nigdy nie jestem pewien, kiedy zastosować kodowanie „na gorąco” w przypadku niez uporządkowanych zmiennych kategorialnych, a kiedy nie. Używam go, ilekroć algorytm używa metryki odległości do obliczenia podobieństwa. Czy ktokolwiek może podać ogólną ogólną zasadę, jakie typy algorytmów wymagają, aby niez uporządkowane funkcje kategorialne były zakodowane na gorąco, a które …
Aby mój (bardzo skromny) zrozumieć wnioskowanie wariacyjne, próbuje się przybliżyć przybliżenie nieznanego rozkładu , znajdując rozkład który optymalizuje:pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Ilekroć inwestuję czas w zrozumienie wnioskowania wariacyjnego, ciągle uderzam w tę formułę i nie mogę się powstrzymać, ale czuję, że nie rozumiem tego. Wydaje się, …
Załóżmy, że mamy problem z klasyfikacją i na początku chcemy uzyskać wgląd w dane i wykonujemy t-SNE. Wynik t-SNE bardzo dobrze rozdziela klasy. Oznacza to, że możliwe jest zbudowanie modelu klasyfikacji, który również bardzo dobrze oddzieli klasy (jeśli t-SNE nie rozdzieli się dobrze, to nie będzie to oznaczało wiele). Wiedząc, …
Jeśli przetwarzamy powiedzmy 10 przykładów w partii, rozumiem, że możemy zsumować stratę dla każdego przykładu, ale jak działa propagacja wsteczna w odniesieniu do aktualizacji wag dla każdego przykładu? Na przykład: Przykład 1 -> strata = 2 Przykład 2 -> strata = -2 Powoduje to średnią stratę 0 (E = 0), …
Tło: Studiuję rozdział 6 głębokiego uczenia się autorstwa Iana Goodfellowa, Yoshui Bengio i Aarona Courville'a. W sekcji 6.2.2.2 (strony 182 z 183, które można obejrzeć tutaj ) zastosowanie sigmoid do wyjścia jest uzasadnione.P(y=1|x)P(y=1|x)P(y=1|x) Podsumowując, niektóre materiały pozwalają, by był neuronem wyjściowym przed zastosowaniem aktywacji, gdzie jest wyjściem poprzedniej ukrytej warstwy, …
Mam ten ogromny zestaw danych z około 2500 zmiennymi i podobnymi 142 obserwacjami. Chcę uruchomić korelację między zmienną X a resztą zmiennych. Ale w wielu kolumnach brakuje wpisów. Próbowałem to zrobić w R za pomocą argumentu „pairwise-complete” ( use=pairwise.complete.obs) i uzyskałem wiązkę korelacji. Ale potem ktoś na StackOverflow opublikował link …
I ostatnio zadawane pytanie mającą matematycznego interpretacji / intuicji za elementarnej równanie dotyczące próbki średniej i wariancji: , geometryczny lub inne.mi[ X2)] = Va r ( X) + ( E[ X] )2)E[X2]=Var(X)+(E[X])2 E[X^2] = Var(X) +(E[X])^2 Ale teraz ciekawi mnie powierzchownie podobne równanie kompromisu wariancji odchylenia. MSE ( θ^) = …
Chcę poznać różnicę między regresją liniową w regularnej analizie uczenia maszynowego a regresją liniową w ustawieniu „głębokiego uczenia”. Jakie algorytmy są stosowane do regresji liniowej w ustawieniach głębokiego uczenia się.
Zarówno terminy „upsampling”, jak i „transponowanie splotu” są używane, gdy wykonujesz „dekonwolucję” (<- niezbyt dobry termin, ale pozwólcie, że użyję go tutaj). Początkowo myślałem, że oznaczają to samo, ale wydaje mi się, że różnią się po przeczytaniu tych artykułów. czy ktoś może wyjaśnić? Transponuj splot : wygląda na to, że …
Mam zestaw danych składający się z proporcji, które mierzą „poziom aktywności” poszczególnych kijanek, dzięki czemu wartości są powiązane od 0 do 1. Dane te zostały zebrane przez zliczenie liczby ruchów danej osoby w określonym przedziale czasu (1 dla ruchu, 0 za brak ruchu), a następnie uśrednia się, aby utworzyć jedną …
Czytałem artykuł Deep Residual Learning for Image Recognition i miałem trudności ze zrozumieniem ze 100% pewnością, co pociąga za sobą blok obliczeniowy. Czytając gazetę mają rysunek 2: co ilustruje, jaki powinien być blok rezydualny. Czy obliczenie bloku resztkowego jest po prostu takie samo jak: y=σ(W2σ(W1x+b1)+b2+x)y=σ(W2σ(W1x+b1)+b2+x) \mathbf{y} = \sigma( W_2 \sigma( …
Rozumiem związek między analizą głównych składników a rozkładem wartości osobliwych na poziomie algebraicznym / dokładnym. Moje pytanie dotyczy implementacji scikit-learn . Dokumentacja mówi: „ [TruncatedSVD] jest bardzo podobny do PCA, ale działa bezpośrednio na przykładowe wektory, zamiast na macierz kowariancji. ”, Co odzwierciedlałoby różnicę algebraiczną między obydwoma podejściami. Jednak później …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.