Algorytmy uczenia maszynowego budują model danych szkoleniowych. Termin „uczenie maszynowe” jest niejasno zdefiniowany; obejmuje to tak zwane uczenie statystyczne, uczenie wzmacniające, uczenie bez nadzoru itp. ZAWSZE DODAJ SZCZEGÓŁOWĄ TAGĘ.
Przypuśćmy, że chcę wytrenować głęboką sieć neuronową do przeprowadzania klasyfikacji lub regresji, ale chcę wiedzieć, jak pewne będą prognozy. Jak mogłem to osiągnąć? Moim pomysłem jest obliczenie entropii krzyżowej dla każdego układu odniesienia na podstawie wyników jego prognozowania w miernikach neuronowych powyżej. Następnie trenowałbym drugą sieć neuronową do regresji, która …
Według „Efficient Backprop” LeCun i wsp. (1998) dobrą praktyką jest znormalizowanie wszystkich danych wejściowych, tak aby były one wyśrodkowane wokół 0 i mieściły się w zakresie maksymalnej drugiej pochodnej. Na przykład użylibyśmy [-0,5,0,5] dla funkcji „Tanh”. Ma to pomóc w postępie wstecznej propagacji, gdy Hesjan staje się bardziej stabilny. Nie …
Po przeczytaniu wielu artykułów do głębokiego uczenia się, rodzajem szorstkiego odczucia jest to, że istnieje wiele sztuczek w szkoleniu sieci, aby uzyskać lepszą niż zwykle wydajność. Z punktu widzenia aplikacji branżowych bardzo trudno jest opracować tego rodzaju sztuczki, z wyjątkiem elitarnych grup badawczych w dużych firmach technologicznych, np. Google lub …
Zakładam, że ogólna konfiguracja regresji, czyli ciągła funkcja jest wybierana z rodziny celu dopasowania danych ( może być dowolną przestrzenią, taką jak sześcian lub faktycznie dowolną rozsądną przestrzenią topologiczną) zgodnie z niektórymi naturalnymi kryteriami.hθ:X→Rnhθ:X→Rnh_\theta:X\to \mathbb R^n{hθ}θ{hθ}θ\{h_\theta\}_\theta(xi,yi)∈X×Rn,i=1,…,k(xja,yja)∈X×Rn,ja=1,…,k(x_i,y_i)\in X\times \mathbb R^n, i=1,\ldots, kXXX[0,1]m[0,1]m[0,1]^m Czy istnieją zastosowania regresji, w których zainteresowany jest kontur? …
Myślałem o rozwiązaniu Lasso metodami waniliowymi. Ale czytałem osoby sugerujące użycie Proksymalnego spadku gradientu. Czy ktoś może wyjaśnić, dlaczego dla Lasso można zastosować bliższe GD zamiast waniliowych metod podskładnikowych?
Sieci autokoderów wydają się znacznie trudniejsze niż normalne sieci MLP klasyfikujące. Po kilku próbach użycia Lasagne wszystko, co otrzymuję w zrekonstruowanym wyjściu, jest w najlepszym razie rozmyte uśrednianie wszystkich obrazów bazy danych MNIST, bez rozróżnienia na to, co faktycznie jest cyfrą wejściową. Wybrana przeze mnie struktura sieci to następujące warstwy …
Zgodnie z dokumentacją obiektu StandardScaler w scikit-learn: Na przykład wiele elementów wykorzystywanych w funkcji celu algorytmu uczenia się (np. Jądro RBF maszyn wektora wektorowego lub regulatory modeli liniowych L1 i L2) zakłada, że wszystkie funkcje są wyśrodkowane wokół 0 i mają wariancję w tej samej kolejności. Jeśli cecha ma wariancję …
Pytania: Jaka jest różnica między drzewkami regresji wzmocnionej (BRT) a uogólnionymi modelami wzmocnionej (GBM)? Czy można ich używać zamiennie? Czy jedna jest specyficzną formą drugiej? Dlaczego Ridgeway użył wyrażenia „Uogólnione modele regresji wzmocnionej” (GBM), aby opisać to, co Friedman wcześniej zaproponował jako „maszynę do zwiększania gradientu” (GBM)? Te dwa akronimy …
W Random Forest każde drzewo jest uprawiane równolegle na unikalnej próbce danych doładowania. Ponieważ oczekuje się, że każda próbka przypominająca zawiera około 63% unikalnych obserwacji, pozostawia to około 37% obserwacji, które można wykorzystać do testowania drzewa. Teraz wydaje się, że w Stochastic Gradient Boosting istnieje również OOBerrorOOBerrorOOB_{error} oszacowanie podobne do …
Mam zestaw danych ze zmienną ciągłą i binarną zmienną docelową (0 i 1). Muszę zdyskretyzować zmienne ciągłe (w przypadku regresji logistycznej) w odniesieniu do zmiennej docelowej oraz z ograniczeniem, że częstotliwość obserwacji w każdym przedziale powinna być zrównoważona. Próbowałem algorytmów uczenia maszynowego, takich jak Chi Merge, drzewa decyzyjne. Scalanie chi …
Ten artykuł twierdzi, że w CART, ponieważ podział binarny jest wykonywany na jednej zmiennej towarzyszącej na każdym etapie, wszystkie podziały są ortogonalne, a zatem interakcje między zmiennymi towarzyszącymi nie są brane pod uwagę. Jednak wiele bardzo poważnych odniesień twierdzi, wręcz przeciwnie, że hierarchiczna struktura drzewa gwarantuje, że interakcje między predyktorami …
W CNN poznamy filtry do tworzenia mapy obiektów w warstwie splotowej. W programie Autoencoder pojedynczą ukrytą jednostkę każdej warstwy można uznać za filtr. Jaka jest różnica między filtrami wyuczonymi w tych dwóch sieciach?
Jedną z metod oceny w konkursie ImageNet (klasyfikacja 1000 kategorii obrazów) jest błąd w pierwszej piątce, co to znaczy? Zobacz: http://www.image-net.org/challenges/LSVRC/
W uczeniu maszynowym często zakłada się, że zbiór danych leży na gładkim kolektorze o małych wymiarach (założenie rozmaitości), ale czy istnieje jakiś sposób, aby udowodnić, że przy spełnieniu określonych warunków, zbiór danych jest rzeczywiście (w przybliżeniu) generowany z niskiego wymiaru gładkiego kolektora? Na przykład, biorąc pod uwagę sekwencję danych gdzie …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.