Algorytmy uczenia maszynowego budują model danych szkoleniowych. Termin „uczenie maszynowe” jest niejasno zdefiniowany; obejmuje to tak zwane uczenie statystyczne, uczenie wzmacniające, uczenie bez nadzoru itp. ZAWSZE DODAJ SZCZEGÓŁOWĄ TAGĘ.
Patrzyłem na teoretyczne ramy wyboru metod (uwaga: nie wybór modelu) i znalazłem bardzo mało systematycznej, motywowanej matematycznie pracy. Pod pojęciem „wybór metody” rozumiem strukturę umożliwiającą rozróżnienie odpowiedniej (lub lepszej, optymalnej) metody w odniesieniu do problemu lub rodzaju problemu. To, co znalazłem, jest znaczące, jeśli fragmentaryczne, pracuje nad poszczególnymi metodami i …
Czytałem więc o proroku na Facebooku, że dzieli on szereg czasowy na trendy i sezonowość. Na przykład model addytywny zostałby zapisany jako: y( t ) = g( t ) + s ( t ) + h ( t ) + ety(t)=g(t)+s(t)+h(t)+et y(t) = g(t) + s(t) + h(t) + e_t …
Rozumiem, że SVM jest bardzo podobny do regresji logistycznej (LR), tj. Ważona suma funkcji jest przekazywana do funkcji sigmoidalnej w celu uzyskania prawdopodobieństwa przynależności do klasy, ale zamiast utraty entropii krzyżowej (logistycznej) funkcja, trening odbywa się przy użyciu utraty zawiasu. Zaletą stosowania utraty zawiasu jest to, że można wykonywać różne …
mgcvOpakowanie Rposiada dwie funkcje montowania interakcji produktów napinacz: te()i ti(). Rozumiem podstawowy podział pracy między nimi (dopasowanie interakcji nieliniowej vs. rozkładanie tej interakcji na główne efekty i interakcję). To, czego nie rozumiem, to dlaczego te(x1, x2)i ti(x1) + ti(x2) + ti(x1, x2)może powodować (nieznacznie) różne wyniki. MWE (dostosowany z ?ti): …
Mam listę słów należących do różnych samookreślonych kategorii. Każda kategoria ma swój własny wzór (na przykład jedna ma stałą długość ze znakami specjalnymi, inna istnieje ze znaków, które występują tylko w tej kategorii „słowa”, ...). Na przykład: "ABC" -> type1 "ACC" -> type1 "a8 219" -> type2 "c 827" -> …
Na str. 34 wstępu do nauki statystycznej :\newcommand{\Var}{{\rm Var}} Choć dowód matematyczny jest poza zakresem tej książki, jest możliwe, aby pokazać, że oczekiwany MSE testy, dla danej wartości , zawsze można rozłożyć na sumę trzech podstawowych ilości: w sprzeczności z f ( x 0 ) , kwadrat Odchylenie od f …
Próbuję wytrenować głęboką sieć neuronową do klasyfikacji, wykorzystując propagację wsteczną. W szczególności używam splotowej sieci neuronowej do klasyfikacji obrazów, korzystając z biblioteki Tensor Flow. Podczas treningu doświadczam dziwnego zachowania i zastanawiam się, czy jest to typowe, czy też robię coś złego. Tak więc moja splotowa sieć neuronowa ma 8 warstw …
Ostatnio zainteresowałem się układaniem modeli jako formą uczenia się w zespole. W szczególności trochę eksperymentowałem z niektórymi zestawami danych zabawek na problemy z regresją. Zasadniczo wdrożyłem indywidualne regresory „poziomu 0”, zapisałem prognozy wyjściowe każdego regresora jako nową funkcję dla „meta-regresora”, który należy wziąć za swój wkład, i dopasowałem ten meta-regresor …
W jaki sposób mapy aktywacyjne na danej warstwie są połączone z filtrami dla tej warstwy? Nie pytam o to, jak wykonać operację splotu między filtrem a mapą aktywacyjną, pytam o rodzaj łączności tych dwóch. Powiedzmy na przykład, że chcesz uzyskać pełną łączność. Masz liczbę filtrów i liczbę map aktywacyjnych w …
Zastanawiałem się, czy można wyszkolić maszynę SVM (powiedzmy liniową, aby ułatwić) za pomocą propagacji wstecznej? Obecnie jestem w bloku drogowego, ponieważ mogę tylko myśleć o pisaniu wyjście klasyfikatora jako fa( x ; θ , b ) = sgn ( θ ⋅ x - ( b + 1 ) ) = …
Rozumiem, że sieci neuronowe (NN) można uznać za uniwersalne aproksymatory zarówno funkcji, jak i ich pochodnych, pod pewnymi założeniami (zarówno w sieci, jak i funkcji do aproksymacji). W rzeczywistości przeprowadziłem szereg testów prostych, ale nietrywialnych funkcji (np. Wielomianów) i wydaje się, że rzeczywiście potrafię je dobrze przybliżyć i ich pierwsze …
Podczas wdrażania autoencodera z siecią neuronową większość osób użyje sigmoid jako funkcji aktywacyjnej. Czy zamiast tego możemy użyć ReLU? (Ponieważ ReLU nie ma limitu górnej granicy, w zasadzie oznacza to, że obraz wejściowy może mieć piksel większy niż 1, w przeciwieństwie do ograniczonych kryteriów dla autoencodera, gdy używany jest sigmoid).
Mam problem ze zrozumieniem tego zdania: Pierwsza proponowana architektura jest podobna do sprzężenia zwrotnego NNLM, w którym nieliniowa warstwa ukryta jest usuwana, a warstwa projekcyjna jest wspólna dla wszystkich słów (nie tylko matrycy projekcyjnej); dlatego wszystkie słowa są rzutowane na tę samą pozycję (ich wektory są uśredniane). Czym jest warstwa …
Czytałem trochę o algorytmach usprawniających dla zadań klasyfikacyjnych, aw szczególności Adaboost. Rozumiem, że celem Adaboost jest wzięcie kilku „słabych uczniów” i poprzez zestaw iteracji danych treningowych, popchnąć klasyfikatorów, aby nauczyli się przewidywać klasy, w których model (y) wielokrotnie popełnia błędy. Zastanawiałem się jednak, dlaczego w tak wielu odczytach wykorzystałem drzewa …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.