Mam lekką dezorientację na wstecznej propagacji błędów algorytmu stosowanego w perceptronu wielowarstwowego (MLP). Błąd jest regulowana przez funkcję kosztów. W wstecznej propagacji błędów, staramy się dostosować ciężar warstw ukrytych. Błąd wyjściowy, który rozumiem, to znaczy e = d - y[Bez indeksów dolnych]. Pytania są następujące: W jaki sposób można uzyskać …
Próbuję zrozumieć, jaki jest cel funkcji utraty i nie do końca rozumiem. Tak więc, o ile rozumiem, funkcja straty służy wprowadzeniu pewnego rodzaju miernika, za pomocą którego możemy zmierzyć „koszt” niewłaściwej decyzji. Powiedzmy, że mam zestaw danych z 30 obiektami, podzieliłem je na zestawy szkoleniowe / testowe, takie jak 20/10. …
Próbuję oszacować parametry rozkładu gamma, które najlepiej pasują do mojej próbki danych. Chcę tylko użyć średniej , std (a więc i wariancji ) z próbki danych, a nie rzeczywistych wartości - ponieważ nie zawsze będą one dostępne w mojej aplikacji. Zgodnie z tym dokumentem do oszacowania kształtu i skali można …
Pracując nad problemem regresji, zacząłem myśleć o przedstawieniu funkcji „dzień tygodnia”. Zastanawiam się, które podejście działałoby lepiej: jedna cecha; wartość 1/7 dla poniedziałku; 2/7 na wtorek ... 7 funkcji: (1, 0, 0, 0, 0, 0, 0) na poniedziałek; (0, 1, 0, 0, 0, 0, 0) na wtorek ... Trudno to …
Pracuję nad bardzo niezrównoważonymi danymi. W literaturze stosuje się kilka metod ponownego równoważenia danych za pomocą ponownego próbkowania (nadmiernego lub niepełnego próbkowania). Dwa dobre podejścia to: SMOTE: TECHnique over-sampling syntetycznej mniejszości ( SMOTE ) ADASYN: Adaptacyjne syntetyczne podejście do próbkowania dla niezrównoważonego uczenia się ( ADASYN ) Wdrożyłem ADASYN, ponieważ …
Kontekst : regresja hierarchiczna z pewnymi brakującymi danymi. Pytanie : Jak wykorzystać oszacowanie maksymalnego prawdopodobieństwa (FIML) pełnej informacji w celu usunięcia brakujących danych w R? Czy polecasz pakiet i jakie są typowe kroki? Bardzo pomocne byłyby również zasoby i przykłady online. PS : Jestem socjologiem, który niedawno zaczął używać R. …
Przeczytałem artykuł Alexandru Niculescu-Mizila i Richa Caruany „ Uzyskiwanie skalibrowanych prawdopodobieństw od wzmocnienia ” i dyskusję w tym wątku. Jednak nadal mam problemy ze zrozumieniem i wdrożeniem logistyki lub skalowania Platta, aby skalibrować moc wyjściową mojego wieloklasowego klasyfikatora podwyższającego (łagodne przyspieszanie z kikutami decyzyjnymi). Jestem nieco zaznajomiony z uogólnionymi modelami …
Czy jest jakaś różnica między „uczeniem się przez transfer” a „adaptacją domeny”? Nie wiem o kontekście, ale rozumiem, że mamy jakiś zestaw danych 1 i trenujemy go, po czym mamy inny zestaw danych 2, do którego chcemy dostosować nasz model bez ponownego szkolenia od zera, dla którego „uczenie się przez …
Załóżmy, że masz jeden przekrój danych, w którym poszczególne osoby znajdują się w grupach (np. Uczniowie w szkołach) i chcesz oszacować model postaci, w Y_i = a + B*X_iktórej Xwektor cech indywidualnych i astałych jest stały. W takim przypadku załóżmy, że nieobserwowana heterogeniczność między grupami wpływa na twoje oszacowania punktowe …
Jaka jest definicja „przestrzeni obiektów”? Na przykład czytając o SVM, czytam o „mapowaniu do przestrzeni funkcji”. Czytając o KOSZYKU, czytam o „partycjonowaniu w przestrzeń funkcji”. Rozumiem, co się dzieje, szczególnie w przypadku CART, ale myślę, że brakuje mi definicji. Czy istnieje ogólna definicja „przestrzeni obiektów”? Czy istnieje definicja, która da …
Pytanie może brzmieć nieco dziwnie, ponieważ jestem nowy w wnioskowaniu statystycznym i sieciach neuronowych. Kiedy w problemach z klasyfikacją za pomocą sieci neuronowych mówimy, że chcemy nauczyć się funkcji która odwzorowuje przestrzeń wejściową na przestrzeń wyjściową :f∗f∗f^*xxxyyy f∗(x;θ)=yf∗(x;θ)=yf^*(x; \theta) = y Czy dopasowujemy parametry ( ) do modelowania funkcji nieliniowej …
SARSA i Q Learning to algorytmy uczenia wzmacniającego, które działają w podobny sposób. Najbardziej uderzającą różnicą jest to, że SARSA jest na polisie, podczas gdy Q Learning jest na polisie. Reguły aktualizacji są następujące: Q Learning: Q(st,at)←Q(st,at)+α[rt+1+γmaxa′Q(st+1,a′)−Q(st,at)]Q(st,at)←Q(st,at)+α[rt+1+γmaxa′Q(st+1,a′)−Q(st,at)]Q(s_t,a_t)←Q(s_t,a_t)+α[r_{t+1}+γ\max_{a'}Q(s_{t+1},a')−Q(s_t,a_t)] SARSA: Q(st,at)←Q(st,at)+α[rt+1+γQ(st+1,at+1)−Q(st,at)]Q(st,at)←Q(st,at)+α[rt+1+γQ(st+1,at+1)−Q(st,at)]Q(s_t,a_t)←Q(s_t,a_t)+α[r_{t+1}+γQ(s_{t+1},a_{t+1})−Q(s_t,a_t)] gdzie st,atst,ats_t,\,a_t i rtrtr_t są stanem, akcja i nagroda w kroku …
Próbuję zrozumieć, w jaki sposób regresja logistyczna wykorzystuje rozkład dwumianowy. Powiedzmy, że badam sukces gniazda u ptaków. Prawdopodobieństwo sukcesu gniazda wynosi 0,6. Korzystając z rozkładu dwumianowego, mogę obliczyć prawdopodobieństwo sukcesów na podstawie n prób (liczby badanych gniazd). Ale w jaki sposób stosuje się rozkład dwumianowy w kontekście modelowania? Powiedzmy, że …
Przeglądałem dokumenty konwolucji keras i znalazłem dwa rodzaje konwulsji Conv1D i Conv2D. Przeprowadziłem wyszukiwanie w Internecie i właśnie to rozumiem na temat Conv1D i Conv2D; Conv1D jest używany do sekwencji, a Conv2D do zdjęć. Zawsze myślałem, że sieci nerwowe splotu są używane tylko do obrazów i w ten sposób wizualizują …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.