Mam czterowarstwowy CNN do przewidywania odpowiedzi na raka za pomocą danych MRI. Używam aktywacji ReLU do wprowadzenia nieliniowości. Dokładność i strata pociągu monotonicznie odpowiednio wzrastają i maleją. Ale moja dokładność testu zaczyna się dziko wahać. Próbowałem zmienić szybkość uczenia się, zmniejszyć liczbę warstw. Ale to nie zatrzymuje fluktuacji. Przeczytałem nawet …
Jestem bardzo nowy w statystykach bayesowskich i może to być głupie pytanie. Niemniej jednak: Rozważ wiarygodny interwał z uprzednim, który określa jednolity rozkład. Na przykład od 0 do 1, gdzie 0 do 1 reprezentuje pełny zakres możliwych wartości efektu. Czy w takim przypadku 95% przedział wiarygodności byłby równy 95% przedziałowi …
Próbowałem nauczyć się uczenia maszynowego przy użyciu materiału Coursera . W tym wykładzie Andrew Ng wykorzystuje algorytm spadku gradientu do znalezienia współczynników modelu regresji liniowej, które zminimalizują funkcję błędu (funkcję kosztu). Czy do regresji liniowej potrzebujemy spadku gradientu? Wydaje się, że potrafię analitycznie rozróżnić funkcję błędu i ustawić ją na …
Widziałem tutaj inny wątek , ale nie sądzę, by odpowiedź zaspokoiła faktyczne pytanie. Ciągle czytam, że Naive Bayes jest klasyfikatorem liniowym (np. Tutaj ) (takim, że wyznacza liniową granicę decyzyjną) za pomocą demonstracji logarytmicznych szans. Symulowałem jednak dwie chmury Gaussa i dopasowałem granicę decyzyjną i otrzymałem wyniki jako takie (biblioteka …
W notatkach MIT OpenCourseWare z 18.05 Wprowadzenie do prawdopodobieństwa i statystyki, wiosna 2014 (obecnie dostępnych tutaj ), stwierdza: Metoda percentyla bootstrap jest atrakcyjna ze względu na swoją prostotę. Zależy to jednak od rozkładu boot oparciu o konkretną próbkę będącą dobrym przybliżeniem do prawdziwego rozkładu . Rice mówi o metodzie centylowej: …
Patrząc na definicje Wikipedii: Mean Squared Error (MSE) Resztkowa suma kwadratów (RSS) Tak mi się wydaje MSE = 1N.RSS = 1N.∑ ( fja- yja)2)MSE=1NRSS=1N∑(fi−yi)2\text{MSE} = \frac{1}{N} \text{RSS} = \frac{1}{N} \sum (f_i -y_i)^2 gdzie N.NN jest numerem on próbek i fifif_i jest nasza ocena yiyiy_i . Jednak żaden z artykułów Wikipedii …
Często twierdzi się, że ładowanie początkowe może zapewnić oszacowanie błędu systematycznego w estymatorze. Jeśli jest szacunkiem dla niektórych statystyk, a są replikami ładowania początkowego (z ), to szacunek obciążenia początkowego szacunku wynosi co wydaje się niezwykle proste i potężne, do tego stopnia, że niepokoi. ~ T II∈{1,⋯,N}biyt≈1t^t^\hat tt~it~i\tilde t_ii∈{1,⋯,N}i∈{1,⋯,N}i\in\{1,\cdots,N\}biast≈1N∑it~i−t^biast≈1N∑it~i−t^\begin{equation} \mathrm{bias}_t …
O tym, czy w regresji logistycznej istnieje błąd (i jego założony rozkład), czytałem w różnych miejscach, które: nie istnieje termin błędu termin błędu ma rozkład dwumianowy (zgodnie z rozkładem zmiennej odpowiedzi) termin błędu ma rozkład logistyczny Czy ktoś może wyjaśnić?
Chciałbym określić względną ważność zbiorów zmiennych w stosunku do randomForestmodelu klasyfikacji w R. importanceFunkcja zapewnia MeanDecreaseGinimetrykę dla każdego predyktora - czy jest to tak proste, jak sumowanie tego dla każdego predyktora w zestawie? Na przykład: # Assumes df has variables a1, a2, b1, b2, and outcome rf <- randomForest(outcome ~ …
Korzystam z narzędzia libsvm ( http://www.csie.ntu.edu.tw/~cjlin/libsvm/ ) do klasyfikacji wektora wsparcia. Jestem jednak zdezorientowany co do formatu danych wejściowych. Z README: Format pliku danych szkoleniowych i testowych to: <label> <index1>:<value1> <index2>:<value2> ... . . . Każda linia zawiera instancję i kończy się znakiem „\ n”. Do klasyfikacji <label>jest liczbą całkowitą …
Powiedzmy, że mam 1000 komponentów i zbieram dane o tym, ile razy rejestrują awarię i za każdym razem, gdy logują awarię, śledzę również, ile czasu zajęło mojemu zespołowi usunięcie problemu. Krótko mówiąc, rejestrowałem czas naprawy (w sekundach) dla każdego z tych 1000 elementów. Dane podano na końcu tego pytania. Wziąłem …
To wygląda na podobne pytanie i nie uzyskało wielu odpowiedzi. Pomijając testy, takie jak D Cooka, i patrząc na resztki jako grupę, interesuje mnie, w jaki sposób inni używają resztek podczas oceny dobroci dopasowania. Używam surowych pozostałości: na wykresie QQ do oceny normalności w wykresie rozrzutu porównaniu do reszt, w …
Czy można obliczyć wartości AIC lub BIC dla modeli regresji lasso i innych modeli znormalizowanych, w których parametry tylko częściowo wchodzą do równania. Jak określa się stopnie swobody? Używam R, aby dopasować modele regresji lasso z glmnet()funkcją z glmnetpakietu i chciałbym wiedzieć, jak obliczyć wartości AIC i BIC dla modelu. …
Czy termin „strata” jest synonimem „błędu”? Czy istnieje różnica w definicji? Jakie jest również pochodzenie terminu „strata”? NB: Wspomnianej tu funkcji błędu nie należy mylić z normalnym błędem.
Dlaczego używamy rektyfikowanych jednostek liniowych (ReLU) z sieciami neuronowymi? Jak to poprawia sieć neuronową? Dlaczego mówimy, że ReLU jest funkcją aktywacyjną? Czy funkcja aktywacji softmax nie jest dostępna dla sieci neuronowych? Zgaduję, że używamy zarówno ReLU, jak i softmax: neuron 1 z wyjściem softmax ----> ReLU na wyjściu neuronu 1, …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.