Jakie są główne różnice między danymi rzadkimi a brakującymi? Jak wpływa na uczenie maszynowe? Mówiąc dokładniej, jaki wpływ rzadkie dane i brakujące dane mają na algorytmy klasyfikacji i algorytmy regresji (przewidywania liczb). Mówię o sytuacji, w której odsetek brakujących danych jest znaczny i nie możemy upuścić wierszy zawierających brakujące dane.
Z podręcznika Prognozowanie: Zasady i praktyka autorstwa Roba J Hyndmana i George'a Athanasopoulosa , w szczególności rozdziału dotyczącego pomiaru dokładności : Metoda prognozy, która minimalizuje MAE, doprowadzi do prognoz mediany, a minimalizacja RMSE doprowadzi do prognoz średniej Czy ktoś może podać intuicyjne wyjaśnienie, dlaczego minimalizacja MAE prowadzi do prognozowania mediany, …
Poświęciłem dużo czasu na opracowanie metod i oprogramowania do walidacji modeli predykcyjnych w tradycyjnej dziedzinie statystyki częstokroć. Wprowadzając w życie więcej pomysłów bayesowskich i nauczając, dostrzegam kilka kluczowych różnic do przyjęcia. Po pierwsze, bayesowskie modelowanie predykcyjne prosi analityka o przemyślenie wcześniejszych dystrybucji, które można dostosować do cech kandydujących, a ci …
Ostatnio dowiedziałem się, że jednym ze sposobów znajdowania lepszych rozwiązań problemów ML jest tworzenie funkcji. Można to zrobić, na przykład sumując dwie funkcje. Na przykład, mamy dwie cechy: „atak” i „obrona” jakiegoś bohatera. Następnie tworzymy dodatkową funkcję o nazwie „total”, która jest sumą „ataku” i „obrony”. Teraz wydaje mi się …
Ostatnio odkryłem, że w stosowanej literaturze ekonometrycznej, gdy mamy do czynienia z problemami wyboru cech, nierzadko wykonuje się LASSO, a następnie regresję OLS przy użyciu wybranych zmiennych. Zastanawiałem się, jak możemy zakwalifikować ważność takiej procedury. Czy spowoduje to problemy takie jak pominięte zmienne? Jakieś dowody wskazujące, że jest on bardziej …
Mam model głębokiej sieci neuronowej i muszę go wyszkolić na moim zestawie danych, który składa się z około 100 000 przykładów, moje dane weryfikacyjne zawierają około 1000 przykładów. Ponieważ trenowanie każdego przykładu zajmuje trochę czasu (około 0,5 s dla każdego przykładu) i aby uniknąć nadmiernego dopasowania, chciałbym zastosować wcześniejsze zatrzymanie, …
Próbuję zrozumieć różne architektury RNN (Recurrent Neural Network), które mają być zastosowane do danych szeregów czasowych, i zaczynam się mylić z różnymi nazwami, które są często używane przy opisywaniu RNN. Czy struktura Długiej pamięci krótkoterminowej (LSTM) i Gated Recurrent Unit (GRU) jest zasadniczo RNN z pętlą sprzężenia zwrotnego?
To prawdopodobnie trywialne pytanie, ale do tej pory moje poszukiwania były bezowocne, w tym w tym artykule na Wikipedii i dokumencie „Kompendium dystrybucji” . Jeśli XXX ma rozkład równomierny, czy oznacza to, że miXmiXe^X ma rozkład wykładniczy? Podobnie, jeśli YYY ma rozkład wykładniczy, czy to znaczy, że l n ( …
Słyszałem, że Jaynes twierdzi, że częstokroć operatorzy działają „z ukrytym uprzedzeniem”. Co to są lub są te ukryte priorytety? Czy to oznacza, że modele częste to wszystkie specjalne przypadki modeli bayesowskich, które czekają na odkrycie?
Dlaczego podczas treningu głębokich i płytkich sieci neuronowych powszechnie stosuje się metody gradientowe (np. Opadanie gradientu, Niestierow, Newton-Raphson), w przeciwieństwie do innych metaheurystyk? Przez metaheurystykę rozumiem metody takie jak symulowane wyżarzanie, optymalizacja kolonii mrówek itp., Które zostały opracowane w celu uniknięcia utknięcia w lokalnych minimach.
Intuicyjnie średnia to tylko średnia z obserwacji. Wariancja polega na tym, jak bardzo te obserwacje różnią się od średniej. Chciałbym wiedzieć, dlaczego odwrotność wariancji jest znana jako precyzja. Jaką intuicję możemy z tego zrobić? I dlaczego macierz precyzji jest tak przydatna jak macierz kowariancji w rozkładzie wielowymiarowym (normalnym)? Wgląd proszę?
Czytam rozdział dotyczący kompromisu wariancji odchylenia w elementach statystycznego uczenia się i mam wątpliwości co do wzoru na stronie 29. Niech dane pochodzą z modelu takiego, że gdzie jest losowy liczba o oczekiwanej wartości i wariancja . Niech oczekiwana wartość błędu modelu wynosi gdzie jest prognozą naszego ucznia. Zgodnie z …
W tym artykule autor łączy liniową analizę dyskryminacyjną (LDA) z analizą głównych składników (PCA). Przy mojej ograniczonej wiedzy nie jestem w stanie śledzić, w jaki sposób LDA może być nieco podobny do PCA. Zawsze uważałem, że LDA jest formą algorytmu klasyfikacji, podobną do regresji logistycznej. Będę wdzięczny za pomoc w …
Używałem theano do eksperymentowania z LSTM i zastanawiałem się, jakie metody optymalizacji (SGD, Adagrad, Adadelta, RMSprop, Adam itp.) Działają najlepiej dla LSTM? Czy są jakieś prace badawcze na ten temat? Czy odpowiedź zależy również od rodzaju aplikacji, dla której używam LSTM? Jeśli tak, używam LSTM do klasyfikacji tekstu (gdzie tekst …
W kontekście regresji OLS rozumiem, że wykres resztkowy (w porównaniu z dopasowanymi wartościami) jest konwencjonalnie oglądany w celu przetestowania stałej wariancji i oceny specyfikacji modelu. Dlaczego reszty są wykreślane względem pasowań, a nie wartości ? Czym różnią się informacje od tych dwóch wykresów?YYY Pracuję nad modelem, który wytworzył następujące wykresy …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.