Algorytmy uczenia maszynowego budują model danych szkoleniowych. Termin „uczenie maszynowe” jest niejasno zdefiniowany; obejmuje to tak zwane uczenie statystyczne, uczenie wzmacniające, uczenie bez nadzoru itp. ZAWSZE DODAJ SZCZEGÓŁOWĄ TAGĘ.
Znam podstawy SVM i SVR, ale wciąż nie rozumiem, jak problem znalezienia hiperpłaszczyzny, która maksymalizuje margines, pasuje do SVR. Po drugie, przeczytałem coś o używanym jako margines tolerancji w SVR. Co to znaczy?ϵϵ\epsilon Po trzecie, czy jest jakaś różnica między parametrami funkcji decyzyjnej stosowanymi w SVM i SVR?
Zawsze czytałem termin interakcja w kontekście regresji. Czy powinniśmy również rozważyć interakcje z różnymi modelami, np. Knn lub svm? Jeśli jest , lub nawet więcej funkcji i powiedzmy obserwacji, jaki jest zwykle sposób na znalezienie użytecznych interakcji? Wypróbować wszystkie kombinacje? Lub użyj tylko kombinacji, które mają sens?505050100100100100010001000
Szukam zasobów (książek, notatek z wykładów itp.) Na temat technik, które mogą obsługiwać dane, które mają wiele celów (np .: trzy zmienne zależne: 2 dyskretne i 1 ciągłe). Czy ktoś ma jakieś zasoby / wiedzę na ten temat? Wiem, że można do tego wykorzystać sieci neuronowe.
Próbuję osadzić około 60 milionów fraz w przestrzeni wektorowej , a następnie obliczyć podobieństwo między nimi. Używam sklearn's CountVectorizerz niestandardową wbudowaną funkcją tokenizera, która produkuje unigramy i bigramy. Okazuje się, że aby uzyskać sensowne reprezentacje, muszę pozwolić na ogromną liczbę kolumn, liniowych w liczbie wierszy. Prowadzi to do niewiarygodnie rzadkich …
Załóżmy, że chcę nauczyć się klasyfikatora, który przyjmuje wektor liczb jako dane wejściowe i podaje etykietę klasy jako dane wyjściowe. Moje dane treningowe składają się z dużej liczby par przepływów międzygałęziowych. Jednak kiedy przechodzę do testowania niektórych nowych danych, dane te są zwykle tylko częściowo kompletne. Na przykład, jeśli wektor …
Używam procesu Gaussa (GP) do regresji. W moim problemie dość często zdarza się, że dwa lub więcej punktów danych są blisko siebie, względem długości skale problemu. Obserwacje mogą być również bardzo głośne. Aby przyspieszyć obliczenia i poprawić precyzję pomiaru , naturalne wydaje się łączenie / integrowanie skupisk punktów, które są …
Przeglądam sekcję LAB §6.6 na temat regresji grzbietu / Lasso w książce „An Introduction to Statistics Learning with Applications in R” Jamesa, Witten, Hastie, Tibshirani (2013). Mówiąc dokładniej, próbuję zastosować model scikit-learn Ridgedo zestawu danych „Hitters” z pakietu R „ISLR”. Stworzyłem ten sam zestaw funkcji, jak pokazano w kodzie R. …
Załóżmy, że dwie klasy i mają atrybut i mają rozkład i . jeśli mamy równe wcześniejsze dla następującej macierzy kosztów:C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} dlaczego jest progiem dla minimalnego klasyfikatora ryzyka (kosztu)?x0<0.5x0<0.5x_0 < 0.5 Oto mój przykład notatki, …
Czy ktoś może mi wytłumaczyć, kiedy użyć nieczystości Gini i pozyskiwania informacji do drzew decyzyjnych? Czy możesz podać mi sytuacje / przykłady, kiedy najlepiej korzystać z których?
Zajmuję się tworzeniem aplikacji do prognozowania, której celem jest umożliwienie importerowi prognozowania popytu na jego produkty z sieci klientów-dystrybutorów. Dane dotyczące sprzedaży są dość dobrym wskaźnikiem popytu, o ile istnieją odpowiednie zapasy, aby zaspokoić popyt. Kiedy jednak zapasy są zmniejszane do zera (sytuacja, w której staramy się pomóc naszemu klientowi …
Ostatnio próbuję dowiedzieć się więcej na temat uczenia się online (to absolutnie fascynujące!), A jednym z tematów, którego nie byłem w stanie dobrze zrozumieć, jest sposób myślenia o wyborze modelu w kontekście offline i online. Konkretnie, załóżmy, szkolimy klasyfikator w trybie offline, na podstawie pewnego ustalonego zbioru danych . Powiedzmy, …
Jestem nowicjuszem w uczeniu maszynowym (także niektóre statystyki), od dłuższego czasu uczę się wiedzy (algorytmy uczenia nadzorowanego / bez nadzoru, odpowiednie metody optymalizacji, regularyzacje, niektóre filozofie (takie jak kompromis odchylenie biasu?). Wiem, że bez prawdziwej praktyki nie uzyskałbym głębokiego zrozumienia tych rzeczy związanych z uczeniem maszynowym. Zacznę więc od pewnego …
Robię ML na moim uniwersytecie, a profesor wspomniał termin Oczekiwanie (E), podczas gdy on próbował wyjaśnić nam kilka rzeczy na temat procesów Gaussa. Ale ze sposobu, w jaki to wyjaśnił, zrozumiałem, że E jest takie samo jak średnia μ. Czy zrozumiałem, prawda? Jeśli jest tak samo, to czy wiesz, dlaczego …
Znalazłem bardzo pomocny samouczek dotyczący algorytmu EM . Przykład i zdjęcie z samouczka jest po prostu genialne. Powiązane pytanie dotyczące obliczania prawdopodobieństwa, jak działa maksymalizacja oczekiwań? Mam inne pytanie dotyczące połączenia teorii opisanej w samouczku z przykładem. Podczas kroku E, EM wybiera funkcję która ogranicza i dla której .soltgtg_tlogP.( x …
Czy istnieje strategia wyboru liczby drzew w GBM? W szczególności, ntreesargument R„s gbmfunkcji. Nie rozumiem, dlaczego nie powinieneś ustawić ntreesnajwyższej rozsądnej wartości. Zauważyłem, że większa liczba drzew wyraźnie zmniejsza zmienność wyników z wielu GBM. Nie sądzę, aby duża liczba drzew prowadziła do nadmiernego dopasowania. jakieś pomysły?
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.