Moje główne pytanie dotyczy prób zrozumienia, w jaki sposób k-krotna walidacja krzyżowa pasuje w kontekście posiadania zestawów szkoleniowych / walidacyjnych / testowych (jeśli w ogóle pasuje w takim kontekście). Zwykle ludzie mówią o podziale danych na zestaw treningowy, walidacyjny i testowy - powiedzmy w stosunku 60/20/20 na kurs Andrew Ng …
Czy koszt entropii krzyżowej ma sens w kontekście regresji (w przeciwieństwie do klasyfikacji)? Jeśli tak, czy możesz podać przykład zabawki za pośrednictwem TensorFlow? Jeśli nie, dlaczego nie? Czytałem o entropii krzyżowej w sieciach neuronowych i głębokim uczeniu się Michaela Nielsena i wydaje się, że można to naturalnie wykorzystać do regresji …
Według mojego (bardzo podstawowego) zrozumienia Naive Bayes szacuje prawdopodobieństwa na podstawie częstotliwości klasowych każdej cechy w danych treningowych. Ale jak oblicza częstotliwość zmiennych ciągłych? A kiedy przewidujesz, jak klasyfikuje nową obserwację, która może nie mieć takich samych wartości jak żadna obserwacja w zestawie treningowym? Czy używa jakiegoś pomiaru odległości lub …
Próbuję zwiększyć gradient w zbiorze danych z częstością zdarzeń około 1% przy użyciu Enterprise Minera, ale nie daje żadnego wyniku. Moje pytanie brzmi: skoro jest to podejście oparte na drzewku decyzyjnym, czy w ogóle warto stosować zwiększanie gradientu przy tak niskim zdarzeniu?
W niektórych samouczkach stwierdziłem, że inicjalizacja wagi „Xaviera” (papier: Zrozumienie trudności w uczeniu głębokich sieci neuronowych ze sprzężeniem zwrotnym ) jest skutecznym sposobem inicjalizacji wag sieci neuronowych. W przypadku w pełni połączonych warstw w tych samouczkach obowiązywała zasada: Var(W)=2nin+nout,simpler alternative:Var(W)=1ninVar(W)=2nin+nout,simpler alternative:Var(W)=1ninVar(W) = \frac{2}{n_{in} + n_{out}}, \quad \text{simpler alternative:} \quad Var(W) …
Dlaczego obszar pod krzywą ROC to prawdopodobieństwo, że klasyfikator uszereguje losowo wybraną „pozytywną” instancję (na podstawie uzyskanych prognoz) wyższą niż przypadkowo wybrana „pozytywna” instancja (z oryginalnej pozytywnej klasy)? W jaki sposób można udowodnić matematycznie to stwierdzenie za pomocą całki, podając CDF i PDF prawdziwie dodatnie i ujemne rozkłady klas?
Wiem, że dla zmiennej ciągłej .P.[ X=x]=0P[X=x]=0P[X=x]=0 Ale nie mogę sobie wyobrazić, że jeśli , istnieje nieskończona liczba możliwych . A także dlaczego ich prawdopodobieństwa stają się nieskończenie małe?xP[X=x]=0P.[X=x]=0P[X=x]=0xxx
Czy ktoś może podać intuicję, dlaczego wyższe momenty rozkładu prawdopodobieństwa , podobnie jak moment trzeci i czwarty, odpowiadają odpowiednio skośności i kurtozie? W szczególności dlaczego odchylenie dotyczące średniej podniesionej do trzeciej lub czwartej potęgi ostatecznie przekłada się na miarę skośności i kurtozy? Czy istnieje sposób na odniesienie tego do trzeciej …
Wiem, że dywergencja KL nie jest symetryczna i nie można jej uważać za miarę. Jeśli tak, to dlaczego jest używane, gdy JS Divergence spełnia wymagane właściwości metryki? Czy istnieją scenariusze, w których można zastosować dywergencję KL, ale nie dywergencję JS lub odwrotnie?
Czytałem o sztuczce log-sum-exp w wielu miejscach (np. Tutaj i tutaj ), ale nigdy nie widziałem przykładu, w jaki sposób jest ona stosowana konkretnie do klasyfikatora Naive Bayes (np. Z funkcjami dyskretnymi i dwiema klasami) Jak dokładnie można uniknąć problemu niedopełnienia liczb przy użyciu tej sztuczki?
Do pracy badawczej korzystałem z jednej klasy SVM , zaimplementowanej w scikit-learn. Ale nie rozumiem tego dobrze. Czy ktoś może podać proste, dobre wyjaśnienie jednej klasy SVM ?
MLE = oszacowanie maksymalnego prawdopodobieństwa MAP = Maksimum a posteriori MLE jest intuicyjny / naiwny, ponieważ zaczyna się od prawdopodobieństwa obserwacji danego parametru (tj. Funkcji prawdopodobieństwa) i próbuje znaleźć parametr najlepiej zgodny z obserwacją . Ale nie bierze pod uwagę wcześniejszej wiedzy. MAP wydaje się bardziej rozsądny, ponieważ bierze pod …
Próbuję zrozumieć koncepcję nadmiernej dyspersji w regresji logistycznej. Czytałem, że nadmierna dyspersja występuje wtedy, gdy zaobserwowana wariancja zmiennej odpowiedzi jest większa niż można by oczekiwać po rozkładzie dwumianowym. Ale jeśli zmienna dwumianowa może mieć tylko dwie wartości (1/0), to jak może mieć średnią i wariancję? Nie przeszkadza mi obliczanie średniej …
Zdaję sobie sprawę, że jest to prawdopodobnie bardzo proste pytanie, ale po przeszukaniu nie mogę znaleźć odpowiedzi, której szukam. Mam problem, w którym muszę ustandaryzować zmienne uruchamiające (regresję grzbietu), aby obliczyć szacunki grzbietu bet. Następnie muszę przekonwertować je z powrotem do oryginalnej skali zmiennych. Ale jak to zrobić? Znalazłem wzór …
Mam pytanie dotyczące optymalizacji parametrów, gdy korzystam z 10-krotnej walidacji krzyżowej. Chcę zapytać, czy parametry powinny zostać naprawione podczas treningu modelu każdego złożenia, tj. (1) wybierz jeden zestaw zoptymalizowanych parametrów dla średniej dokładności każdego złożenia. lub (2) Powinienem znaleźć zoptymalizowany parametr dla każdego zagięcia, a następnie każde zagięcie używa różnych …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.