Przeprowadzam zagnieżdżoną weryfikację krzyżową. Czytałem, że krzyżowa walidacja z pominięciem jednego może być stronnicza (nie pamiętam dlaczego). Czy lepiej jest używać 10-krotnej walidacji krzyżowej czy pomijanej walidacji krzyżowej oprócz dłuższego czasu wykonywania dla krzyżowej walidacji pomijanej?
W ostatnim dobrze odebranym pytaniu Tim pyta, kiedy niezrównoważone dane naprawdę stanowią problem w uczeniu maszynowym ? Przesłanka tego pytania polega na tym, że istnieje wiele literatury dotyczącej uczenia maszynowego, która omawia równowagę klas i problem niezrównoważonych klas . Chodzi o to, że zestawy danych z nierównowagą między klasą dodatnią …
Zgodnie z tą i tą odpowiedzią autoencodery wydają się być techniką wykorzystującą sieci neuronowe do redukcji wymiarów. Chciałbym dodatkowo wiedzieć, czym jest wariacyjny autoencoder (jego główne różnice / zalety w stosunku do „tradycyjnych” autoencoderów), a także jakie są główne zadania edukacyjne, do których są wykorzystywane te algorytmy.
Próbuję zrozumieć regresję kwantową, ale jedną rzeczą, która sprawia, że cierpię, jest wybór funkcji straty. ρτ(u)=u(τ−1{u<0})ρτ(u)=u(τ−1{u<0})\rho_\tau(u) = u(\tau-1_{\{u<0\}}) Wiem, że minimalne oczekiwanie na jest równe kwantile , ale jaki jest intuicyjny powód, aby zacząć od tej funkcji? Nie widzę związku między minimalizowaniem tej funkcji a kwantylem. Czy ktoś może mi …
Właśnie skończyłem czytać świetną książkę Wprowadzenie do Empirical Bayes . Myślałem, że książka jest świetna, ale budowanie priorów z danych wydawało się złe. Zostałem przeszkolony, że opracowujesz plan analizy, następnie gromadzisz dane, a następnie testujesz hipotezę, którą wcześniej określiłeś w swoim planie analizy. Kiedy przeprowadzasz analizę danych, które już zostały …
Jestem trochę zdezorientowany co do zalet mieszanych modeli w zakresie modelowania predykcyjnego. Ponieważ modele predykcyjne mają zwykle przewidywać wartości wcześniej nieznanych obserwacji, wydaje mi się oczywiste, że jedynym sposobem, w jaki model mieszany może być użyteczny, jest jego zdolność do przewidywania na poziomie populacji (to znaczy bez dodawania żadnych efektów …
Ujemny rozkład dwumianowy (NB) jest zdefiniowany na nieujemnych liczbach całkowitych i ma funkcję masy prawdopodobieństwa fa( k ; r , p ) = ( k + r - 1k) pk( 1 - p )r.f(k;r,p)=(k+r−1k)pk(1−p)r.f(k;r,p)={\binom {k+r-1}{k}}p^{k}(1-p)^{r}.Czy ma sens rozważenie ciągłego rozkładu na liczbach rzeczywistych nieujemnych zdefiniowanych przez tę samą formułę (zastępując …
Piszę krótki esej teoretyczny na kurs statystyki bayesowskiej (w mgr ekonomii) na temat nieinformacyjnych priorów i staram się zrozumieć, jakie są etapy rozwoju tej teorii. Do tej pory moja oś czasu składa się z trzech głównych kroków: zasada obojętności Laplace'a (1812), priory non-invariant (Jeffreys (1946)), odniesienie Bernardo przed (1979). Z …
Próbuję ustalić, kto wynalazł strukturę danych i algorytm drzewa decyzyjnego. We wpisie w Wikipedii dotyczącym uczenia się drzewa decyzyjnego jest twierdzenie, że „ID3 i CART zostały wynalezione niezależnie mniej więcej w tym samym czasie (między 1970 a 1980)”. ID3 został zaprezentowany później w: Quinlan, JR 1986. Indukcja drzew decyzyjnych. Mach. …
Obecnie pracuję nad problemem, w którym muszę opracować algorytm Monte Carlo (MCMC) łańcucha Markowa dla modelu przestrzeni stanów. Aby móc rozwiązać problem, podano mi następujące prawdopodobieństwo : p ( ) = 2I ( > 0) / (1+ ). jest odchyleniem standardowym .ττ\tauττ\tauττ\tauτ2)τ2)\tau^2ττ\tauxxx Więc teraz wiem, że jest to rozkład w …
Czytałem o optymalizatorze Adama do głębokiego uczenia się i natknąłem się na następujące zdanie w nowej książce Deep Learning autorstwa Bengio, Goodfellow i Courville: Adam jest ogólnie uważany za dość odpornego na wybór hiper parametrów, chociaż szybkość uczenia się czasami trzeba zmienić w stosunku do sugerowanego domyślnego. jeśli to prawda, …
Czy jest coś istotnego w średniej geometrycznej i średniej arytmetycznej, które są bardzo blisko siebie, powiedzmy ~ 0,1%? Jakie są domysły na temat takiego zbioru danych? Pracowałem nad analizą zestawu danych i zauważam, że jak na ironię wartości są bardzo, bardzo bliskie. Nie do końca, ale blisko. Szybka kontrola rozsądności …
Wiemy, że musimy zastosować korekty podobne do Benjaminiego Hochberga do testowania wielu hipotez w eksperymentach opartych na jednym zestawie danych, w celu kontroli częstotliwości fałszywych odkryć, w przeciwnym razie wszystkie eksperymenty, które dadzą pozytywny wynik, mogą być fałszywe. Ale dlaczego nie stosujemy tej samej zasady do wszystkich eksperymentów od samego …
Inspiracja do tego pytania pochodzi z dobrze znanego artykułu Leo-Breimana znanego z artykułu Modelowanie statystyczne: Dwie kultury (dostępny otwarty dostęp). Autor porównuje to, co widzi jako dwa odmienne podejścia do analizy danych, dotykające kluczowych pomysłów w klasycznej statystyce i uczeniu maszynowym. Jednak artykuł jest zrozumiały dla szerokiego grona odbiorców - …
ANOVA a wielokrotna regresja liniowa? Rozumiem, że obie te metody wydają się wykorzystywać ten sam model statystyczny. Jednak w jakich okolicznościach powinienem skorzystać z której metody? Jakie są zalety i wady tych metod w porównaniu? Dlaczego ANOVA jest tak często stosowana w badaniach eksperymentalnych i rzadko znajduję badanie regresji?
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.