Czytałem o dwóch wersjach funkcji straty dla regresji logistycznej, która z nich jest poprawna i dlaczego? Z uczenia maszynowego , Zhou ZH (po chińsku), z :β=(w,b) and βTx=wTx+bβ=(w,b) and βTx=wTx+b\beta = (w, b)\text{ and }\beta^Tx=w^Tx +b l(β)=∑i=1m(−yiβTxi+ln(1+eβTxi))(1)(1)l(β)=∑i=1m(−yiβTxi+ln(1+eβTxi))l(\beta) = \sum\limits_{i=1}^{m}\Big(-y_i\beta^Tx_i+\ln(1+e^{\beta^Tx_i})\Big) \tag 1 Z mojego kursu na uczelni, z :zi=yif(xi)=yi(wTxi+b)zi=yif(xi)=yi(wTxi+b)z_i = y_if(x_i)=y_i(w^Tx_i …
Przeczytałem tę stronę: http://neuralnetworksanddeeplearning.com/chap3.html i powiedział, że sigmoidalna warstwa wyjściowa z entropią krzyżową jest dość podobna do warstwy wyjściowej softmax z prawdopodobieństwem logarytmicznym. co się stanie, jeśli użyję sigmoid z logarytmem prawdopodobieństwa lub softmax z entropią krzyżową w warstwie wyjściowej? czy to w porządku? ponieważ widzę, że istnieje niewielka różnica …
W prawie wszystkich pracach analitycznych, które kiedykolwiek przeprowadziłem, używam: set.seed(42) To hołd dla Autostopowicza po Galaktyce . Ale zastanawiam się, czy tworzę uprzedzenia, używając ciągle tego samego ziarna.
Rozumiem, co to jest posterior, ale nie jestem pewien, co oznacza ten drugi? Czym różnią się 2? Kevin P Murphy wskazał w swoim podręczniku Machine Learning: Probabilistic Perspective , że jest to „stan wewnętrznego przekonania”. Co to tak naprawdę oznacza? Miałem wrażenie, że przeor reprezentuje twoje wewnętrzne przekonania lub uprzedzenia, …
Uważam, że generowanie wykresów przez R może zająć dużo czasu, gdy obecne są miliony punktów - nic dziwnego, biorąc pod uwagę, że punkty są drukowane indywidualnie. Ponadto takie wykresy są często zbyt zagracone i gęste, aby były przydatne. Wiele punktów nakłada się i tworzy czarną masę, a wiele czasu spędza …
Jeśli wspólne prawdopodobieństwo jest przecięciem 2 zdarzeń, to czy wspólne prawdopodobieństwo 2 niezależnych zdarzeń nie powinno wynosić zero, ponieważ w ogóle się nie przecinają? Jestem zmieszany.
Sieć neuronowa uczy się cech zestawu danych jako sposobu na osiągnięcie pewnego celu. Po zakończeniu możemy chcieć dowiedzieć się, czego nauczyła się sieć neuronowa. Jakie były funkcje i dlaczego o to dbano. Czy ktoś może podać jakieś referencje na temat pracy, która dotyczy tego problemu?
Często widzę, że ludzie tworzą nowe funkcje w oparciu o istniejące funkcje związane z problemem uczenia maszynowego. Na przykład tutaj: https://triangleinequality.wordpress.com/2013/09/08/basic-feature-engineering-with-the-titanic-data/ ludzie uważają, że wielkość rodziny osoby jest nową funkcją na temat liczby braci, sióstr i rodziców, które były cechami istniejącymi. Ale po co to? Nie rozumiem, dlaczego tworzenie nowych …
Rozumiem, w jaki sposób otrzymujemy 3,5 jako oczekiwaną wartość dla rzutu rzetelną 6-stronną kostką. Ale intuicyjnie mogę spodziewać się każdej twarzy z równą szansą 1/6. Czyż zatem oczekiwana wartość rzutu kostką nie powinna być równa liczbie od 1 do 6 z jednakowym prawdopodobieństwem? Innymi słowy, na pytanie „jaka jest oczekiwana …
Ostatnio natknąłem się na artykuł, który proponuje użycie klasyfikatora k-NN w określonym zbiorze danych. Autorzy wykorzystali wszystkie dostępne próbki danych, aby przeprowadzić k-krotną weryfikację krzyżową dla różnych wartości k i zgłosić wyniki walidacji krzyżowej najlepszej konfiguracji hiperparametrów. Według mojej wiedzy wynik ten jest stronniczy i powinni zachować osobny zestaw testowy, …
Moje pytanie wypływa z tego komentarza na blogu Andrew Gelmana, w którym opowiada się za stosowaniem 50% przedziałów ufności zamiast 95% przedziałów ufności, chociaż nie dlatego, że są one dokładniej oszacowane: Wolę przerwy od 50% do 95% z 3 powodów: Stabilność obliczeniowa, Bardziej intuicyjna ocena (połowa 50% przedziałów powinna zawierać …
Wzór na warunkowe prawdopodobieństwo wystąpienia biorąc pod uwagę, że zdarzyło się , jest następujący: P \ left (\ text {A} ~ \ middle | ~ \ text {B} \ right) = \ frac { P \ left (\ text {A} \ cap \ text {B} \ right)} {P \ left …
Niech i będą procesami białego szumu. Czy możemy powiedzieć, że jest koniecznie procesem białego szumu?b t c t = a t + b tatata_tbtbtb_tct=at+btct=at+btc_t=a_t+b_t
Próbuję napisać serię postów na blogu o wartościach p i pomyślałem, że warto wrócić do miejsca, w którym wszystko się zaczęło - co wydaje się być artykułem Pearsona z 1900 roku. Jeśli znasz ten papier, pamiętasz, że obejmuje to testowanie dopasowania. Pearson jest nieco luźny w swoim języku, jeśli chodzi …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.