W notatkach z 3 wykładów z kursu Coursera Machine Learning Andrew Ng do funkcji kosztów dodawany jest termin w celu wdrożenia regularyzacji: jot+( θ ) = J( θ ) +λ2 m∑j = 1nθ2)jotJ+(θ)=J(θ)+λ2m∑j=1nθj2J^+(\theta) = J(\theta) + \frac{\lambda}{2m} \sum_{j=1}^n \theta_j^2 Notatki z wykładu mówią: Możemy również uregulować wszystkie nasze parametry theta …
W najnowszym artykule WaveNet autorzy odnoszą się do swojego modelu jako stosu warstw rozszerzonych splotów. Tworzą również następujące wykresy wyjaśniające różnicę między zwinięciem „zwykłym” a zwężeniem rozszerzonym. Wyglądają zwykłe sploty Jest to splot o wielkości filtra 2 i kroku 1, powtarzany dla 4 warstw. Następnie pokazują architekturę stosowaną przez ich …
Próbowanie zrozumienia związku między entropią krzyżową a zakłopotaniem. Na ogół dla modelu M , Perplexity (M) = 2 ^ entropii (M) . Czy ta relacja obowiązuje dla wszystkich różnych n-gramów, tj. Unigram, bigram itp.?
Standardowy błąd proporcji będzie największy, jaki może być dla danego N, gdy proporcja wynosi 0,5, a zmniejsza się wraz ze wzrostem proporcji od 0,5. Rozumiem, dlaczego tak jest, gdy patrzę na równanie błędu standardowego proporcji, ale nie mogę tego dalej wyjaśniać. Czy istnieje wyjaśnienie poza matematycznymi właściwościami formuły? Jeśli tak, …
Chcę oszacować rozbieżność KL między dwoma ciągłymi rozkładami f i g. Nie mogę jednak zapisać gęstości dla f lub g. Mogę próbkować zf i g za pomocą jakiejś metody (na przykład markov chain Monte Carlo). Rozbieżność KL od f do g jest zdefiniowana w następujący sposób reK.L.( f| | sol) …
Wyobraź sobie, że mamy model regresji liniowej ze zmienną zależną yyy. Znajdziemy toR2)yRy2R^2_y. Teraz wykonujemy kolejną regresję, ale tym razemlog( y)log(y)\log(y)i podobnie znajdź R2)log( y)Rlog(y)2R^2_{\log(y)}. Powiedziano mi, że nie mogę porównać obuR2)R2R^2aby zobaczyć, który model jest bardziej odpowiedni. Dlaczego? Podany mi powód był taki, że będziemy porównywać zmienność różnych wielkości …
Mam zestaw danych z trzema zmiennymi, gdzie wszystkie zmienne są liczbowe. Nazwijmy to , i . Dopasowuję model regresji z perspektywy Bayesa za pomocą MCMCyyyx1x1x_1x2x2x_2rjags Zrobiłem analizę eksploracyjną, a wykres rozrzutu sugeruje, że należy użyć wyrażenia kwadratowego. Następnie zamontowałem dwa modeley×x2y×x2y\times x_2 (1)y=β0+β1∗x1+β2∗x2y=β0+β1∗x1+β2∗x2y=\beta_0+\beta_1*x_1+\beta_2*x_2 (2)y=β0+β1∗x1+β2∗x2+β3∗x1x2+β4∗x21+β5∗x22y=β0+β1∗x1+β2∗x2+β3∗x1x2+β4∗x12+β5∗x22y=\beta_0+\beta_1*x1+\beta_2*x_2+\beta_3*x_1x_2+\beta_4*x_1^2+\beta_5*x_2^2 W modelu 1 wielkość efektu każdego …
Gdzie mogę znaleźć dowód twierdzenia Pitmana – Koopmana – Darmois? Od dłuższego czasu korzystam z Google. Co dziwne, wiele notatek wspomina o tym twierdzeniu, ale żadna z nich nie przedstawia dowodu.
Jeśli użyję wcześniej Jeffreysa dla dwumianowego parametru prawdopodobieństwa oznacza to użycie rozkładu .θθ\thetaθ∼beta(1/2,1/2)θ∼beta(1/2,1/2)\theta \sim beta(1/2,1/2) Jeśli przekształcę się w nowy układ odniesienia wówczas wyraźnie nie będzie również dystrybuowane jako rozkład .ϕ=θ2ϕ=θ2\phi = \theta^2ϕϕ\phibeta(1/2,1/2)beta(1/2,1/2)beta(1/2,1/2) Moje pytanie brzmi: w jakim sensie Jeffreys był niezmienny przed reparametryzacją? Myślę, że nie rozumiem tematu szczerze …
Czy istnieje wielowymiarowa alternatywa dla testu dwóch prób Kołmogorowa-Smirnowa ? Chodzi mi o test, który można wykorzystać do sprawdzenia, gdy różnią się dwa podstawowe rozkłady wielowymiarowe.
Mam zestaw danych z kolumnami a b c(3 atrybuty). ajest liczbowy i ciągły, ba jednocześnie cjest kategoryczny, każdy z dwoma poziomami. Używam K-Najbliższa metody sąsiadów do klasyfikowania ai bna c. Aby móc mierzyć odległości, przekształcam mój zestaw danych, usuwając bi dodając b.level1i b.level2. Jeśli obserwacja ima pierwszy poziom w bkategoriach, …
Zastanawiam się, czy odchylenie standardowe zawsze było budowane przy założeniu rozkładu normalnego. Innymi słowy, jeśli próbka nie jest normalnie dystrybuowana, to czy stosowanie standardowego odchylenia należy uznać za błąd?
Właśnie uruchomiłem FA przy użyciu skośnego obrotu (promax), a element dał ładunek czynnikowy wynoszący 1.041 na jeden czynnik, (i ładunki czynnikowe -.131, -.119 i .065 na innych czynnikach przy użyciu macierzy wzorów ) . I nie jestem pewien, co to znaczy, myślałem, że może to być tylko od -1 do …
W tym popularnym pytaniu , wysoko oceniona odpowiedź powoduje, że MLE i Baum Welch są osobni w dopasowaniu HMM. W przypadku problemu szkoleniowego możemy użyć następujących 3 algorytmów: MLE (szacowanie maksymalnego prawdopodobieństwa), szkolenie Viterbi (NIE mylić z dekodowaniem Viterbi), Baum Welch = algorytm przewijania do przodu ALE w Wikipedii , …
Co w artykule „Szybszy RCNN”, gdy mówimy o zakotwiczeniu, co oznaczają przez użycie „piramid pól referencyjnych” i jak to się robi? Czy to tylko oznacza, że w każdym punkcie kotwiczenia W * H * k generowana jest ramka ograniczająca? Gdzie W = szerokość, H = wysokość, a k = liczba …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.