Powiedz, że używam RNN / LSTM do analizy sentymentu, co jest podejściem typu jeden do jednego (patrz ten blog ). Sieć jest trenowana przez skróconą propagację wsteczną w czasie (BPTT), w której sieć jest rozwijana tylko przez 30 ostatnich kroków, jak zwykle. W moim przypadku każda z moich sekcji tekstowych, …
Jestem nowy w uczeniu maszynowym, więc próbuję znaleźć literaturę, ale nie jestem nawet pewien, po co Google. Moje dane mają następującą formę: User A performs Action P User B performs Action Q User C performs Action R ... User C performs Action X User A performs Action Y User B …
Kobieta, dla której pracowałem, poprosiła mnie o wykonanie jednokierunkowej ANOVA dla niektórych danych. Odpowiedziałem, że dane te były danymi z powtarzanych pomiarów (szeregów czasowych) i uważałem, że naruszenie zasady niezależności zostało naruszone. Odpowiedziała, że nie powinnam się martwić o założenia, po prostu wykonaj test, a ona weźmie pod uwagę, że …
Gdy odkrywam uczenie maszynowe, widzę różne interesujące techniki, takie jak: automatycznie dostraja algorytmy za pomocą technik takich jak grid search, uzyskać bardziej dokładne wyniki dzięki połączeniu różnych algorytmów tego samego „typ”, to jest boosting, uzyskać bardziej dokładne wyniki dzięki połączeniu różnych algorytmów (ale nie ten sam rodzaj algorytmów), to stacking, …
Studiuję, jak skonstruować 95% przedział ufności dla ilorazu szans ze współczynników uzyskanych w regresji logistycznej. Biorąc pod uwagę model regresji logistycznej, log(p1−p)=α+βxlog(p1−p)=α+βx \log\left(\frac{p}{1 - p}\right) = \alpha + \beta x \newcommand{\var}{\rm Var} \newcommand{\se}{\rm SE} tak, że x=0x=0x = 0 dla grupy kontrolnej i x=1x=1x = 1 dla grupy obserwacji. Czytałem …
Czy oprócz użyteczności jest jakieś uzasadnienie epistemiczne (matematyczne, filozoficzne, heurystyczne itp.) Dla używania sprzężonych priorów? A może jest to po prostu tyle, że zwykle jest to wystarczająco dobre przybliżenie i sprawia, że jest o wiele łatwiej?
Chciałbym wiedzieć, jak przekształcić wartości ujemne Log(), ponieważ mam dane heteroskedastyczne. Przeczytałem, że działa ze wzorem, Log(x+1)ale to nie działa z moją bazą danych i nadal otrzymuję NaN. Np. Dostaję ten komunikat ostrzegawczy (nie umieściłem całej bazy danych, ponieważ myślę, że jedna z moich wartości ujemnych wystarczy, aby pokazać przykład): …
Tak więc, patrząc na sieci neuronowe z funkcjami radialnymi, zauważyłem, że ludzie zawsze zalecają użycie 1 ukrytej warstwy, podczas gdy w wielowarstwowych sieciach neuronowych perceptronów więcej warstw uważa się za lepsze. Biorąc pod uwagę, że sieci RBF można trenować z wersją propagacji wstecznej, czy istnieją jakieś powody, dla których głębsze …
Więc ja i mój wujek spieramy się o to, czy rzut monetą jest naprawdę przypadkowy. Twierdzę, że nie jest tak, ponieważ w rzeczywistości bankomat zawsze manipuluje monetą, więc wynik nie wynosi 50/50, dlatego nie jest dobrym wyborem jako technika randomizacji do przypisywania grup w badaniach klinicznych. Twierdzi jednak, że losowość …
Rozważam dużą (ale skończoną) przestrzeń modeli o różnym stopniu złożoności, które eksploruję za pomocą RJMCMC . Wstęp na wektorze parametrów dla każdego modelu jest dość pouczający. W jakich przypadkach (jeśli w ogóle) powinienem się martwić paradoksem Jeffreysa-Lindleya faworyzującym prostsze modele, gdy jeden z bardziej złożonych modeli byłby bardziej odpowiedni? Czy …
Mam matrycę terminów dokumentowych , a teraz chciałbym wyodrębnić słowa kluczowe dla każdego dokumentu za pomocą nadzorowanej metody uczenia się (SVM, Naive Bayes, ...). W tym modelu używam już Tf-idf, znacznika Pos, ...M.M.M Ale teraz zastanawiam się nad kolejnymi. Mam macierz z podobieństwami cosinusowymi między warunkami.dodoC Czy istnieje możliwość wykorzystania …
W dwóch popularnych bibliotekach identyfikacji języka, Compact Language Detector 2 dla C ++ i wykrywaczu języka dla java, oba wykorzystały (oparte na znakach) n-gramach do wyodrębnienia funkcji tekstowych. Dlaczego nie używa się worka słów (pojedyncze słowo / słownik) i jakie są zalety i wady worka słów i n-gramów? Jakie są …
Jak interpretować wysokość wykresów gęstości: Na przykład na powyższym wykresie pik wynosi około 0,07 przy x = 18. Czy mogę wywnioskować, że około 7% wartości to około 18? Czy mogę być bardziej szczegółowy? Istnieje również drugi pik przy x = 30 o wysokości 0,02. Czy to znaczy, że około 2% …
Biorąc pod uwagę iid i , szukamy:X n ≈ N ( μ X , σ 2 X ) μ X ≈ 0N≥30N≥30N\geq30Xn≈N(μX,σ2X)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μX≈0μX≈0\mu_X \approx 0 dokładne przybliżone przybliżenie dystrybucji zamkniętej formy YN=∏1NXnYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} asymptotyczne ( wykładnicze ?) przybliżenie tego samego produktu To jest szczególny przypadek bardziej ogólnego pytania .μX≈0μX≈0\mu_X \approx 0
Cohena jest jednym z najczęstszych sposobów mierzenia wielkości efektu ( patrz Wikipedia ). Po prostu mierzy odległość między dwoma środkami pod względem zbiorczego odchylenia standardowego. Jak możemy uzyskać matematyczny wzór szacowania wariancji Cohena ? dddddd Edycja z grudnia 2015 r .: Z tym pytaniem wiąże się pomysł obliczania przedziałów ufności …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.