Często wspomina się, że rektyfikowane jednostki liniowe (ReLU) zastąpiły jednostki softplus, ponieważ są liniowe i szybsze w obliczeniach. Czy softplus nadal ma tę zaletę, że indukuje rzadkość, czy też jest ograniczony do ReLU? Pytam o to, dlatego zastanawiam się nad negatywnymi konsekwencjami zerowego nachylenia ReLU. Czy ta właściwość nie „pułapkuje” …
Powiedzmy, że mam dwa zdarzenia, A i B, i niektóre parametry dystrybucji , i chciałbym spojrzeć na P ( A | B , θ ) .θθ \theta P(A|B,θ)P(A|B,θ)P(A | B,\theta) Zatem najprostsza definicja prawdopodobieństwa warunkowego to, biorąc pod uwagę niektóre zdarzenia A i B, następnie . Więc jeśli istnieje wiele …
Po przeprowadzeniu analizy głównego składnika (PCA) chcę rzutować nowy wektor na przestrzeń PCA (tzn. Znaleźć jego współrzędne w układzie współrzędnych PCA). Mam obliczony PCA w języku R użyciu prcomp. Teraz powinienem być w stanie pomnożyć mój wektor przez macierz obrotu PCA. Czy główne elementy tej macierzy powinny być ułożone w …
Za pomocą następującego zestawu danych chciałem sprawdzić, czy odpowiedź (efekt) zmienia się w odniesieniu do witryn, sezonu, czasu trwania i ich interakcji. Niektóre internetowe fora poświęcone statystykom sugerowały, żebym kontynuował liniowe modele z efektami mieszanymi, ale problem polega na tym, że ponieważ replikacje są losowe w każdej stacji, nie mam …
Uczę się o funkcji empirycznej kumulatywnej dystrybucji. Ale nadal nie rozumiem Dlaczego nazywa się to „empirycznym”? Czy jest jakaś różnica między Empirical CDF a CDF?
W statystyce klasycznej istnieje definicja, że statystyka zbioru danych jest zdefiniowana jako kompletna dla parametru nie jest możliwe sformułowanie z niej obiektywnego estymatora sposób nietrwały. Oznacza to, że jedynym sposobem na uzyskanie dla wszystkich jest prawie na pewno równe .TT.Ty1,…,yny1,…,yny_1, \ldots, y_nθθ\theta000Eh(T(y))=0mih(T.(y))=0E h(T (y )) = 0θθ\thetahhh000 Czy kryje się …
W mojej klasie prawdopodobieństwa ciągle stosowane są terminy „sumy zmiennych losowych”. Jednak utknąłem na tym, co to dokładnie oznacza? Czy mówimy o sumie wielu realizacji z zmiennej losowej? Jeśli tak, to czy to nie stanowi pojedynczej liczby? W jaki sposób suma realizacji zmiennych losowych prowadzi nas do dystrybucji lub jakiejkolwiek …
Zadaję pytanie dotyczące łańcuchów Markowa, a dwie ostatnie części mówią: Czy ten łańcuch Markowa ma ograniczający rozkład. Jeśli Twoja odpowiedź brzmi „tak”, znajdź dystrybucję ograniczającą. Jeśli Twoja odpowiedź brzmi „nie”, wyjaśnij dlaczego. Czy ten łańcuch Markowa ma rozkład stacjonarny. Jeśli Twoja odpowiedź brzmi „tak”, znajdź rozkład stacjonarny. Jeśli Twoja odpowiedź …
Oceniam model fizyczny i chciałbym wiedzieć, której z metod powinienem tutaj użyć (między RMSE a współczynnikiem determinacji R2) Problem jest następujący: Mam funkcję, która wyświetla prognozy dla wartości wejściowej x, . Mam też faktyczną obserwację tej wartości, którą nazywam yyx¯¯¯¯¯=f(x)yx¯=f(x)\overline{y_x}= f(x) .yxyxy_x Moje pytanie brzmi, jakie są plusy i minusy …
Chcę obliczyć rozkład prawdopodobieństwa dla sumy kombinacji kości. Pamiętam, że prawdopodobieństwo jest liczbą kombinacji, które sumują tę liczbę w stosunku do całkowitej liczby kombinacji (zakładając, że kości mają równomierny rozkład). Jakie są formuły Łączna liczba kombinacji Liczba kombinacji, które sumują określoną liczbę
Czytałem artykuł z normalizacji wsadowej (BN) (1) i nie rozumiałem potrzeby używania średnich ruchomych do śledzenia dokładności modelu, a nawet jeśli zaakceptowałem, że było to właściwe, nie rozumiem co dokładnie robią. W moim rozumieniu (co się mylę) w dokumencie wspomniano, że wykorzystuje on statystyki populacji, a nie mini-partię, statystyki po …
Chciałbym wiedzieć, czy są jakieś / jakieś zalety stosowania próbkowania warstwowego zamiast próbkowania losowego, podczas dzielenia oryginalnego zestawu danych na zestaw szkoleniowy i testowy do klasyfikacji. Ponadto, czy próbkowanie warstwowe wprowadza więcej uprzedzeń do klasyfikatora niż próbkowanie losowe? Aplikacja, dla której chciałbym zastosować próbkowanie warstwowe do przygotowania danych, jest klasyfikatorem …
Eksperymentuję trochę autoencoderów, a dzięki tensorflow stworzyłem model, który próbuje zrekonstruować zestaw danych MNIST. Moja sieć jest bardzo prosta: X, e1, e2, d1, Y, gdzie e1 i e2 są warstwami kodującymi, d2 i Y są warstwami dekodującymi (a Y jest zrekonstruowanym wyjściem). X ma 784 jednostki, e1 ma 100, e2 …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.