Chciałbym narysować liczby całkowite od 1 do określonego , rzucając pewną liczbą uczciwych sześciościennych kości (d6). Dobra odpowiedź wyjaśni, dlaczego jej metoda daje jednolite i niezależne liczby całkowite.N.NN Jako przykład ilustrujący pomocne byłoby wyjaśnienie, jak działa rozwiązanie dla przypadku .N = 150N=150N=150 Ponadto chciałbym, aby procedura była jak najbardziej wydajna: …
Wiele samouczków online mówi o spadku gradientu i prawie wszystkie z nich mają ustalony rozmiar kroku (współczynnik uczenia ). Dlaczego nie ma potrzeby wyszukiwania linii (takiego jak wyszukiwanie linii wstecznej lub dokładne wyszukiwanie linii)?αα\alpha
Widziałem podobny wniosek z wielu dyskusji, że wraz ze wzrostem rozmiaru mini-partii konwergencja SGD faktycznie staje się trudniejsza / gorsza, na przykład ten artykuł i ta odpowiedź . Słyszałem także o ludziach stosujących sztuczki, takie jak małe stawki uczenia się lub wielkości partii na wczesnym etapie, aby rozwiązać ten problem …
Czytam książkę: Bishop, Rozpoznawanie wzorców i uczenie maszynowe (2006) który definiuje wykładniczą rodzinę jako rozkłady postaci (równanie 2.194): p(x|η)=h(x)g(η)exp{ηTu(x)}p(x|η)=h(x)g(η)exp{ηTu(x)}p(\mathbf x|\boldsymbol \eta) = h(\mathbf x) g(\boldsymbol \eta) \exp \{\boldsymbol \eta^\mathrm T \mathbf u(\mathbf x)\} Ale nie widzę żadnych ograniczeń dotyczących lub . Czy to nie oznacza, że dowolna dystrybucja może być …
Mam dane na temat zachowań ruchowych (czasu spania, siedzącego trybu życia i aktywności fizycznej), które wynoszą około 24 (jak w godzinach dziennie). Chcę utworzyć zmienną, która przechwytuje względny czas spędzony na każdym z tych zachowań - powiedziano mi, że dokonałaby tego izometryczna transformacja logarytmiczna. Wygląda na to, że powinienem użyć …
Definiujemy epokę, która przeszła przez wszystkie dostępne próbki szkoleniowe, a rozmiar mini-partii jako liczbę próbek, w stosunku do której uśredniamy, aby znaleźć aktualizacje wag / odchyleń potrzebnych do zejścia z gradientu. Moje pytanie brzmi: czy powinniśmy rysować bez zastępowania z zestawu przykładów treningu, aby wygenerować każdą mini-partię w epoce. Wydaje …
Czytałem (na przykład tutaj ), że jądro Epanechnikowa jest optymalne, przynajmniej w sensie teoretycznym, podczas szacowania gęstości jądra. Jeśli to prawda, to dlaczego Gaussian pojawia się tak często jako domyślne jądro lub w wielu przypadkach jedyne jądro w bibliotekach szacowania gęstości?
Korzystam z modelu logit. Moja zmienna zależna jest binarna. Jednak mam niezależną zmienną, która jest kategoryczne i zawiera odpowiedzi: 1.very good, 2.good, 3.average, 4.poor and 5.very poor. Jest to więc porządkowe („ilościowe jakościowe”). Nie jestem pewien, jak sobie z tym poradzić w modelu. Używam gretl. [Uwaga z @ttnphns: Chociaż pytanie …
Istnieją znaczące współczesne badania dotyczące optymalizacji bayesowskiej (1) dostrajania hiperparametrów ML. Motywacją do kierowania jest tutaj minimalna liczba punktów danych, aby dokonywać świadomych wyborów, które punkty warto wypróbować (wywołania funkcji celu są drogie, więc zmniejszenie ich liczby jest lepsze), ponieważ szkolenie modelu jest czasochłonne - niektóre skromnie -Duże problemy z …
Studiując uczenie się przez wzmocnienie, natknąłem się na wiele form funkcji nagrody: , R ( s , a , s ′ ) , a nawet funkcji nagrody, która zależy tylko od bieżącego stanu. Powiedziawszy to, zdałem sobie sprawę, że nie jest łatwo „stworzyć” lub „zdefiniować” funkcję nagrody.R(s,a)R(s,a)R(s,a)R(s,a,s′)R(s,a,s′)R(s,a,s') Oto moje pytania: …
Właśnie uczę się o optymalizacji i mam problem ze zrozumieniem różnicy między optymalizacją wypukłą i nie wypukłą. Z mojego zrozumienia funkcja wypukła to taka, w której „odcinek linii między dowolnymi dwoma punktami na wykresie funkcji znajduje się powyżej lub na wykresie”. W takim przypadku można zastosować algorytm spadku gradientu, ponieważ …
Niektóre funkcje moich danych mają duże wartości, podczas gdy inne funkcje mają znacznie mniejsze wartości. Czy konieczne jest wyśrodkowanie + skalowanie danych przed zastosowaniem t-SNE, aby zapobiec odchyleniu w kierunku większych wartości? Korzystam z implementacji sklearn.manifold.TSNE w Pythonie z domyślną miarą odległości euklidesowej.
Niektórzy autorzy (np. Pallant, 2007, s. 225; patrz zdjęcie poniżej) sugerują obliczenie wielkości efektu dla testu rang podpisanego przez Wilcoxona poprzez podzielenie statystyki testu przez pierwiastek kwadratowy z liczby obserwacji: r=Znx+ny√r=Znx+nyr = \frac{Z}{\sqrt{n_x + n_y}} Zjest wyjście statystyczny badania przez SPSS (patrz zdjęcie poniżej), jak również przez wilcoxsign_testw R. (Patrz …
Mam model zestawu danych Filmy i użyłem regresji: model <- lm(imdbVotes ~ imdbRating + tomatoRating + tomatoUserReviews+ I(genre1 ** 3.0) +I(genre2 ** 2.0)+I(genre3 ** 1.0), data = movies) library(ggplot2) res <- qplot(fitted(model), resid(model)) res+geom_hline(yintercept=0) Co dało wynik: Teraz próbowałem po raz pierwszy pracować nad czymś o nazwie Dodany wykres zmienny …
Ogólnie, jaka jest różnica między E ( X | Y )E(X|Y)E(X|Y) i E ( X | Y = y )E(X|Y=y)E(X|Y=y) ? Poprzednia jest funkcją y,yy a ostatnia jest funkcją xxx ? To takie mylące ...
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.