Ten post dotyczy dwuwymiarowego modelu regresji liniowej, Yi=β0+β1xiYi=β0+β1xiY_i = \beta_0 + \beta_1x_i. Zawsze brałem pod uwagę podział sumy kwadratów (SSTO) na sumę kwadratów dla błędu (SSE) i sumę kwadratów dla modelu (SSR) na wiarę, ale kiedy naprawdę zacząłem o tym myśleć, nie rozumiem dlaczego to działa ... Część I nie …
W jakimś celu muszę wygenerować losowe liczby (dane) z rozkładu „nachylonego równomiernie”. „Nachylenie” tego rozkładu może się zmieniać w rozsądnych odstępach czasu, a następnie mój rozkład powinien zmienić się z jednorodnego na trójkątny w zależności od nachylenia. Oto moje pochodzenie: Uprośćmy to i wygeneruj dane od do (niebieski, czerwony to …
Chcę tylko sprawdzić jakieś uzasadnienie. Jeśli moja oryginalna próbka ma rozmiar i ładuję ją, mój proces myślowy wygląda następująco:nnn 1n1n\frac{1}{n} to szansa na jakąkolwiek obserwację z oryginalnej próbki. Aby mieć pewność, że następne losowanie nie będzie poprzednio próbkowaną obserwacją, ograniczamy wielkość próby do . W ten sposób otrzymujemy ten wzór:n …
Próbuję wykonać SVD ręcznie: m<-matrix(c(1,0,1,2,1,1,1,0,0),byrow=TRUE,nrow=3) U=eigen(m%*%t(m))$vector V=eigen(t(m)%*%m)$vector D=sqrt(diag(eigen(m%*%t(m))$values)) U1=svd(m)$u V1=svd(m)$v D1=diag(svd(m)$d) U1%*%D1%*%t(V1) U%*%D%*%t(V) Ale ostatnia linia nie mwraca. Dlaczego? Wydaje się, że ma to coś wspólnego z oznakami tych wektorów własnych ... Czy też źle zrozumiałem procedurę?
Tak jak wielu innych, znalazłem tu i tutaj zasoby niezwykle przydatne do zrozumienia komórek LSTM. Jestem pewien, że rozumiem, w jaki sposób wartości płyną i są aktualizowane, i jestem wystarczająco pewny, aby dodać wspomniane „połączenia z wizjerami” itp. W moim przykładzie za każdym razem mam wektor wejściowy długości ii wektor …
Jestem zdezorientowany następującymi informacjami i nie byłem w stanie znaleźć odpowiedzi gdzie indziej. Próbuję nauczyć się języka R podczas wykonywania statystyk i, jako ćwiczenie, próbuję dwukrotnie sprawdzić wyniki wbudowanych funkcji R, wykonując je również „ręcznie”, jak to było w R. Jednak , dla testu Kruskala-Wallisa ciągle otrzymuję różne wyniki i …
Próbuję symulować zestaw danych, który pasuje do posiadanych danych empirycznych, ale nie jestem pewien, jak oszacować błędy w oryginalnych danych. Dane empiryczne obejmują heteroscedastyczność, ale nie jestem zainteresowany jej przekształceniem, ale raczej stosuję model liniowy ze składnikiem błędu do odtworzenia symulacji danych empirycznych. Załóżmy na przykład, że mam jakiś empiryczny …
Hastie i Tibshirani wspominają w rozdziale 4.3.2 swojej książki, że w regresji liniowej podejście metodą najmniejszych kwadratów jest w rzeczywistości szczególnym przypadkiem maksymalnego prawdopodobieństwa. Jak możemy udowodnić ten wynik? PS: Nie oszczędzaj żadnych szczegółów matematycznych.
Przechodzę przez problemy w pisemnych problemach z klasą głębokiego uczenia się NLP Stanforda http://cs224d.stanford.edu/assignment1/assignment1_soln Próbuję zrozumieć odpowiedź dla 3a, gdzie szukają pochodnej wektora dla środkowego słowa. Załóżmy, że otrzymałeś przewidywany wektor słowa odpowiadający środkowemu słowu c dla skipgramu, a przewidywania słów dokonuje się za pomocą funkcji softmax występującej w modelach …
Dopasowuję model efektów mieszanych z terminem spline w aplikacji, w której trend w czasie jest znany jako curvi-liniowy. Chciałbym jednak ocenić, czy trend krzywoliniowy występuje z powodu indywidualnego odchylenia od liniowości, czy jest to efekt na poziomie grupy, który sprawia, że dopasowanie na poziomie grupy wydaje się krzywoliniowo-liniowe. Podaję powtarzalny …
Jaka jest różnica między uczeniem się na wiele sposobów a nieliniową redukcją wymiarów ? Widziałem te dwa terminy używane zamiennie. Na przykład: http://www.cs.cornell.edu/~kilian/research/manifold/manifold.html : Uczenie się przez kolektory (często określane również jako nieliniowa redukcja wymiarów) ma na celu osadzenie danych, które pierwotnie leżą w przestrzeni o dużych wymiarach w przestrzeni …
Próbuję utworzyć model zredukowany, aby przewidzieć wiele zmiennych zależnych (DV) (~ 450), które są wysoce skorelowane. Moje zmienne niezależne (IV) są również liczne (~ 2000) i wysoce skorelowane. Jeśli użyję lasso do wybrania zredukowanego modelu dla każdego wyjścia osobno, nie ma gwarancji, że uzyskam ten sam podzbiór zmiennych niezależnych, ponieważ …
Chcę obliczyć ważność każdej funkcji wejściowej przy użyciu modelu głębokiego. Ale znalazłem tylko jeden artykuł na temat wyboru funkcji za pomocą głębokiego uczenia się - głęboki wybór funkcji . Wstawiają warstwę węzłów połączonych bezpośrednio z każdą operacją przed pierwszą ukrytą warstwą. Słyszałem, że do tego rodzaju pracy można również wykorzystać …
Uczę się o ładowaniu jako sposobie szacowania wariancji przykładowej statystyki. Mam jedną podstawową wątpliwość. Cytowanie z http://web.stanford.edu/class/psych252/tutorials/doBootstrapPrimer.pdf : • Ile obserwacji powinniśmy przeskalować ponownie? Dobrą sugestią jest pierwotna wielkość próby. Jak możemy ponownie próbkować tyle obserwacji, ile w oryginalnej próbce? Jeśli mam próbkę o wielkości 100 i próbuję oszacować wariancję …
Czytam ten przedruk i mam trudności z wyprowadzeniem równań dla regresji procesu Gaussa. Używają ustawień i notacji Rasmussen i Williams . Tak więc hałas addytywny, zerowy, stacjonarny i normalnie rozłożony z wariancjąσ2noiseσnoise2\sigma^2_{noise} zakłada się: y=f(x)+ϵ,ϵ∼N(0,σ2noise)y=f(x)+ϵ,ϵ∼N(0,σnoise2)y=f(\mathbf{x})+\epsilon, \quad \epsilon\sim N(0,\sigma^2_{noise}) Zakłada się, że GP poprzedził średnią zero f(x)f(x)f(\mathbf{x}), co oznacza że ∀ …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.