Próbuję wykonać regresję lasso, która ma następującą postać: Minimalizuj w( Y - X w ) ′ ( Y - X w ) + λwww( Y- Xw )′( Y- Xw ) + λ| w |1(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 Biorąc pod uwagę , doradzono mi, aby znaleźć optymalne …
Każde stwierdzenie, które znajduję w estymatorze Jamesa-Steina zakłada, że oszacowane zmienne losowe mają tę samą wariancję (i jednostkę). Ale wszystkie te przykłady wspominają również, że estymator JS może być używany do szacowania ilości, nie mając ze sobą nic wspólnego. Przykład wikipedia jest prędkością światła, spożycie herbaty w Tajwanie i wagi …
Dopasowuję regresję do . Czy poprawne jest obliczanie szacunkowych punktów przekształcenia (i przedziałów ufności / prognozowania) przez potęgowanie? Nie wierzę tak, ponieważ E [ f ( X ) ] ≠ f ( E [ X ] ), ale chciał opinii innych.log(y)log(y)\log(y)E[f(X)]≠f(E[X])E[f(X)]≠f(E[X])E[f(X)] \ne f(E[X]) Mój przykład poniżej pokazuje konflikty z transformacją …
Załóżmy, że masz zmienną objaśniającą gdzie oznacza daną współrzędną. Masz również zmienną odpowiedzi . Teraz możemy połączyć obie zmienne jako:X=(X(s1),…,X(sn))X=(X(s1),…,X(sn)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right)sssY=(Y(s1),…,Y(sn))Y=(Y(s1),…,Y(sn)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) W(s)=(X(s)Y(s))∼N(μ(s),T)W(s)=(X(s)Y(s))∼N(μ(s),T){\bf{W}}({\bf{s}}) = \left( \begin{array}{ccc}X(s) \\ Y(s) \end{array} \right) \sim N(\boldsymbol{\mu}(s), T) W takim przypadku wybieramy po prostu μ(s)=(μ1μ2)Tμ(s)=(μ1μ2)T\boldsymbol{\mu}(s) = \left( \mu_{1} \; \; \mu_{2}\right)^{T} a TTT …
Moje pytanie opiera się na tej odpowiedzi, która wykazała, który lme4::lmermodel odpowiada dwukierunkowej ANOVA z powtarzanymi pomiarami: require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), d[d$c == …
Jestem kompletnym nowicjuszem :) Robię badanie na próbie 10 000 z populacji około 745,000. Każda próbka reprezentuje „procentowe podobieństwo”. Zdecydowana większość próbek wynosi około 97% -98%, ale kilka ma od 60% do 90%, co oznacza, że rozkład jest mocno negatywnie wypaczony. Około 0,6% wyników wynosi 0%, ale zostaną one potraktowane …
Pracuję z zestawem danych, który jest nieparametryczny i zawiera 12 zabiegów. Przeprowadziłem test Kruskala-Wallisa i uzyskałem znaczącą wartość , a teraz chciałbym przeprowadzić procedurę wielokrotnych porównań, aby zobaczyć, które z zabiegów znacznie się różnią. Jest wiele informacji na ten temat, ale nie znalazłem niczego, co konkretnie rozwiązałoby ten problem. Jakieś …
Obawiam się, że powiązane pytania nie odpowiedziały na moje. Oceniamy wyniki> 2 klasyfikatorów (uczenie maszynowe). Nasza hipoteza zerowa mówi, że wyniki nie różnią się. Aby ocenić tę hipotezę, wykonujemy testy parametryczne (ANOVA) i nieparametryczne (Friedman). Jeśli są znaczące, chcemy dowiedzieć się, którzy klasyfikatorzy różnią się w zadaniu post-hoc. Moje pytanie …
Próbuję uruchomić model, aby oszacować, w jaki sposób katastrofalne choroby, takie jak gruźlica, AIDS itp. Wpływają na wydatki na hospitalizację. Mam „na koszt hospitalizacji” jako zmienną zależną i różne indywidualne markery jako zmienne niezależne, z których prawie wszystkie są obojętne, takie jak płeć, głowa gospodarstwa domowego, stan ubóstwa i oczywiście …
Ostatnio próbuję dowiedzieć się więcej na temat uczenia się online (to absolutnie fascynujące!), A jednym z tematów, którego nie byłem w stanie dobrze zrozumieć, jest sposób myślenia o wyborze modelu w kontekście offline i online. Konkretnie, załóżmy, szkolimy klasyfikator w trybie offline, na podstawie pewnego ustalonego zbioru danych . Powiedzmy, …
Załóżmy, że model regresji logistycznej służy do przewidywania, czy kupujący online kupi produkt (wynik: zakup) po kliknięciu zestawu reklam online (predyktory: Ad1, Ad2 i Ad3). Wynikiem jest zmienna binarna: 1 (zakupiona) lub 0 (nie zebrana). Predyktory są również zmiennymi binarnymi: 1 (kliknięte) lub 0 (nie kliknięte). Więc wszystkie zmienne są …
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Jakie są dostępne metody / implementacja w R / Python, aby odrzucić / wybrać nieistotne / ważne funkcje w danych? Moje …
Używam zwykłego estymatora kurtozy, , ale zauważam, że nawet małe „odstające” w moim rozkładzie empirycznym , tj. małe szczyty daleko od centrum, wpływają na to ogromnie. Czy istnieje estymator kurtozy, który jest bardziej niezawodny?K^=μ^4σ^4K^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}
Podczas wykonywania głównej analizy składowej (PCA) powszechną rzeczą do zrobienia jest wykreślenie dwóch obciążeń względem siebie w celu zbadania zależności między zmiennymi. W pracy dołączonej do pakietu PLS R do wykonywania regresji głównej składowej i regresji PLS istnieje inny wykres, zwany wykresem ładunków korelacyjnych (patrz rysunek 7 i strona 15 …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.