normą jest unikalny (przynajmniej częściowo), ponieważ znajduje się na granicy między uwypuklony i wypukłe. normą jest „najbardziej rzadki” norma wypukły (prawda?). p = 1 L 1L1L1L_1p=1p=1p=1L1L1L_1 Rozumiem, że norma euklidesowa ma korzenie w geometrii i ma jasną interpretację, gdy wymiary mają te same jednostki. Ale nie rozumiem, dlaczego jest stosowany …
Wiem, że w regresji liniowej zmienna odpowiedzi musi być ciągła, ale dlaczego tak jest? Nie mogę znaleźć w Internecie niczego, co wyjaśniałoby, dlaczego nie mogę używać dyskretnych danych dla zmiennej odpowiedzi.
Mam surowe dane, które mają około 20 kolumn (20 funkcji). Dziesięć z nich to ciągłe dane, a 10 z nich ma charakter kategoryczny. Niektóre dane jakościowe mogą mieć 50 różnych wartości (stany USA). Po wstępnym przetworzeniu danych 10 ciągłych kolumn staje się 10 przygotowanymi kolumnami, a 10 wartości kategorycznych staje …
Powiedzmy, że mamy problem z klasyfikacją binarną z cechami głównie kategorycznymi. Do nauki tego używamy jakiegoś modelu nieliniowego (np. XGBoost lub Losowe lasy). Czy należy nadal martwić się wielokulturowością? Dlaczego? Jeśli odpowiedź na powyższe pytanie jest prawdziwa, jak należy z tym walczyć, biorąc pod uwagę, że używa się tego rodzaju …
W artykule DeepMind z 2015 r. Na temat uczenia się głębokiego wzmacniania stwierdzono, że „poprzednie próby połączenia RL z sieciami neuronowymi były w dużej mierze nieudane z powodu niestabilnego uczenia się”. Następnie w artykule wymieniono niektóre przyczyny tego zjawiska, oparte na korelacjach między obserwacjami. Czy ktoś mógłby wyjaśnić, co to …
Z tego, co rozumiem, wybór zmiennych oparty na wartościach p (przynajmniej w kontekście regresji) jest wysoce wadliwy. Wygląda na to, że wybór zmiennych oparty na AIC (lub podobny) jest przez niektórych uważany za wadliwy, chociaż wydaje się to nieco niejasne (np. Patrz moje pytanie i kilka linków na ten temat …
Szukam odniesienia, w którym udowodniono, że harmoniczna oznacza x¯h=n∑ni=11xix¯h=n∑i=1n1xi\bar{x}^h = \frac{n}{\sum_{i=1}^n \frac{1}{x_i}} minimalizuje (w ) sumę kwadratowych błędów względnychzzz ∑i=1n((xi−z)2xi).∑i=1n((xi−z)2xi).\sum_{i=1}^n \left( \frac{(x_i - z)^2}{x_i}\right).
Dostaję trochę kłopotliwych wyników dla korelacji sumy z trzecią zmienną, gdy dwa predyktory są ujemnie skorelowane. Co powoduje te kłopotliwe wyniki? Przykład 1: Korelacja między sumą dwóch zmiennych a trzecią zmienną Rozważ wzór 16.23 na stronie 427 tekstu Guildforda z 1965 r., Pokazany poniżej. Zakłopotanie: jeśli obie zmienne korelują .2 …
Małe tło Pracuję nad interpretacją analizy regresji, ale bardzo się mylę co do znaczenia r, r do kwadratu i resztkowego odchylenia standardowego. Znam definicje: Charakteryzacje r mierzy siłę i kierunek liniowej zależności między dwiema zmiennymi na wykresie rozrzutu Kwadrat R jest statystyczną miarą tego, jak blisko są dane do dopasowanej …
Cel Potwierdź, czy rozumienie KKT jest prawidłowe, czy nie. Szukaj dalszych wyjaśnień i potwierdzeń w KKT. tło Próbowanie zrozumienia warunków KKT, szczególnie tych uzupełniających, które zawsze pojawiają się niespodziewanie w artykułach SVM. Nie potrzebuję listy abstrakcyjnych wzorów, ale potrzebuję konkretnego, intuicyjnego i graficznego wyjaśnienia. Pytanie Jeśli P, który minimalizuje funkcję …
Buduję modele ARIMA dla niektórych danych wiatru / fal. Buduję osobny model dla każdej zmiennej. Dwie zmienne, które muszę modelować, to kierunek fali i wiatru. Wartości podano w stopniach (0–360 °). Czy jest możliwe modelowanie tego typu danych, gdy przedział wartości jest okrągły? Jeśli nie, to która klasa modeli jest …
W specyficznym problemie, z którym pracuję (konkurs) mam następujące ustawienie: 21 funkcji (numerycznie na [0,1]) i wyjście binarne. Mam około 100 K. wierszy. Ustawienie wydaje się być bardzo głośne. Ja i inni uczestnicy stosujemy generowanie funkcji przez jakiś czas, a osadzanie t-rozproszonego stochastycznego sąsiada okazało się w tym otoczeniu dość …
nazwa operatora {diag}}\newcommand{\diag}{\operatorname{diag}} Mamy problem: minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), przy założeniu, że: ∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). Czy w tym przypadku istnieje rozwiązanie w formie zamkniętej? Mam to: (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), więc myślę, że odpowiedź brzmi : wj=yjmax{0,1−λn|yj|},wj=yjmax{0,1−λn|yj|},w\,^j=y\,^j\max\left\{0,1-\lambda \frac{n}{|y^j|}\right\}, dla yj=∑i=1nyixijσ2iyj=∑i=1nyixijσi2y\,^j=\displaystyle\sum_{i=1}^n\frac{y_ix_i\,^j}{\sigma_i^2} , ale nie jestem pewien.
Próbuję zrozumieć, czy dyskretna transformata Fouriera daje taką samą reprezentację krzywej jak regresja z wykorzystaniem zasady Fouriera. Na przykład, library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT daje liczbę …
Przeczytałem kilka artykułów na temat ręcznego tworzenia obrazów w celu „oszukania” sieci neuronowej (patrz poniżej). Czy to dlatego, że sieci modelują tylko prawdopodobieństwo warunkowe ? Jeśli sieć może modelować wspólne prawdopodobieństwo , czy takie przypadki nadal występują?p ( y , x )p ( y| x)p(y|x)p(y|x)p ( y, x )p(y,x)p(y,x) Domyślam …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.