Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Norms - Co jest specjalnego w ?
normą jest unikalny (przynajmniej częściowo), ponieważ znajduje się na granicy między uwypuklony i wypukłe. normą jest „najbardziej rzadki” norma wypukły (prawda?). p = 1 L 1L1L1L_1p=1p=1p=1L1L1L_1 Rozumiem, że norma euklidesowa ma korzenie w geometrii i ma jasną interpretację, gdy wymiary mają te same jednostki. Ale nie rozumiem, dlaczego jest stosowany …



4
Czy należy martwić się o wiele kolinearność przy stosowaniu modeli nieliniowych?
Powiedzmy, że mamy problem z klasyfikacją binarną z cechami głównie kategorycznymi. Do nauki tego używamy jakiegoś modelu nieliniowego (np. XGBoost lub Losowe lasy). Czy należy nadal martwić się wielokulturowością? Dlaczego? Jeśli odpowiedź na powyższe pytanie jest prawdziwa, jak należy z tym walczyć, biorąc pod uwagę, że używa się tego rodzaju …

1
Dlaczego nauka głębokiego wzmacniania jest niestabilna?
W artykule DeepMind z 2015 r. Na temat uczenia się głębokiego wzmacniania stwierdzono, że „poprzednie próby połączenia RL z sieciami neuronowymi były w dużej mierze nieudane z powodu niestabilnego uczenia się”. Następnie w artykule wymieniono niektóre przyczyny tego zjawiska, oparte na korelacjach między obserwacjami. Czy ktoś mógłby wyjaśnić, co to …



4
Jak suma dwóch zmiennych może wyjaśnić większą wariancję niż poszczególne zmienne?
Dostaję trochę kłopotliwych wyników dla korelacji sumy z trzecią zmienną, gdy dwa predyktory są ujemnie skorelowane. Co powoduje te kłopotliwe wyniki? Przykład 1: Korelacja między sumą dwóch zmiennych a trzecią zmienną Rozważ wzór 16.23 na stronie 427 tekstu Guildforda z 1965 r., Pokazany poniżej. Zakłopotanie: jeśli obie zmienne korelują .2 …

2
Co r, r kwadrat i resztkowe odchylenie standardowe mówią nam o zależności liniowej?
Małe tło Pracuję nad interpretacją analizy regresji, ale bardzo się mylę co do znaczenia r, r do kwadratu i resztkowego odchylenia standardowego. Znam definicje: Charakteryzacje r mierzy siłę i kierunek liniowej zależności między dwiema zmiennymi na wykresie rozrzutu Kwadrat R jest statystyczną miarą tego, jak blisko są dane do dopasowanej …

2
KKT w pigułce graficznie
Cel Potwierdź, czy rozumienie KKT jest prawidłowe, czy nie. Szukaj dalszych wyjaśnień i potwierdzeń w KKT. tło Próbowanie zrozumienia warunków KKT, szczególnie tych uzupełniających, które zawsze pojawiają się niespodziewanie w artykułach SVM. Nie potrzebuję listy abstrakcyjnych wzorów, ale potrzebuję konkretnego, intuicyjnego i graficznego wyjaśnienia. Pytanie Jeśli P, który minimalizuje funkcję …

1
Modelowanie szeregów czasowych danych cyklicznych
Buduję modele ARIMA dla niektórych danych wiatru / fal. Buduję osobny model dla każdej zmiennej. Dwie zmienne, które muszę modelować, to kierunek fali i wiatru. Wartości podano w stopniach (0–360 °). Czy jest możliwe modelowanie tego typu danych, gdy przedział wartości jest okrągły? Jeśli nie, to która klasa modeli jest …

3
Wybór hiperparametrów za pomocą T-SNE do klasyfikacji
W specyficznym problemie, z którym pracuję (konkurs) mam następujące ustawienie: 21 funkcji (numerycznie na [0,1]) i wyjście binarne. Mam około 100 K. wierszy. Ustawienie wydaje się być bardzo głośne. Ja i inni uczestnicy stosujemy generowanie funkcji przez jakiś czas, a osadzanie t-rozproszonego stochastycznego sąsiada okazało się w tym otoczeniu dość …

1
Rozwiązanie formy zamkniętej dla problemu lasso, gdy macierz danych jest ukośna
nazwa operatora {diag}}\newcommand{\diag}{\operatorname{diag}} Mamy problem: minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), przy założeniu, że: ∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag⁡(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). Czy w tym przypadku istnieje rozwiązanie w formie zamkniętej? Mam to: (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag⁡(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), więc myślę, że odpowiedź brzmi : wj=yjmax{0,1−λn|yj|},wj=yjmax{0,1−λn|yj|},w\,^j=y\,^j\max\left\{0,1-\lambda \frac{n}{|y^j|}\right\}, dla yj=∑i=1nyixijσ2iyj=∑i=1nyixijσi2y\,^j=\displaystyle\sum_{i=1}^n\frac{y_ix_i\,^j}{\sigma_i^2} , ale nie jestem pewien.

2
Z perspektywy statystycznej: transformata Fouriera vs regresja na podstawie Fouriera
Próbuję zrozumieć, czy dyskretna transformata Fouriera daje taką samą reprezentację krzywej jak regresja z wykorzystaniem zasady Fouriera. Na przykład, library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT daje liczbę …

2
Dlaczego sieci neuronowe można łatwo oszukać?
Przeczytałem kilka artykułów na temat ręcznego tworzenia obrazów w celu „oszukania” sieci neuronowej (patrz poniżej). Czy to dlatego, że sieci modelują tylko prawdopodobieństwo warunkowe ? Jeśli sieć może modelować wspólne prawdopodobieństwo , czy takie przypadki nadal występują?p ( y , x )p ( y| x)p(y|x)p(y|x)p ( y, x )p(y,x)p(y,x) Domyślam …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.