Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy normalizacja przed Lasso jest naprawdę konieczna?
Przeczytałem trzy główne powody standaryzacji zmiennych przed czymś takim jak Lassoregresja: 1) Interpretowalność współczynników. 2) Możliwość uszeregowania znaczenia współczynnika według względnej wielkości oszacowań współczynnika skurczu. 3) Nie ma potrzeby przechwytywania. Ale zastanawiam się nad najważniejszą kwestią. Czy mamy powody sądzić, że standaryzacja poprawiłaby generalizację modelu poza próbą? Nie obchodzi mnie …




1
Dlaczego glmnet używa „naiwnej” elastycznej siatki z oryginalnego papieru Zou & Hastie?
Oryginalny papier elastycznej siatki Zou & Hastie (2005) Regularyzacja i wybór zmiennych za pomocą elastycznej siatki wprowadzono funkcję elastycznej utraty siatki dla regresji liniowej (tutaj zakładam, że wszystkie zmienne są wyśrodkowane i skalowane do wariancji jednostkowej): ale nazwał to „naiwną elastyczną siecią”. Twierdzili, że wykonuje podwójny skurcz (lasso i grzbiet), …

3
Czy nie można teraz powiedzieć, że modele głębokiego uczenia się są interpretowalne? Czy funkcje węzłów?
W przypadku modeli statystycznych i uczenia maszynowego istnieje wiele poziomów interpretacji: 1) algorytm jako całość, 2) części algorytmu ogólnie 3) części algorytmu na poszczególnych wejściach, a te trzy poziomy są podzielone na dwie części, jeden do treningu, a drugi do oceny funkcji. Ostatnie dwie części są znacznie bliższe niż pierwsze. …

1
Czy stopnie swobody mogą być liczbą niecałkowitą?
Kiedy korzystam z GAM, daje mi resztkowy DF (ostatni wiersz kodu). Co to znaczy? Wychodząc poza przykład GAM, ogólnie, czy liczba stopni swobody może być liczbą niecałkowitą?26.626.626.6 > library(gam) > summary(gam(mpg~lo(wt),data=mtcars)) Call: gam(formula = mpg ~ lo(wt), data = mtcars) Deviance Residuals: Min 1Q Median 3Q Max -4.1470 -1.6217 -0.8971 …
27 r  degrees-of-freedom  gam  machine-learning  pca  lasso  probability  self-study  bootstrap  expected-value  regression  machine-learning  linear-model  probability  simulation  random-generation  machine-learning  distributions  svm  libsvm  classification  pca  multivariate-analysis  feature-selection  archaeology  r  regression  dataset  simulation  r  regression  time-series  forecasting  predictive-models  r  mean  sem  lavaan  machine-learning  regularization  regression  conv-neural-network  convolution  classification  deep-learning  conv-neural-network  regression  categorical-data  econometrics  r  confirmatory-factor  scale-invariance  self-study  unbiased-estimator  mse  regression  residuals  sampling  random-variable  sample  probability  random-variable  convergence  r  survival  weibull  references  autocorrelation  hypothesis-testing  distributions  correlation  regression  statistical-significance  regression-coefficients  univariate  categorical-data  chi-squared  regression  machine-learning  multiple-regression  categorical-data  linear-model  pca  factor-analysis  factor-rotation  classification  scikit-learn  logistic  p-value  regression  panel-data  multilevel-analysis  variance  bootstrap  bias  probability  r  distributions  interquartile  time-series  hypothesis-testing  normal-distribution  normality-assumption  kurtosis  arima  panel-data  stata  clustered-standard-errors  machine-learning  optimization  lasso  multivariate-analysis  ancova  machine-learning  cross-validation 


2
Dlaczego losowe spacery są ze sobą powiązane?
Zauważyłem, że średnio wartość bezwzględna współczynnika korelacji Pearsona jest stała zbliżona do każdej pary niezależnych losowych spacerów, niezależnie od długości spaceru.0.560.42 Czy ktoś może wyjaśnić to zjawisko? Spodziewałem się, że korelacje będą się zmniejszać wraz ze wzrostem długości marszu, jak w przypadku dowolnej losowej sekwencji. Do moich eksperymentów wykorzystałem losowe …

3
Jakie są skutki wyboru różnych funkcji strat w klasyfikacji do przybliżonej straty 0-1
Wiemy, że niektóre funkcje celu są łatwiejsze do optymalizacji, a niektóre są trudne. I jest wiele funkcji utraty, których chcemy używać, ale trudnych w użyciu, na przykład utrata 0-1. Dlatego znajdziemy kilka funkcji utraty proxy do wykonania pracy. Na przykład używamy utraty zawiasu lub straty logistycznej do „przybliżenia” utraty 0-1. …


2
Czy podobieństwo cosinus jest identyczne z odległością euklidesową znormalizowaną przez l2?
Identyczne ten sposób, że spowoduje to identyczne wyniki dla podobieństwa kolejności pomiędzy wektorem u i zestaw wektorów V . Mam model przestrzeni wektorowej, który ma parametry pomiaru odległości (odległość euklidesowa, podobieństwo cosinusa) i techniki normalizacji (brak, l1, l2) jako parametrów. Z mojego zrozumienia, wyniki z ustawień [cosinus, none] powinny być …

3
Jak odróżnić modele regresji liniowej od nieliniowej?
Czytałem następujący link o regresji nieliniowej SAS Nieliniowy . Rozumiem po przeczytaniu pierwszego rozdziału „Regresja nieliniowa vs. regresja liniowa”, że poniższe równanie jest w rzeczywistości regresją liniową, czy to prawda? Jeśli tak to dlaczego? y=b1x3+b2x2+b3x+cy=b1x3+b2x2+b3x+cy = b_1x^3 + b_2x^2 + b_3x + c Czy mam również zrozumieć, że w regresji …

17
Jak opisać statystyki w jednym zdaniu?
Kiedy zacząłem uczyć się statystyki, procedury takie jak test t, ANOVA, chi-kwadrat i regresja liniowa wydawały się być bardzo różnymi stworzeniami. Ale teraz zdaję sobie sprawę, że te procedury robią mniej więcej to samo. Podobnie wartości takie jak wariancja, reszty, błąd standardowy i średnia również mierzą mniej więcej to samo. …
27 definition 

4
Co jest nie tak z T-SNE vs PCA w redukcji wymiarów za pomocą R?
Mam macierz liczb zmiennoprzecinkowych 336 x 256 (336 genomów bakteryjnych (kolumny) x 256 znormalizowanych częstotliwości tetranukleotydowych (wiersze), np. Każda kolumna daje 1). Dobre wyniki uzyskuje się, gdy uruchamiam analizę przy użyciu analizy składników zasadniczych. Najpierw obliczam klastry kmeans na danych, a następnie uruchamiam PCA i koloruję punkty danych na podstawie …
27 r  pca  tsne 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.