Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Dlaczego spakowane drzewo / losowe drzewo leśne ma większe odchylenie niż pojedyncze drzewo decyzyjne?
Jeśli weźmiemy pod uwagę dorosłe drzewo decyzyjne (tj. Drzewo decyzji bez przycinania), ma ono dużą wariancję i niskie odchylenie. Bagging i losowe lasy używają tych modeli o dużej wariancji i agregują je w celu zmniejszenia wariancji, a tym samym zwiększenia dokładności prognoz. Zarówno Bagging, jak i losowe lasy używają próbkowania …

5
Kiedy stosować model z efektem mieszanym?
Liniowe modele mieszanych efektów są rozszerzeniami modeli regresji liniowej dla danych gromadzonych i podsumowywanych w grupach. Kluczową zaletą jest to, że współczynniki mogą się różnić w odniesieniu do jednej lub więcej zmiennych grupowych. Mam jednak problem z tym, kiedy użyć modelu z efektem mieszanym? Rozwiążę moje pytania na przykładzie zabawki …

1
Jaka jest utrata masy ciała?
Zaczynam od głębokiego uczenia się i mam pytanie, na które nie mogłem znaleźć odpowiedzi, być może nie szukałem właściwie. Widziałem tę odpowiedź , ale nadal nie jest jasne, jaka jest utrata masy ciała i jak to jest związane z funkcją utraty.

1
Strzały zmiennych podstawowych w biplocie PCA w R.
Ryzykując, że pytanie będzie specyficzne dla oprogramowania i pod pretekstem jego wszechobecności i osobliwości, chcę zapytać o funkcję biplot()w R, a dokładniej o obliczenie i wykreślenie domyślnych, nałożonych na siebie czerwonych strzałek, odpowiadających do podstawowych zmiennych. [Aby nadać sens niektórym komentarzom, początkowo opublikowane wykresy miały problem z brakiem zainteresowania, a …
11 r  pca  biplot 

3
Jaka jest różnica między modelem deterministycznym a stochastycznym?
Prosty model liniowy: ϵ t N ( 0 , σ 2 )x=αt+ϵtx=αt+ϵtx=\alpha t + \epsilon_t gdzie ~ iidϵtϵt\epsilon_tN(0,σ2)N(0,σ2)N(0,\sigma^2) z iE(x)=αtE(x)=αtE(x) = \alpha tVar(x)=σ2Var(x)=σ2Var(x)=\sigma^2 AR (1): ϵ t N ( 0 , σ 2 )Xt=αXt−1+ϵtXt=αXt−1+ϵtX_t =\alpha X_{t-1} + \epsilon_t gdzie ~ iidϵtϵt\epsilon_tN(0,σ2)N(0,σ2)N(0,\sigma^2) z iE(x)=αtE(x)=αtE(x) = \alpha tVar(x)=tσ2Var(x)=tσ2Var(x)=t\sigma^2 Tak więc prosty model …


1
R / mgcv: Dlaczego produkty tensorowe te () i ti () wytwarzają różne powierzchnie?
mgcvOpakowanie Rposiada dwie funkcje montowania interakcji produktów napinacz: te()i ti(). Rozumiem podstawowy podział pracy między nimi (dopasowanie interakcji nieliniowej vs. rozkładanie tej interakcji na główne efekty i interakcję). To, czego nie rozumiem, to dlaczego te(x1, x2)i ti(x1) + ti(x2) + ti(x1, x2)może powodować (nieznacznie) różne wyniki. MWE (dostosowany z ?ti): …
11 r  gam  mgcv  conditional-probability  mixed-model  references  bayesian  estimation  conditional-probability  machine-learning  optimization  gradient-descent  r  hypothesis-testing  wilcoxon-mann-whitney  time-series  bayesian  inference  change-point  time-series  anova  repeated-measures  statistical-significance  bayesian  contingency-tables  regression  prediction  quantiles  classification  auc  k-means  scikit-learn  regression  spatial  circular-statistics  t-test  effect-size  cohens-d  r  cross-validation  feature-selection  caret  machine-learning  modeling  python  optimization  frequentist  correlation  sample-size  normalization  group-differences  heteroscedasticity  independence  generalized-least-squares  lme4-nlme  references  mcmc  metropolis-hastings  optimization  r  logistic  feature-selection  separation  clustering  k-means  normal-distribution  gaussian-mixture  kullback-leibler  java  spark-mllib  data-visualization  categorical-data  barplot  hypothesis-testing  statistical-significance  chi-squared  type-i-and-ii-errors  pca  scikit-learn  conditional-expectation  statistical-significance  meta-analysis  intuition  r  time-series  multivariate-analysis  garch  machine-learning  classification  data-mining  missing-data  cart  regression  cross-validation  matrix-decomposition  categorical-data  repeated-measures  chi-squared  assumptions  contingency-tables  prediction  binary-data  trend  test-for-trend  matrix-inverse  anova  categorical-data  regression-coefficients  standard-error  r  distributions  exponential  interarrival-time  copula  log-likelihood  time-series  forecasting  prediction-interval  mean  standard-error  meta-analysis  meta-regression  network-meta-analysis  systematic-review  normal-distribution  multiple-regression  generalized-linear-model  poisson-distribution  poisson-regression  r  sas  cohens-kappa 

1
Dlaczego brak negatywności jest ważny dla współpracujących systemów filtrujących / rekomendujących?
We wszystkich nowoczesnych systemach rekomendujących, które widziałem, które opierają się na faktoryzacji macierzy, nieujemna faktoryzacja macierzy jest wykonywana na matrycy filmu użytkownika. Rozumiem, dlaczego brak negatywności jest ważny dla interpretacji i / lub jeśli chcesz rzadkich czynników. Ale jeśli zależy ci tylko na wydajności przewidywania, jak na przykład w konkursie …


3
Średnia odwrotnego rozkładu wykładniczego
Biorąc pod uwagę zmienną losową , jaka jest średnia i wariancja G = 1Y= Ex p ( λ )Y=Exp(λ)Y = Exp(\lambda) ?G = 1YG=1YG=\dfrac{1}{Y} Patrzę na odwrotny rozkład gamma, ale średnia i wariancja są zdefiniowane tylko odpowiednio dla i α > 2 ...α > 1α>1\alpha>1α > 2α>2\alpha>2

2
Korelacja między sinusem a cosinusem
Załóżmy, że jest równomiernie rozmieszczony na . Niech i . Pokaż, że korelacja między i wynosi zero.XXX[0,2π][0,2π][0, 2\pi]Y=sinXY=sin⁡XY = \sin XZ=cosXZ=cos⁡XZ = \cos XYYYZZZ Wydaje się, że musiałbym znać standardowe odchylenie sinus i cosinus oraz ich kowariancję. Jak mogę je obliczyć? Myślę, że muszę założyć, że ma rozkład równomierny, a …

2
Jak określić parametry dla t-SNE w celu zmniejszenia wymiarów?
Jestem bardzo nowy w osadzaniu słów. Chcę wyobrazić sobie, jak wyglądają dokumenty po nauce. Czytałem, że t-SNE jest podejściem do tego. Mam 100 000 dokumentów o 250 wymiarach jako rozmiarze osadzenia. Dostępnych jest również kilka pakietów. Jednak w przypadku t-SNE nie wiem, ile iteracji, wartość alfa lub wartość zdolności pertraktacyjnych …

2
Regresja liniowa, oczekiwania warunkowe i wartości oczekiwane
Ok, więc trochę mgliste w kilku sprawach, każda pomoc byłaby mile widziana. Rozumiem, że model regresji liniowej jest przewidziany przez oczekiwanie warunkowe E(Y|X)=b+Xb+emi(Y|X)=b+Xb+miE(Y|X)=b+Xb+e Czy zakładamy, że zarówno jak i są zmiennymi losowymi o nieznanym rozkładzie prawdopodobieństwa? Rozumiałem, że tylko reszty i szacowane współczynniki beta są zmiennymi losowymi. jeśli tak, jako …
11 regression 

1
Intuicyjnie, dlaczego entropia krzyżowa jest miarą odległości dwóch rozkładów prawdopodobieństwa?
Dla dwóch dyskretnych rozkładów i , entropia krzyżowa jest zdefiniowana jakoqpppqqq H(p,q)=−∑xp(x)logq(x).H(p,q)=−∑xp(x)log⁡q(x).H(p,q)=-\sum_x p(x)\log q(x). Zastanawiam się, dlaczego byłby to intuicyjny pomiar odległości między dwoma rozkładami prawdopodobieństwa? Widzę, że jest entropią , która mierzy „zaskoczenie” . jest miarą, która częściowo zastępuje przez . Nadal nie rozumiem intuicyjnego znaczenia definicji.H(p,p)H(p,p)H(p,p)ppppppH(p,q)H(p,q)H(p,q)pppqqq


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.