Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Jakie są zalety używania ReLU w stosunku do softplus jako funkcji aktywacyjnych?
Często wspomina się, że rektyfikowane jednostki liniowe (ReLU) zastąpiły jednostki softplus, ponieważ są liniowe i szybsze w obliczeniach. Czy softplus nadal ma tę zaletę, że indukuje rzadkość, czy też jest ograniczony do ReLU? Pytam o to, dlatego zastanawiam się nad negatywnymi konsekwencjami zerowego nachylenia ReLU. Czy ta właściwość nie „pułapkuje” …

2
Teoria ekstremalnych wartości - pokaż: Normalna do Gumbela
Maksymalna wartość iid Standardnormals zbieżny do standardowa Gumbela rozdzielający według wartości ekstremalnej teorii .X1,…,Xn.∼X1,…,Xn.∼X_1,\dots,X_n. \sim Jak możemy to pokazać? Mamy P(maxXi≤x)=P(X1≤x,…,Xn≤x)=P(X1≤x)⋯P(Xn≤x)=F(x)nP(maxXi≤x)=P(X1≤x,…,Xn≤x)=P(X1≤x)⋯P(Xn≤x)=F(x)nP(\max X_i \leq x) = P(X_1 \leq x, \dots, X_n \leq x) = P(X_1 \leq x) \cdots P(X_n \leq x) = F(x)^n Musimy znaleźć / wybrać an>0,bn∈Ran>0,bn∈Ra_n>0,b_n\in\mathbb{R} ciągów stałych takich, …


4
Jak rzutować nowy wektor na przestrzeń PCA?
Po przeprowadzeniu analizy głównego składnika (PCA) chcę rzutować nowy wektor na przestrzeń PCA (tzn. Znaleźć jego współrzędne w układzie współrzędnych PCA). Mam obliczony PCA w języku R użyciu prcomp. Teraz powinienem być w stanie pomnożyć mój wektor przez macierz obrotu PCA. Czy główne elementy tej macierzy powinny być ułożone w …
21 r  pca  r  variance  heteroscedasticity  misspecification  distributions  time-series  data-visualization  modeling  histogram  kolmogorov-smirnov  negative-binomial  likelihood-ratio  econometrics  panel-data  categorical-data  scales  survey  distributions  pdf  histogram  correlation  algorithms  r  gpu  parallel-computing  approximation  mean  median  references  sample-size  normality-assumption  central-limit-theorem  rule-of-thumb  confidence-interval  estimation  mixed-model  psychometrics  random-effects-model  hypothesis-testing  sample-size  dataset  large-data  regression  standard-deviation  variance  approximation  hypothesis-testing  variance  central-limit-theorem  kernel-trick  kernel-smoothing  error  sampling  hypothesis-testing  normality-assumption  philosophical  confidence-interval  modeling  model-selection  experiment-design  hypothesis-testing  statistical-significance  power  asymptotics  information-retrieval  anova  multiple-comparisons  ancova  classification  clustering  factor-analysis  psychometrics  r  sampling  expectation-maximization  markov-process  r  data-visualization  correlation  regression  statistical-significance  degrees-of-freedom  experiment-design  r  regression  curve-fitting  change-point  loess  machine-learning  classification  self-study  monte-carlo  markov-process  references  mathematical-statistics  data-visualization  python  cart  boosting  regression  classification  robust  cart  survey  binomial  psychometrics  likert  psychology  asymptotics  multinomial 

2
Ostrzeżenie „Model nie zbiegło się” w lmer ()
Za pomocą następującego zestawu danych chciałem sprawdzić, czy odpowiedź (efekt) zmienia się w odniesieniu do witryn, sezonu, czasu trwania i ich interakcji. Niektóre internetowe fora poświęcone statystykom sugerowały, żebym kontynuował liniowe modele z efektami mieszanymi, ale problem polega na tym, że ponieważ replikacje są losowe w każdej stacji, nie mam …


2
Jaka intuicja kryje się za definiowaniem kompletności statystyki jako niemożności stworzenia bezstronnego estymatora ?
W statystyce klasycznej istnieje definicja, że ​​statystyka zbioru danych jest zdefiniowana jako kompletna dla parametru nie jest możliwe sformułowanie z niej obiektywnego estymatora sposób nietrwały. Oznacza to, że jedynym sposobem na uzyskanie dla wszystkich jest prawie na pewno równe .TT.Ty1,…,yny1,…,yny_1, \ldots, y_nθθ\theta000Eh(T(y))=0mih(T.(y))=0E h(T (y )) = 0θθ\thetahhh000 Czy kryje się …


3
Jaka jest różnica między rozkładami „ograniczającymi” a „stacjonarnymi”?
Zadaję pytanie dotyczące łańcuchów Markowa, a dwie ostatnie części mówią: Czy ten łańcuch Markowa ma ograniczający rozkład. Jeśli Twoja odpowiedź brzmi „tak”, znajdź dystrybucję ograniczającą. Jeśli Twoja odpowiedź brzmi „nie”, wyjaśnij dlaczego. Czy ten łańcuch Markowa ma rozkład stacjonarny. Jeśli Twoja odpowiedź brzmi „tak”, znajdź rozkład stacjonarny. Jeśli Twoja odpowiedź …

7
RMSE a współczynnik determinacji
Oceniam model fizyczny i chciałbym wiedzieć, której z metod powinienem tutaj użyć (między RMSE a współczynnikiem determinacji R2) Problem jest następujący: Mam funkcję, która wyświetla prognozy dla wartości wejściowej x, . Mam też faktyczną obserwację tej wartości, którą nazywam yyx¯¯¯¯¯=f(x)yx¯=f(x)\overline{y_x}= f(x) .yxyxy_x Moje pytanie brzmi, jakie są plusy i minusy …
21 error 

11
Jak łatwo określić rozkład wyników dla wielu kości?
Chcę obliczyć rozkład prawdopodobieństwa dla sumy kombinacji kości. Pamiętam, że prawdopodobieństwo jest liczbą kombinacji, które sumują tę liczbę w stosunku do całkowitej liczby kombinacji (zakładając, że kości mają równomierny rozkład). Jakie są formuły Łączna liczba kombinacji Liczba kombinacji, które sumują określoną liczbę
21 probability  dice 

2
Jak i dlaczego normalizacja wsadowa wykorzystuje średnie ruchome do śledzenia dokładności modelu podczas treningu?
Czytałem artykuł z normalizacji wsadowej (BN) (1) i nie rozumiałem potrzeby używania średnich ruchomych do śledzenia dokładności modelu, a nawet jeśli zaakceptowałem, że było to właściwe, nie rozumiem co dokładnie robią. W moim rozumieniu (co się mylę) w dokumencie wspomniano, że wykorzystuje on statystyki populacji, a nie mini-partię, statystyki po …

1
Korzyści z próbkowania warstwowego vs losowego do generowania danych treningowych w klasyfikacji
Chciałbym wiedzieć, czy są jakieś / jakieś zalety stosowania próbkowania warstwowego zamiast próbkowania losowego, podczas dzielenia oryginalnego zestawu danych na zestaw szkoleniowy i testowy do klasyfikacji. Ponadto, czy próbkowanie warstwowe wprowadza więcej uprzedzeń do klasyfikatora niż próbkowanie losowe? Aplikacja, dla której chciałbym zastosować próbkowanie warstwowe do przygotowania danych, jest klasyfikatorem …

1
Funkcja utraty dla autoencoderów
Eksperymentuję trochę autoencoderów, a dzięki tensorflow stworzyłem model, który próbuje zrekonstruować zestaw danych MNIST. Moja sieć jest bardzo prosta: X, e1, e2, d1, Y, gdzie e1 i e2 są warstwami kodującymi, d2 i Y są warstwami dekodującymi (a Y jest zrekonstruowanym wyjściem). X ma 784 jednostki, e1 ma 100, e2 …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.