Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Generuj losowe liczby z „nachylonego rozkładu równomiernego” z teorii matematycznej
W jakimś celu muszę wygenerować losowe liczby (dane) z rozkładu „nachylonego równomiernie”. „Nachylenie” tego rozkładu może się zmieniać w rozsądnych odstępach czasu, a następnie mój rozkład powinien zmienić się z jednorodnego na trójkątny w zależności od nachylenia. Oto moje pochodzenie: Uprośćmy to i wygeneruj dane od do (niebieski, czerwony to …

1
Szansa, że ​​próbka bootstrap jest dokładnie taka sama jak oryginalna próbka
Chcę tylko sprawdzić jakieś uzasadnienie. Jeśli moja oryginalna próbka ma rozmiar i ładuję ją, mój proces myślowy wygląda następująco:nnn 1n1n\frac{1}{n} to szansa na jakąkolwiek obserwację z oryginalnej próbki. Aby mieć pewność, że następne losowanie nie będzie poprzednio próbkowaną obserwacją, ograniczamy wielkość próby do . W ten sposób otrzymujemy ten wzór:n …

2
Dlaczego nie mogę uzyskać prawidłowego SVD X za pomocą rozkładu wartości własnych XX 'i X'X?
Próbuję wykonać SVD ręcznie: m<-matrix(c(1,0,1,2,1,1,1,0,0),byrow=TRUE,nrow=3) U=eigen(m%*%t(m))$vector V=eigen(t(m)%*%m)$vector D=sqrt(diag(eigen(m%*%t(m))$values)) U1=svd(m)$u V1=svd(m)$v D1=diag(svd(m)$d) U1%*%D1%*%t(V1) U%*%D%*%t(V) Ale ostatnia linia nie mwraca. Dlaczego? Wydaje się, że ma to coś wspólnego z oznakami tych wektorów własnych ... Czy też źle zrozumiałem procedurę?
9 r  svd  eigenvalues 

1
Zrozumienie topologii LSTM
Tak jak wielu innych, znalazłem tu i tutaj zasoby niezwykle przydatne do zrozumienia komórek LSTM. Jestem pewien, że rozumiem, w jaki sposób wartości płyną i są aktualizowane, i jestem wystarczająco pewny, aby dodać wspomniane „połączenia z wizjerami” itp. W moim przykładzie za każdym razem mam wektor wejściowy długości ii wektor …

1
Nieznaczna niespójność między wbudowaną funkcją R Kruskala-Wallisa a obliczeniami ręcznymi
Jestem zdezorientowany następującymi informacjami i nie byłem w stanie znaleźć odpowiedzi gdzie indziej. Próbuję nauczyć się języka R podczas wykonywania statystyk i, jako ćwiczenie, próbuję dwukrotnie sprawdzić wyniki wbudowanych funkcji R, wykonując je również „ręcznie”, jak to było w R. Jednak , dla testu Kruskala-Wallisa ciągle otrzymuję różne wyniki i …

2
Symuluj regresję liniową z heteroscedastycznością
Próbuję symulować zestaw danych, który pasuje do posiadanych danych empirycznych, ale nie jestem pewien, jak oszacować błędy w oryginalnych danych. Dane empiryczne obejmują heteroscedastyczność, ale nie jestem zainteresowany jej przekształceniem, ale raczej stosuję model liniowy ze składnikiem błędu do odtworzenia symulacji danych empirycznych. Załóżmy na przykład, że mam jakiś empiryczny …


1
Gradienty dla słowa skipgram 2
Przechodzę przez problemy w pisemnych problemach z klasą głębokiego uczenia się NLP Stanforda http://cs224d.stanford.edu/assignment1/assignment1_soln Próbuję zrozumieć odpowiedź dla 3a, gdzie szukają pochodnej wektora dla środkowego słowa. Załóżmy, że otrzymałeś przewidywany wektor słowa odpowiadający środkowemu słowu c dla skipgramu, a przewidywania słów dokonuje się za pomocą funkcji softmax występującej w modelach …

1
Model efektów mieszanych z splajnami
Dopasowuję model efektów mieszanych z terminem spline w aplikacji, w której trend w czasie jest znany jako curvi-liniowy. Chciałbym jednak ocenić, czy trend krzywoliniowy występuje z powodu indywidualnego odchylenia od liniowości, czy jest to efekt na poziomie grupy, który sprawia, że ​​dopasowanie na poziomie grupy wydaje się krzywoliniowo-liniowe. Podaję powtarzalny …
9 r  splines  lme4-nlme 

1
Jaka jest różnica między uczeniem się na wiele sposobów a nieliniową redukcją wymiarów?
Jaka jest różnica między uczeniem się na wiele sposobów a nieliniową redukcją wymiarów ? Widziałem te dwa terminy używane zamiennie. Na przykład: http://www.cs.cornell.edu/~kilian/research/manifold/manifold.html : Uczenie się przez kolektory (często określane również jako nieliniowa redukcja wymiarów) ma na celu osadzenie danych, które pierwotnie leżą w przestrzeni o dużych wymiarach w przestrzeni …

1
Wielowymiarowa regresja liniowa z lasso wr
Próbuję utworzyć model zredukowany, aby przewidzieć wiele zmiennych zależnych (DV) (~ 450), które są wysoce skorelowane. Moje zmienne niezależne (IV) są również liczne (~ 2000) i wysoce skorelowane. Jeśli użyję lasso do wybrania zredukowanego modelu dla każdego wyjścia osobno, nie ma gwarancji, że uzyskam ten sam podzbiór zmiennych niezależnych, ponieważ …

3
Wybór funkcji za pomocą głębokiego uczenia się?
Chcę obliczyć ważność każdej funkcji wejściowej przy użyciu modelu głębokiego. Ale znalazłem tylko jeden artykuł na temat wyboru funkcji za pomocą głębokiego uczenia się - głęboki wybór funkcji . Wstawiają warstwę węzłów połączonych bezpośrednio z każdą operacją przed pierwszą ukrytą warstwą. Słyszałem, że do tego rodzaju pracy można również wykorzystać …

2
Rozmiar próbek bootstrap
Uczę się o ładowaniu jako sposobie szacowania wariancji przykładowej statystyki. Mam jedną podstawową wątpliwość. Cytowanie z http://web.stanford.edu/class/psych252/tutorials/doBootstrapPrimer.pdf : • Ile obserwacji powinniśmy przeskalować ponownie? Dobrą sugestią jest pierwotna wielkość próby. Jak możemy ponownie próbkować tyle obserwacji, ile w oryginalnej próbce? Jeśli mam próbkę o wielkości 100 i próbuję oszacować wariancję …

1
Wątpliwości dotyczące wyprowadzenia równań regresji procesu Gaussa w pracy
Czytam ten przedruk i mam trudności z wyprowadzeniem równań dla regresji procesu Gaussa. Używają ustawień i notacji Rasmussen i Williams . Tak więc hałas addytywny, zerowy, stacjonarny i normalnie rozłożony z wariancjąσ2noiseσnoise2\sigma^2_{noise} zakłada się: y=f(x)+ϵ,ϵ∼N(0,σ2noise)y=f(x)+ϵ,ϵ∼N(0,σnoise2)y=f(\mathbf{x})+\epsilon, \quad \epsilon\sim N(0,\sigma^2_{noise}) Zakłada się, że GP poprzedził średnią zero f(x)f(x)f(\mathbf{x}), co oznacza że ∀ …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.