Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Liniowość PCA
PCA jest uważana za procedurę liniową, jednak: PCA(X)≠PCA(X1)+PCA(X2)+…+PCA(Xn),PCA(X)≠PCA(X1)+PCA(X2)+…+PCA(Xn),\mathrm{PCA}(X)\neq \mathrm{PCA}(X_1)+\mathrm{PCA}(X_2)+\ldots+\mathrm{PCA}(X_n), gdzie . To znaczy, że wektory własne uzyskane przez PCA na macierzach danych nie sumują się do zrównania wektorów własnych uzyskanych przez PCA z sumą macierzy danych . Ale nie jest to definicja funkcji liniowej która:X i X i fX=X1+X2+…+XnX=X1+X2+…+XnX=X_1+X_2+\ldots+X_nXiXiX_iXiXiX_ifff f(x+y)=f(x)+f(y)?f(x+y)=f(x)+f(y)?f(x+y)=f(x)+f(y)? …
35 pca  linear 

5
Myśl jak bayesian, sprawdź jak częsty: co to znaczy?
Patrzę na niektóre slajdy wykładowe na kursie danych, który można znaleźć tutaj: https://github.com/cs109/2015/blob/master/Lectures/01-Introduction.pdf Niestety nie widzę wideo z tego wykładu iw pewnym momencie na slajdzie prezenter ma następujący tekst: Niektóre kluczowe zasady Myśl jak Bayesian, sprawdź jak Frequentist (pojednanie) Czy ktoś wie, co to właściwie oznacza? Mam wrażenie, że z …

2
Zwiększanie gradientu dla regresji liniowej - dlaczego to nie działa?
Ucząc się o zwiększaniu gradientu, nie słyszałem o żadnych ograniczeniach dotyczących właściwości „słabego klasyfikatora”, którego ta metoda używa do budowania i składania modelu. Jednak nie wyobrażam sobie zastosowania GB, który wykorzystuje regresję liniową, a właściwie po przeprowadzeniu niektórych testów - to nie działa. Testowałem najbardziej standardowe podejście z gradientem sumy …

3
Jak wybrać metodę grupowania? Jak sprawdzić poprawność rozwiązania klastrowego (aby uzasadnić wybór metody)?
Jednym z największych problemów związanych z analizą skupień jest to, że może się zdarzyć, że będziemy musieli wyciągnąć odmienne wnioski, gdy oprą się na różnych zastosowanych metodach klastrowania (w tym różnych metodach łączenia w hierarchicznym klastrze). Chciałbym poznać Twoją opinię na ten temat - którą metodę wybierzesz i jak. Można …



4
W jaki sposób LSTM zapobiega problemowi zanikania gradientu?
LSTM został opracowany specjalnie w celu uniknięcia problemu zanikania gradientu. Ma to zrobić za pomocą karuzeli Constant Error (CEC), która na poniższym schemacie ( Greff i in. ) Odpowiada pętli wokół komórki . (źródło: deeplearning4j.org ) Rozumiem, że ta część może być postrzegana jako rodzaj funkcji tożsamości, więc pochodna jest …



4
Jak rozkład może mieć nieskończoną średnią i wariancję?
Byłoby zrozumiałe, gdyby można podać następujące przykłady: Rozkład o nieskończonej średniej i nieskończonej wariancji. Rozkład o nieskończonej średniej i skończonej wariancji. Rozkład ze skończoną średnią i nieskończoną wariancją. Rozkład ze skończoną średnią i skończoną wariancją. Pochodzi ode mnie, widząc te nieznane terminy (nieskończona średnia, nieskończona wariancja) użyte w artykule, który …

2
Regresja wielokrotna czy współczynnik korelacji częściowej? I relacje między nimi
Nie wiem nawet, czy to pytanie ma sens, ale jaka jest różnica między regresją wielokrotną a korelacją częściową (oprócz oczywistych różnic między korelacją a regresją, do czego nie dążę)? Chcę dowiedzieć się, co następuje: Mam dwie zmienne niezależne ( , ) i jedną zmienną zależną ( ). Teraz indywidualnie zmienne …

3
PCA i podział pociąg / test
Mam zestaw danych, dla którego mam wiele zestawów etykiet binarnych. Dla każdego zestawu etykiet uczę klasyfikatora, oceniając go poprzez walidację krzyżową. Chcę zmniejszyć wymiarowość za pomocą analizy głównych składników (PCA). Moje pytanie brzmi: Czy możliwe jest wykonanie PCA raz dla całego zestawu danych, a następnie użycie nowego zestawu danych o …

6
Najlepsza metoda na krótkie serie czasowe
Mam pytanie związane z modelowaniem krótkich szeregów czasowych. Nie jest kwestią, czy je wymodelować , ale jak. Jaką metodę poleciłbyś do modelowania (bardzo) krótkich szeregów czasowych (powiedzmy o długości )? Przez „najlepszy” rozumiem tu najbardziej niezawodny, czyli najmniej podatny na błędy ze względu na ograniczoną liczbę obserwacji. W przypadku krótkich …

5
Jak rozwiązać paradoks Simpsona?
Paradoks Simpsona to klasyczna łamigłówka omawiana na wstępnych kursach statystyki na całym świecie. Jednak mój kurs był satysfakcjonujący, aby po prostu zauważyć, że istniał problem i nie przedstawił rozwiązania. Chciałbym wiedzieć, jak rozwiązać paradoks. To znaczy, w obliczu paradoksu Simpsona, gdzie dwie różne opcje wydają się konkurować o najlepszy wybór …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.