Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Dlaczego estymator Jamesa-Steina nazywany jest estymatorem „skurczu”?
Czytałem o estymatorze Jamesa-Steina. W tych uwagach jest zdefiniowany jako θ^=(1−p−2∥X∥2)Xθ^=(1−p−2‖X‖2)X \hat{\theta}=\left(1 - \frac{p-2}{\|X\|^2}\right)X Przeczytałem dowód, ale nie rozumiem następującego oświadczenia: Geometrycznie estymator Jamesa-Steina zmniejsza każdy składnik kierunku początku ...XXX Co dokładnie oznacza „zmniejsza każdy składnik XXX kierunku źródła”? Myślałem o czymś takim jak ∥θ^−0∥2&lt;∥X−0∥2,‖θ^−0‖2&lt;‖X−0‖2,\|\hat{\theta} - 0\|^2 < \|X - …

2
Jakie jest uzasadnienie funkcji kowariancji Matérna?
Funkcja kowariancji Matérna jest powszechnie stosowana jako funkcja jądra w procesie Gaussa. Jest tak zdefiniowane Cν(d)=σ221−νΓ(ν)(2ν−−√dρ)νKν(2ν−−√dρ)Cν(d)=σ221−νΓ(ν)(2νdρ)νKν(2νdρ) {\displaystyle C_{\nu }(d)=\sigma ^{2}{\frac {2^{1-\nu }}{\Gamma (\nu )}}{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}^{\nu }K_{\nu }{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}} gdzie jest funkcją odległości (taką jak odległość euklidesowa), jest funkcją gamma, jest …

4
Problem z drzewem magicznych pieniędzy
Myślałem o tym problemie pod prysznicem, ponieważ inspiracją były strategie inwestycyjne. Powiedzmy, że było drzewo magicznych pieniędzy. Każdego dnia możesz zaoferować pieniądze drzewku pieniędzy, które potroi je lub zniszczy z prawdopodobieństwem 50/50. Natychmiast zauważasz, że robiąc to, średnio zarabiasz i chętnie skorzystasz z drzewa pieniędzy. Jeśli jednak zaoferowałbyś wszystkie swoje …


6
Czy strojenie hiperparametrów na próbce zestawu danych jest złym pomysłem?
Mam zestaw danych zawierający 140000 przykładów i 30 funkcji, dla których uczę kilku klasyfikatorów do klasyfikacji binarnej (SVM, regresja logistyczna, losowy las itp.) W wielu przypadkach dostrajanie hiperparametrów w całym zbiorze danych przy użyciu wyszukiwania siatkowego lub losowego jest zbyt kosztowne pod względem czasowym. Zacząłem stosować następującą technikę Podpróbka mojego …



2
Metodologia prognozowania VAR
Buduję model VAR do prognozowania ceny aktywów i chciałbym wiedzieć, czy moja metoda jest statystycznie solidna, czy testy, które podałem, są odpowiednie i czy potrzebne są dalsze, aby zapewnić wiarygodną prognozę na podstawie moich zmiennych wejściowych. Poniżej znajduje się mój bieżący proces sprawdzania przyczynowości Grangera i prognozowania wybranego modelu VAR. …
19 r  forecasting  modeling  var 


1
Dobroć dopasowania i który model wybrać regresję liniową lub Poissona
Potrzebuję porady dotyczącej dwóch głównych dylematów w moich badaniach, które są studium przypadku 3 dużych farmaceutyków i innowacji. Liczba patentów rocznie jest zmienną zależną. Moje pytania są Jakie są najważniejsze kryteria dobrego modelu? Co jest ważniejsze / mniej ważne? Czy to, że większość lub wszystkie zmienne będą znaczące? Czy to …

4
Najlepszy sposób radzenia sobie z heteroscedastycznością?
Mam wykres wartości resztkowych modelu liniowego w funkcji dopasowanych wartości, w których heteroscedastyczność jest bardzo wyraźna. Jednak nie jestem pewien, jak powinienem postępować teraz, ponieważ o ile rozumiem ta heteroscedastyczność powoduje, że mój model liniowy jest nieważny. (Czy to prawda?) Użyj solidnego dopasowania liniowego za pomocą rlm()funkcji MASSpakietu, ponieważ jest …

3
Czy istnieje wiele lokalnych optymalnych rozwiązań, gdy rozwiązujemy regresję liniową?
Przeczytałem to oświadczenie na jednym starym egzaminie prawda / fałsz: Możemy uzyskać wiele lokalnych optymalnych rozwiązań, jeśli rozwiążemy problem regresji liniowej, minimalizując sumę błędów kwadratu za pomocą spadku gradientu. Rozwiązanie: Fałsz Moje pytanie brzmi, która część tego pytania jest błędna? Dlaczego to stwierdzenie jest fałszywe?


5
Jak przekodować zmienną kategorialną na zmienną numeryczną podczas korzystania z SVM lub sieci neuronowej
Aby użyć SVM lub sieci neuronowej, należy przekształcić (zakodować) zmienne kategorialne w zmienne numeryczne, normalną metodą w tym przypadku jest użycie wartości binarnych 0-1 z przekształconą k-tą wartością kategorialną na (0,0, .. ., 1,0, ... 0) (1 jest w pozycji k-tej). Czy istnieją inne metody, aby to zrobić, zwłaszcza gdy …

2
Modele równań strukturalnych (SEM) a sieci bayesowskie (BN)
Terminologia tutaj to bałagan. „Równanie strukturalne” jest tak samo niejasne jak „most architektoniczny”, a „sieć bayesowska” nie jest z natury bayesowska . Co więcej, Judea Pearl , bóg przyczynowości, mówi, że obie szkoły modeli są prawie identyczne. Jakie są ważne różnice? (Zdumiewające dla mnie, strona Wikipedii dla SEM nie zawiera …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.