Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak dokładnie działa wybór funkcji Chi-kwadrat?
Wiem, że dla każdej pary klas obiektów wartość statystyki chi-kwadrat jest obliczana i porównywana z wartością progową. Jestem trochę zmieszany. Jeśli istnieje cech i klas , jak buduje się tabelę awaryjną? Jak decydować, które funkcje zachować, a które usunąć?mmmkkk Wszelkie wyjaśnienia będą mile widziane. Z góry dziękuję

3
Tor zderzeniowy w solidnym szacowaniu średniej
Mam kilka (około 1000) oszacowań i wszystkie one mają być oszacowaniami długoterminowej elastyczności. Nieco ponad połowa z nich jest szacowana za pomocą metody A, a reszta za pomocą metody B. Gdzieś czytam coś w stylu „Myślę, że metoda B ocenia coś zupełnie innego niż metoda A, ponieważ szacunki są znacznie …

7
Jakiego algorytmu uczenia maszynowego można użyć do przewidywania rynku akcji?
Alternatywnie, aby przewidzieć rynki walutowe. Wiem, że może to być dość skomplikowane, więc na wstępie szukam prostego algorytmu przewidywania, który ma pewną dokładność. (Dotyczy projektu uniwersyteckiego trwającego cztery miesiące) Czytałem, że wielowarstwowa sieć neuronowa może być przydatna. Masz jakieś przemyślenia na ten temat? Ponadto semantyczna analiza mediów społecznościowych może zapewnić …



2
Dlaczego rozkład Poissona jest wybrany do modelowania procesów przybycia w problemach teorii kolejkowania?
Gdy weźmiemy pod uwagę scenariusze teorii kolejkowania, w których poszczególne osoby przybywają do obsługującego węzła i ustawiają się w kolejce, zwykle do modelowania czasów przybycia stosuje się proces Poissona. Te scenariusze pojawiają się w przypadku problemów z routingiem sieciowym. Doceniłbym intuicyjne wyjaśnienie, dlaczego proces Poissona najlepiej nadaje się do modelowania …

5
Który algorytm klasyfikacji statystycznej może przewidzieć wartość prawda / fałsz dla sekwencji danych wejściowych?
Biorąc pod uwagę sekwencję danych wejściowych, muszę ustalić, czy sekwencja ta ma pewną pożądaną właściwość. Właściwość może być tylko prawdą lub fałszem, tzn. Istnieją tylko dwie możliwe klasy, do których może należeć sekwencja. Dokładny związek między sekwencją a właściwością jest niejasny, ale uważam, że jest bardzo spójny i powinien podlegać …




2
Stała normalizująca w twierdzeniu Bayesa
Pr(data)Pr(data)\Pr(\textrm{data}) Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)\Pr(\text{parameters} \mid \text{data}) = \frac{\Pr(\textrm{data} \mid \textrm{parameters}) \Pr(\text{parameters})}{\Pr(\text{data})} nazywa się stałą normalizującą . Co to dokładnie jest Jaki jest jego cel? Dlaczego wygląda na ? Dlaczego to nie zależy od parametrów?Pr(data)Pr(data)\Pr(data)

4
Jak określić hipotezę zerową w testowaniu hipotez
Jaka jest dobra ogólna zasada wyboru pytania dla hipotezy zerowej. Na przykład, jeśli chcę sprawdzić, czy hipoteza B jest prawdziwa, czy powinienem użyć B jako zerowej, B jako alternatywnej hipotezy, czy NIE B jako zerowej? Mam nadzieję, że pytanie jest jasne. Wiem, że ma to coś wspólnego z błędem, który …

4
Wydajna aktualizacja regresji liniowej podczas dodawania obserwacji i / lub predyktorów w R
Byłbym zainteresowany znalezieniem sposobów na R efektywnego aktualizowania modelu liniowego po dodaniu obserwacji lub predyktora. biglm ma możliwość aktualizacji podczas dodawania obserwacji, ale moje dane są na tyle małe, że mieszczą się w pamięci (chociaż mam wiele instancji do aktualizacji). Istnieją sposoby, aby to zrobić gołymi rękami, np. W celu …

5
Czy istnieje coś więcej niż prawdopodobieństwo bayesianizmu?
Jako student fizyki doświadczyłem wykładu „Dlaczego jestem Bayesianem” może pół tuzina razy. Zawsze jest tak samo - prezenter z satysfakcją wyjaśnia, w jaki sposób interpretacja bayesowska przewyższa interpretację częstokrzyską rzekomo stosowaną przez masy. Wspominają o regule Bayesa, marginalizacji, przeorach i późniejszych. Jaka jest prawdziwa historia? Czy istnieje uzasadniona dziedzina zastosowania …

4
Optymalny wybór kar dla lasso
Czy są jakieś wyniki analityczne lub prace eksperymentalne dotyczące optymalnego wyboru współczynnika kary karnej ℓ1ℓ1\ell_1Przez „ optymalny” rozumiem parametr, który maksymalizuje prawdopodobieństwo wyboru najlepszego modelu lub minimalizuje oczekiwaną stratę. Pytam, ponieważ często niepraktyczne jest wybranie parametru za pomocą weryfikacji krzyżowej lub bootstrapu, albo z powodu dużej liczby przypadków problemu, albo …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.