Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak wybrać algorytmy uczenia się
Muszę wdrożyć program, który klasyfikuje rekordy na 2 kategorie (prawda / fałsz) na podstawie niektórych danych szkoleniowych i zastanawiałem się, na jaki algorytm / metodologię powinienem patrzeć. Wygląda na to, że jest ich wiele do wyboru - sztuczna sieć neuronowa, algorytm genetyczny, uczenie maszynowe, optymalizacja bayesowska itp. Itd. I nie …

5
Wprowadzenie do teorii miary
Chciałbym dowiedzieć się więcej o nieparametrycznych technikach bayesowskich (i pokrewnych). Mam doświadczenie w informatyce i chociaż nigdy nie brałem udziału w kursie teorii miary lub teorii prawdopodobieństwa, miałem ograniczone formalne szkolenie w zakresie prawdopodobieństwa i statystyki. Czy ktoś może polecić czytelne wprowadzenie do tych pojęć, aby zacząć?

2
Pomiar podobieństwa dokumentu
Do grupowania dokumentów (tekstowych) potrzebny jest sposób pomiaru podobieństwa między parami dokumentów. Dwie alternatywy to: Porównaj dokumenty jako wektory terminów za pomocą podobieństwa Cosinus - i TF / IDF jako ważenia terminów. Porównaj rozkład prawdopodobieństwa każdego dokumentu za pomocą rozbieżności f, np. Rozbieżności Kullbacka-Leiblera Czy jest jakiś intuicyjny powód, aby …


3
Współczynnik determinacji ( ): Nigdy w pełni nie zrozumiałem interpretacji
Chcę w pełni zrozumieć pojęcie opisujące wielkość zmienności między zmiennymi. Każde internetowe wyjaśnienie jest trochę mechaniczne i tępe. Chcę „zrozumieć” tę koncepcję, nie tylko mechanicznie używać liczb.r2r2r^2 Np .: Przebadane godziny vs. wynik testu rrr = 0,8 r2r2r^2 = 0,64 Co to znaczy? 64% zmienności wyników testu można wytłumaczyć godzinami? …





4
Entropia obrazu
Jaki jest najbardziej poprawny pod względem teoretycznym / informacyjnym sposób obliczenia entropii obrazu? W tej chwili nie dbam o wydajność obliczeniową - chcę, aby teoretycznie była jak najbardziej poprawna. Zacznijmy od obrazu w skali szarości. Jednym intuicyjnym podejściem jest rozważenie obrazu jako worka pikseli i obliczenie gdzie jest liczbą poziomów …

2
Jak podsumować wiarygodne interwały dla odbiorców medycznych
Ze Stanem i pakietów frontend rstanarmczy brmsmogę łatwo analizować dane droga Bayesa jak ja zanim z mieszanych modeli takich jak lme. Chociaż na biurku mam większość książek i artykułów Kruschke-Gelman-Wagenmakers itp., Nie mówią mi one, jak podsumować wyniki dla medycznej publiczności, rozdartej między Skylla gniewu Bayesiana a Charybdą recenzentów medycznych …

5
Podejście statystyczne do ustalenia, czy dane brakuje przypadkowo
Mam duży zestaw wektorów cech, których użyję do zaatakowania problemu z klasyfikacją binarną (za pomocą scikit learn w Pythonie). Zanim zacznę myśleć o imputacji, jestem zainteresowany próbą ustalenia na podstawie pozostałych części danych, czy brakujące dane są „losowo brakujące”, czy nie losowe. Jak rozsądnie podejść do tego pytania? Okazuje się, …



2
Jakie są założenia regresji grzbietu i jak je przetestować?
Rozważmy standardowy model regresji wielokrotnej gdzie , więc normalność, homoscedastyczność i nieskorelacja błędów pozostają w mocy.Y= Xβ+ εY=Xβ+εY=X\beta+\varepsilonε ∼ N( 0 , σ2)jan)ε∼N(0,σ2In)\varepsilon \sim \mathcal N(0, \sigma^2I_n) Załóżmy, że wykonujemy regresję grzbietu, dodając tę ​​samą niewielką ilość do wszystkich elementów przekątnej :XXX βr i d g e= [ X′X+ k …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.