Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Ocena regresji logistycznej i interpretacja dobroci dopasowania Hosmera-Lemeshowa
Jak wszyscy wiemy, istnieją 2 metody oceny modelu regresji logistycznej i testują one bardzo różne rzeczy Moc predykcyjna: Uzyskaj statystykę mierzącą, jak dobrze możesz przewidzieć zmienną zależną na podstawie zmiennych niezależnych. Dobrze znanymi Pseudo R ^ 2 są McFadden (1974) oraz Cox i Snell (1989). Statystyki dobroci dopasowania Test mówi, …

2
Zmienić modelowanie procesu za pomocą rozkładu Poissona, aby zastosować ujemny rozkład dwumianowy?
\newcommand{\P}{\mathbb{P}} Mamy procesu losowego, które mogą, albo nie, może wystąpić wiele razy w zadanym okresie czasu . Mamy plik danych z wcześniej istniejącego modelu tego procesu, który zapewnia prawdopodobieństwo wystąpienia wielu zdarzeń w okresie 0 \ leq t <T . Ten istniejący model jest stary i musimy przeprowadzać bieżące kontrole …

2
Paradoks danych ID (przynajmniej dla mnie)
Jeśli chodzi o moją kruszywa (i ograniczonych) wiedzy na statystykach zezwoleń, zrozumiałem, że jeśli X1,X2,...,XnX1,X2,...,XnX_1, X_2,..., X_n są IID zmiennymi losowymi, a następnie jako termin oznacza, że są niezależne i jednakowo rozdzielone. Moje obawy o to dawny majątek próbek IID, który brzmi: p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(X_{n}|X_{i_1},X_{i_2},...,X_{i_k}) = p(X_{n}), dla dowolnej kolekcji różnych 's …

2
Bag-of-Words do klasyfikacji tekstu: Dlaczego nie użyć częstotliwości słów zamiast TFIDF?
Powszechnym podejściem do klasyfikacji tekstu jest wyszkolenie klasyfikatora z „worka słów”. Użytkownik bierze tekst do sklasyfikowania i zlicza częstotliwości słów w każdym obiekcie, po czym następuje pewnego rodzaju przycinanie, aby zachować wynikową macierz o możliwym do zarządzania rozmiarze. Często widzę, jak użytkownicy konstruują wektor cech za pomocą TFIDF. Innymi słowy, …

4
Czego możemy się nauczyć o ludzkim mózgu ze sztucznych sieci neuronowych?
Wiem, że moje pytanie / tytuł nie jest zbyt szczegółowe, dlatego postaram się je wyjaśnić: Sztuczne sieci neuronowe mają stosunkowo ścisłe konstrukcje. Oczywiście na ogół mają na nie wpływ biologia i próbują zbudować matematyczny model prawdziwych sieci neuronowych, ale nasze zrozumienie prawdziwych sieci neuronowych jest niewystarczające do zbudowania dokładnych modeli. …


3
Dlaczego transformacji mocy lub logów nie uczy się wiele w uczeniu maszynowym?
Uczenie maszynowe (ML) w znacznym stopniu wykorzystuje techniki regresji liniowej i logistycznej. Powołuje się on także na technikach inżynierii (funkcja feature transform, kernelitp). Dlaczego nic o variable transformation(np power transformation) wymienione w ML? (Na przykład, nigdy nie słyszę o włączeniu roota lub logu do funkcji, zwykle używają po prostu wielomianów …

4
Algorytmy wykrywania anomalii szeregów czasowych
Obecnie używam Twitter AnomalyDetection w R: https://github.com/twitter/AnomalyDetection . Ten algorytm zapewnia wykrywanie anomalii szeregów czasowych dla danych z sezonowością. Pytanie: czy istnieją inne algorytmy podobne do tego (kontrola sezonowości nie ma znaczenia)? Próbuję zdobyć jak najwięcej algorytmów szeregów czasowych na moich danych, aby móc wybrać najlepszy jeden / zestaw.

2
Autoencodery nie mogą nauczyć się istotnych funkcji
Mam 50 000 obrazów takich jak te dwa: Przedstawiają wykresy danych. Chciałem wydobyć funkcje z tych obrazów, więc użyłem kodu autoencodera dostarczonego przez Theano (deeplearning.net). Problem polega na tym, że te autoencodery wydają się nie uczyć żadnych funkcji. Próbowałem RBM i to samo. Zestaw danych MNIST zapewnia ładne funkcje, ale …

2
Lasso bayesowskie kontra zwykłe lasso
Dostępne są różne programy wdrożeniowe dla lasso . Wiem wiele dyskusji na temat podejścia bayesowskiego i częstego na różnych forach. Moje pytanie jest bardzo specyficzne dla lasso - jakie są różnice lub zalety lasso baysian w porównaniu ze zwykłym lasso ? Oto dwa przykłady implementacji w pakiecie: # just example …

1
Interpretacja geometryczna wielokrotnego współczynnika korelacji
Interesuje mnie geometryczne znaczenie wielokrotnej korelacji RRR i współczynnik determinacji w regresji lub w notacji wektorowej,R2R2R^2yi=β1+β2x2,i+⋯+βkxk,i+ϵiyi=β1+β2x2,i+⋯+βkxk,i+ϵiy_i = \beta_1 + \beta_2 x_{2,i} + \dots + \beta_k x_{k,i} + \epsilon_i y=Xβ+ϵy=Xβ+ϵ\mathbf{y} = \mathbf{X \beta} + \mathbf{\epsilon} Tutaj macierz projektowa ma wierszyXX\mathbf{X}nnnkkk kolumn, z których pierwszą jest , wektor 1s, który odpowiada przecięciu …


3
Wykrywanie wartości odstających w przekrzywionych rozkładach
Zgodnie z klasyczną definicją wartości odstającej jako punktu danych poza IQR 1,5 * z górnego lub dolnego kwartylu, zakłada się rozkład nieskośny. W przypadku rozkładów skośnych (wykładnicza, Poissona, geometryczna itp.) Czy najlepszym sposobem na wykrycie wartości odstającej jest analiza transformacji oryginalnej funkcji? Na przykład rozkłady luźno rządzone rozkładem wykładniczym można …

1
Czy wielomian (1 / n,…, 1 / n) można scharakteryzować jako dyskretny Dirichlet (1, .., 1)?
To pytanie jest nieco niechlujne, ale w celu uzupełnienia tego uwzględnię kolorowe wykresy! Najpierw tło, a następnie pytanie. tło Załóżmy, że masz wymiarowy rozkład wielomianowy z jednakowymi probailitami w kategoriach . Niech będzie znormalizowanymi ( ) z tego rozkładu, to znaczy:nnnnnnπ=(π1,…,πn)π=(π1,…,πn)\pi = (\pi_1, \ldots, \pi_n)ccc (c1,…,cn)∼Multinomial(1/n,…,1/n)πi=cin(c1,…,cn)∼Multinomial(1/n,…,1/n)πi=cin(c_1, \ldots, c_n) \sim \text{Multinomial}(1/n, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.