Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Ocena modelu regresji logistycznej
Pracowałem nad modelem logistycznym i mam trudności z oceną wyników. Mój model to dwumianowy logit. Moje zmienne objaśniające to: zmienna kategorialna z 15 poziomami, zmienna dychotomiczna i 2 zmienne ciągłe. Mój N jest duży> 8000. Staram się modelować decyzję firm o inwestowaniu. Zmienna zależna to inwestycja (tak / nie), 15 …

2
Przekształcanie listy częściowych rankingów w globalny ranking
Pracuję nad czymś w rodzaju następującego problemu. Mam grupę użytkowników i N książek. Każdy użytkownik tworzy uporządkowany ranking wszystkich książek, które przeczytał (co jest prawdopodobnie podzbiorem N książek), np. Książka 1> Książka 40> Książka 25. Teraz chcę przekształcić te indywidualne rankingi użytkowników w jeden uporządkowany ranking wszystkich książek. Czy są …

2
Wybór komponentów PCA, które oddzielają grupy
Często diagnozowałem moje dane wielowymiarowe za pomocą PCA (dane omiczne z setkami tysięcy zmiennych i dziesiątkami lub setkami próbek). Dane często pochodzą z eksperymentów z kilkoma kategorycznymi zmiennymi niezależnymi definiującymi niektóre grupy, i często muszę przejść przez kilka składników, zanim znajdę te, które wykazują rozdział między grupami zainteresowań. Wymyśliłem dość …


1
Hamiltonian Monte Carlo i dyskretne przestrzenie parametrów
Właśnie rozpoczął budowę modeli Stan ; aby zbudować znajomość narzędzia, pracuję nad niektórymi ćwiczeniami z analizy danych bayesowskich (wydanie 2). W Waterbuck wykonywania zakłada, że dane , z nieznany. Ponieważ Hamiltonian Monte Carlo nie zezwala na parametry dyskretne, zadeklarowałem jako rzeczywistą i zakodowałem rozkład dwumianowy o wartości rzeczywistej za pomocą …


2
dyspersja w summary.glm ()
Przeprowadziłem glm.nb przez glm1<-glm.nb(x~factor(group)) gdzie grupa jest kategorialna, a x jest zmienną metryczną. Kiedy próbuję uzyskać podsumowanie wyników, otrzymuję nieco inne wyniki, w zależności od tego, czy używam summary()lub summary.glm. summary(glm1)daje mi ... Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.1044 0.1519 0.687 0.4921 factor(gruppe)2 0.1580 0.2117 0.746 0.4555 …

3
Autowowariancja procesu ARMA (2,1) - wyprowadzenie modelu analitycznego dla
Muszę wyprowadzić wyrażenia analityczne dla funkcji autokowariancji procesu ARMA (2,1) oznaczonej przez:γ(k)γ(k)\gamma\left(k\right) yt=ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵtyt=ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵty_t=\phi_1y_{t-1}+\phi_2y_{t-2}+\theta_1\epsilon_{t-1}+\epsilon_t Więc wiem, że: γ(k)=E[yt,yt−k]γ(k)=E[yt,yt−k]\gamma\left(k\right) = \mathrm{E}\left[y_t,y_{t-k}\right] więc mogę napisać: γ(k)=ϕ1E[yt−1yt−k]+ϕ2E[yt−2yt−k]+θ1E[ϵt−1yt−k]+E[ϵtyt−k]γ(k)=ϕ1E[yt−1yt−k]+ϕ2E[yt−2yt−k]+θ1E[ϵt−1yt−k]+E[ϵtyt−k]\gamma\left(k\right) = \phi_1 \mathrm{E}\left[y_{t-1}y_{t-k}\right]+\phi_2 \mathrm{E}\left[y_{t-2}y_{t-k}\right]+\theta_1 \mathrm{E}\left[\epsilon_{t-1}y_{t-k}\right]+\mathrm{E}\left[\epsilon_{t}y_{t-k}\right] następnie, aby uzyskać analityczną wersję funkcji autokowariancji, muszę zastąpić wartości - 0, 1, 2 ... dopóki nie otrzymam rekurencji, która jest ważna …






3
Potrzebujesz algorytmu, aby obliczyć względne prawdopodobieństwo, że dane są próbkami z rozkładu normalnego w porównaniu z rozkładem logarytmicznym
Powiedzmy, że masz zestaw wartości i chcesz wiedzieć, czy bardziej prawdopodobne jest, że próbkowano z rozkładu Gaussa (normalnego) lub próbkowano z rozkładu logarytmicznego? Oczywiście idealnie byłoby wiedzieć coś o populacji lub o źródłach błędów eksperymentalnych, więc mielibyśmy dodatkowe informacje przydatne w odpowiedzi na pytanie. Ale tutaj załóżmy, że mamy tylko …

1
Czy stosując średnią k-krotną weryfikację uśredniasz wszystkie modele
Kiedy przeprowadzam walidację krzyżową k-fold, rozumiem, że uzyskujesz miary dokładności, wskazując wszystkie fałdy z wyjątkiem jednego w tym folderze i przewidując, a następnie powtórz ten proces razy. Następnie możesz uruchomić wskaźniki dokładności dla wszystkich swoich instancji (precyzja, przywołanie,% sklasyfikowane poprawnie), które powinny być takie same, jakbyś je obliczał za każdym …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.