Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Kiedy należy użyć próbkowania Gibbsa zamiast Metropolis-Hastings?
Istnieją różne rodzaje algorytmów MCMC: Metropolis-Hastings Gibbs Próbkowanie pod kątem ważności / odrzucenia (powiązane). Dlaczego warto korzystać z próbkowania Gibbs zamiast Metropolis-Hastings? Podejrzewam, że zdarzają się przypadki, w których wnioskowanie jest łatwiejsze w przypadku próbkowania Gibbsa niż w przypadku Metropolis-Hastings, ale nie mam jasności co do szczegółów.

1
Pomóż mi zrozumieć skorygowany iloraz szans w regresji logistycznej
Z trudem próbuję zrozumieć zastosowanie regresji logistycznej w pracy. Artykuł dostępny tutaj wykorzystuje regresję logistyczną do przewidywania prawdopodobieństwa powikłań podczas operacji zaćmy. To, co mnie dezorientuje, to fakt, że artykuł przedstawia model, który przypisuje iloraz szans 1 do linii bazowej opisanej następująco: Pacjenta, którego profil ryzyka był w grupie odniesienia …

2
Extreme learning machine: o co w tym wszystkim chodzi?
Od ponad roku zastanawiam się, wdrażam i stosuję paradygmat Extreme Learning Machine (ELM), a im dłużej to robię, tym bardziej wątpię, czy to naprawdę dobra rzecz. Wydaje mi się jednak, że moja opinia jest sprzeczna ze środowiskiem naukowym, w którym - gdy używa się cytatów i nowych publikacji jako środka …
20 regression 

1
Dyskusja na temat overfit w xgboost
Moja konfiguracja jest następująca: Postępuję zgodnie z wytycznymi w „Applied Predictive Modeling”. W związku z tym odfiltrowałem skorelowane funkcje i kończę na następujących: 4900 punktów danych w zestawie treningowym i 1600 punktów danych w zestawie testowym. Mam 26 cech, a celem jest zmienna ciągła. Stosuję 5-krotną walidację krzyżową do trenowania …

2
Dowód zbieżności średnich k
W przypadku zadania poproszono mnie o przedstawienie dowodu, że k-średnie zbiega się w skończonej liczbie kroków. Oto co napisałem: CCCE(C)=∑xmini=1k∥x−ci∥2E(C)=∑xmini=1k‖x−ci‖2E(C)=\sum_{\mathbf{x}}\min_{i=1}^{k}\left\Vert \mathbf{x}-\mathbf{c}_{i}\right\Vert ^{2}E(C)E(C)E(C) Krok 2 odnosi się do kroku, który oznacza każdy punkt danych najbliższym centrum skupienia, a krok 3 jest krokiem, w którym centra są aktualizowane przy użyciu średniej. Nie …

6
Oczekiwana wartość czasu oczekiwania na pierwszy z dwóch autobusów kursujących co 10 i 15 minut
Natknąłem się na pytanie w wywiadzie: Co 10 minut przyjeżdża czerwony pociąg. Co 15 minut przyjeżdża niebieski pociąg. Oba zaczynają się od przypadkowego czasu, więc nie masz żadnego harmonogramu. Jeśli przyjeżdżasz na stację w przypadkowym czasie i jeździsz pociągiem, który przyjeżdża pierwszy, jaki jest oczekiwany czas oczekiwania?

2
Zalety wykładniczej rodziny: dlaczego powinniśmy ją studiować i wykorzystywać?
Więc tutaj studiuję wnioskowanie. Chciałbym, aby ktoś mógł wymienić zalety wykładniczej rodziny. Przez rodzinę wykładniczą rozumiem rozkłady, które są podane jako f( x|θ)=h(x)exp{η(θ)T( x ) - B ( θ)}f(x|θ)=h(x)exp⁡{η(θ)T.(x)-b(θ)}\begin{align*} f(x|\theta) = h(x)\exp\left\{\eta(\theta)T(x) - B(\theta)\right\} \end{align*} których wsparcie nie zależy od parametru θθ\theta . Oto kilka zalet, które odkryłem: (a) Obejmuje …



1
Jaka jest historia działek i jak ewoluował projekt „pudełka i wąsów”?
Wiele źródeł datuje klasyczny projekt „pudełkowej fabuły” na Johna Tukeya i jego „schematyczną fabułę” z 1970 r. Wygląda na to, że od tego czasu pozostał względnie niezmienny, a wycięta w pudełku wersja Edwarda Tufte'a nie została przyłapana, podczas gdy wykresy skrzypcowe - choć bardziej pouczający wariant wykresu skrzynkowego - pozostają …


4
Dlaczego zwiększenie wielkości próby przewracania monet nie poprawia przybliżenia normalnej krzywej?
Czytam książkę Statystyka (Freeman, Pisani, Purves) i próbuję odtworzyć przykład, w którym rzuca się monetą, powiedzmy 50 razy, liczbę głów liczoną i to się powtarza powiedzmy 1000 razy. Po pierwsze, utrzymałem liczbę rzutów (wielkość próbki) na poziomie 1000 i zwiększyłem liczbę powtórzeń. Im więcej powtórzeń, tym lepiej dane pasują do …

4
Związki między korelacją a przyczyną
Ze strony Wikipedii zatytułowanej korelacja nie oznacza związku przyczynowego , W przypadku dowolnych dwóch skorelowanych zdarzeń, A i B, możliwe różne zależności obejmują: A powoduje B (bezpośredni związek przyczynowy); B powoduje A (przyczynowość odwrotna); A i B są konsekwencjami wspólnej przyczyny, ale nie powodują siebie; Zarówno A, jak i B …

1
Test nieparametryczny, jeżeli dwie próbki są pobierane z tego samego rozkładu
Chciałbym przetestować hipotezę, że dwie próbki pochodzą z tej samej populacji, nie przyjmując żadnych założeń dotyczących rozkładu próbek lub populacji. Jak mam to zrobić? Z Wikipedii mam wrażenie, że test U Manna Whitneya powinien być odpowiedni, ale wydaje mi się, że nie działa w praktyce. Dla konkretności stworzyłem zestaw danych …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.