Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Rozkład stosunku zależnych zmiennych losowych chi-kwadrat
Załóżmy, że gdzie są niezależne.X=X1+X2+⋯+XnX=X1+X2+⋯+Xn X = X_1 + X_2+\cdots+ X_n Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim N(0,\sigma^2) Moje pytanie brzmi: co robi dystrybucja Z=X2X21+X22+⋯+X2nZ=X2X12+X22+⋯+Xn2 Z = \frac{X^2}{X_1^2 + X_2^2 + \cdots + X_n^2} podążać? Wiem stąd, że stosunek dwóch losowych zmiennych chi-kwadrat wyrażonych jako zgodny z rozkładem Beta. Myślę, że ta zakłada niezależność …

3
Dopasowanie modeli wielopoziomowych do złożonych danych pomiarowych w języku R.
Szukam porady, w jaki sposób analizować złożone dane ankietowe za pomocą modeli wielopoziomowych w R. Użyłem surveypakietu do ważenia nierównych prawdopodobieństw wyboru w modelach jednopoziomowych, ale ten pakiet nie ma funkcji do modelowania wielopoziomowego. lme4Opakowanie jest idealne do modelowania wielopoziomowego, ale nie jest to sposób, że wiem zawierać ciężarów na …

1
Czy funkcja łącznika kanonicznego zawsze istnieje dla Uogólnionego Modelu Liniowego (GLM)?
W GLM, zakładając skalarny i dla rozkładu leżącego u podstaw z pdf Można wykazać, że . Jeśli funkcja łączenia spełnia następujące warunki, gdzie jest predyktorem liniowym, wówczas nazywa się w tym celu funkcją łącza kanonicznego Model.YYYθθ\thetafY(y|θ,τ)=h(y,τ)exp(θy−A(θ)d(τ))fY(y|θ,τ)=h(y,τ)exp⁡(θy−A(θ)d(τ))f_Y(y | \theta, \tau) = h(y,\tau) \exp{\left(\frac{\theta y - A(\theta)}{d(\tau)} \right)}μ=E(Y)=A′(θ)μ=E⁡(Y)=A′(θ) \mu = \operatorname{E}(Y) = …


1
Model krańcowy a model efektów losowych - jak wybrać między nimi? Rada dla laika
Szukając jakichkolwiek informacji o modelu marginalnym i modelu efektów losowych oraz o tym, jak wybierać między nimi, znalazłem pewne informacje, ale było to mniej więcej matematyczne streszczenie (np. Tutaj: https: //stats.stackexchange .pl / a / 68753/38080 ). Gdzieś stwierdziłem, że zaobserwowano znaczne różnice między szacunkami parametrów między tymi dwiema metodami …

3
Przedział ufności dla krzyżowo potwierdzonej dokładności klasyfikacji
Pracuję nad problemem klasyfikacji, który oblicza podobieństwo między dwoma wejściowymi obrazami rentgenowskimi. Jeśli obrazy przedstawiają tę samą osobę (etykieta „prawa”), obliczona zostanie wyższa metryka; wprowadzenie obrazów dwóch różnych osób (oznaczenie „zły”) spowoduje obniżenie wartości. Użyłem warstwowej 10-krotnej walidacji krzyżowej, aby obliczyć prawdopodobieństwo błędnej klasyfikacji. Mój obecny rozmiar próbki wynosi około …


1
Rozkład próbkowania promienia rozkładu normalnego 2D
Dwuwymiarowy rozkład normalny ze średnią i macierzą kowariancji można ponownie zapisać we współrzędnych biegunowych o promieniu kącie . Moje pytanie brzmi: jaki jest rozkład próbkowania , to znaczy odległość od punktu do szacowanego środka danej macierzy kowariancji próbki ?μμ\muΣΣ\Sigmarrrθθ\thetar^r^\hat{r}xxxx¯x¯\bar{x}SSS Tło: Rzeczywista odległość od punktu oznacza, że zgodne z rozkładem Hoyta …


1
Jak sprawdzić ergodyczność procesów stochastycznych na podstawie ich ścieżek (ścieżek)?
Jak sprawdzić ergodyczność szeroko zakrojonych stacjonarnych procesów stochastycznych z ich ścieżek prób? Czy możemy sprawdzić ergodyczność na podstawie pojedynczej ścieżki próbki? Czy potrzebujemy wielu ścieżek przykładowych? Jedną z motywacji sprawdzania ergodyczności są szeregi czasowe, aby upewnić się, że można bezpiecznie wykorzystać średnią ścieżki próbki w czasie jako średnią dla populacji?

1
Test Friedmana vs test Wilcoxona
Usiłuję ocenić wydajność nadzorowanego algorytmu klasyfikacji uczenia maszynowego. Obserwacje dzielą się na klasy nominalne (na razie 2, jednak chciałbym uogólnić to na problemy wielu klas), zaczerpnięte z populacji 99 osób. Jednym z pytań, na które chciałbym odpowiedzieć, jest to, czy algorytm wykazuje znaczącą różnicę w dokładności klasyfikacji między klasami wejściowymi. …

3
Czy modułowość sieci Newmana działa dla podpisanych, ważonych wykresów?
Modułowość wykresu jest zdefiniowana na stronie Wikipedii . W innym poście ktoś wyjaśnił, że modułowość można łatwo obliczyć (i zmaksymalizować) dla sieci ważonych, ponieważ macierz przyległości może również zawierać wartościowe powiązania. Chciałbym jednak wiedzieć, czy zadziała to również z podpisanymi, cenionymi krawędziami, na przykład od -10 do +10. Czy możesz …

2
Wygładzanie Laplace'a i Dirichleta wcześniej
W artykule na Wikipedii o wygładzaniu Laplace'a (lub wygładzaniu addytywnym) mówi się, że z bayesowskiego punktu widzenia odpowiada to oczekiwanej wartości rozkładu tylnego przy użyciu symetrycznego rozkładu Dirichleta z parametrem jako wcześniejszym.αα\alpha Zastanawiam się, jak to w rzeczywistości jest prawdą. Czy ktoś mógłby mi pomóc zrozumieć, w jaki sposób te …

1
Wyjaśnienie maksymalizacji oczekiwań
Znalazłem bardzo pomocny samouczek dotyczący algorytmu EM . Przykład i zdjęcie z samouczka jest po prostu genialne. Powiązane pytanie dotyczące obliczania prawdopodobieństwa, jak działa maksymalizacja oczekiwań? Mam inne pytanie dotyczące połączenia teorii opisanej w samouczku z przykładem. Podczas kroku E, EM wybiera funkcję która ogranicza i dla której .soltgtg_tlogP.( x …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.