Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Teksty wprowadzające dotyczące ekonometrii strukturalnej
W ostatnich latach podejście strukturalne do ekonometrii w porównaniu do ekonometrii o zredukowanej formie stało się bardziej popularne. Wymaga to ścisłego połączenia teoretycznych modeli ekonomicznych i statystyk w celu oszacowania interesujących parametrów. Nakładanie bardziej teoretycznej struktury na sposób, w jaki korzystamy z danych i metod statystycznych, ma na celu dostarczenie …

1
Czy możemy użyć pominięcia jednej średniej i standardowego odchylenia, aby ujawnić wartości odstające?
Załóżmy, że normalnie rozpowszechniłem dane. Dla każdego elementu danych chcę sprawdzić, ile SD jest oddalonych od średniej. Dane mogą zawierać wartości odstające (prawdopodobnie tylko jeden, ale mogą być również dwa lub trzy) lub nie, ale ta wartość odstająca jest zasadniczo tym, czego szukam. Czy sensowne jest tymczasowe wykluczenie elementu, na …

1
Czy algorytm Gibbs Sampling gwarantuje szczegółową równowagę?
Mam najwyższą władzę 1, że Gibbs Sampling jest szczególnym przypadkiem algorytmu Metropolis-Hastings do próbkowania Markov Chain Monte Carlo. Algorytm MH zawsze daje prawdopodobieństwo przejścia z właściwością równowagi szczegółowej; Spodziewam się, że Gibbs też powinien. Więc gdzie w poniższym prostym przypadku popełniłem błąd? Dla rozkładu docelowego π(x,y)π(x,y)\pi(x, y) na dwóch zmiennych …
17 mcmc  gibbs 

3
Budowanie i wybór modelu za pomocą Hosmer i in. 2013. Zastosowana regresja logistyczna w R
To jest mój pierwszy post na StackExchange, ale od dłuższego czasu używam go jako zasobu, zrobię co w mojej mocy, aby użyć odpowiedniego formatu i wprowadzić odpowiednie zmiany. Jest to również pytanie wieloczęściowe. Nie byłem pewien, czy powinienem podzielić pytanie na kilka różnych postów, czy tylko na jeden. Ponieważ wszystkie …

1
Dowód stacjonarności AR (2)
Rozważmy proces AR (2) o średnim środku Xt=ϕ1Xt−1+ϕ2Xt−2+ϵtXt=ϕ1Xt−1+ϕ2Xt−2+ϵtX_t=\phi_1X_{t-1}+\phi_2X_{t-2}+\epsilon_t gdzie ϵtϵt\epsilon_t jest standardowym procesem białego szumu. Tylko dla uproszczenia niech mnie nazywają ϕ1=bϕ1=b\phi_1=b i ϕ2=aϕ2=a\phi_{2}=a . Skupiając się na pierwiastkach równania charakterystyk otrzymałem z1,2=−b±b2+4a−−−−−−√2az1,2=−b±b2+4a2az_{1,2}=\frac{-b\pm\sqrt{b^2+4a}}{2a} Klasyczne warunki w podręcznikach są następujące:{|a|&lt;1a±b&lt;1{|a|&lt;1a±b&lt;1\begin{cases}|a|<1 \\ a\pm b<1 \end{cases} Próbowałem rozwiązać ręcznie (przy pomocy Mathematica) nierówności …

1
Regresja logistyczna: jak uzyskać model nasycony
Właśnie przeczytałem o miary dewiacji dla regresji logistycznej. Jednak część zwana modelem nasyconym nie jest dla mnie jasna. Przeprowadziłem obszerne wyszukiwanie w Google, ale żaden z wyników nie odpowiedział na moje pytanie. Do tej pory dowiedziałem się, że model nasycony ma parametr dla każdej obserwacji, co w konsekwencji powoduje idealne …

1
Pominięte zmienne odchylenie w regresji logistycznej vs. pominięte zmienne odchylenie w zwykłej regresji metodą najmniejszych kwadratów
Mam pytanie dotyczące pominiętej zmienności stronniczej w regresji logistycznej i liniowej. Powiedzmy, że pomijam niektóre zmienne z modelu regresji liniowej. Udawaj, że te pominięte zmienne nie są skorelowane ze zmiennymi, które zawarłem w moim modelu. Te pominięte zmienne nie wpływają na współczynniki w moim modelu. Ale w regresji logistycznej właśnie …

3
Jak przedstawić fabułę pudełka z ekstremalną wartością odstającą?
Mógłbym skorzystać z pewnych wskazówek dotyczących prezentacji niektórych danych. Ten pierwszy wykres stanowi porównanie kontroli przypadku dla cytokiny IL-10. Ręcznie ustawiłem oś y, aby zawierała 99% danych. Ustawiłem to ręcznie, ponieważ grupa przypadków ma skrajnie odstające wartości. Moi współpracownicy wahają się przed usunięciem wartości odstających z naszego zestawu danych. Nie …

2
Analiza ważonych głównych składników
Po krótkich poszukiwaniach niewiele znajduję informacji na temat włączania wag obserwacyjnych / błędów pomiarowych do analizy głównych składników. To, co uważam, polega na iteracyjnych podejściach obejmujących wagi (np. Tutaj ). Moje pytanie brzmi: dlaczego to podejście jest konieczne? Dlaczego nie możemy użyć wektorów własnych ważonej macierzy kowariancji?

3
Czy korelacja niezerowa oznacza zależność?
Wiemy, że zerowa korelacja nie oznacza niezależności. Interesuje mnie, czy niezerowa korelacja implikuje zależność - tj. Jeśli Corr(X,Y)≠0Corr(X,Y)≠0\text{Corr}(X,Y)\ne0 dla niektórych zmiennych losowych i , możemy ogólnie powiedzieć, że ?XXXYYYfX,Y(x,y)≠fX(x)fY(y)fX,Y(x,y)≠fX(x)fY(y)f_{X,Y}(x,y) \ne f_X(x) f_Y(y)


3
Dlaczego nie wykorzystać rozkładu T do oszacowania średniej, gdy próbka jest duża?
Podstawowe kursy statystyki często sugerują zastosowanie rozkładu normalnego do oszacowania średniej parametru populacji, gdy wielkość próby n jest duża (zwykle powyżej 30 lub 50). Rozkład T studenta jest stosowany dla mniejszych próbek w celu uwzględnienia niepewności w odchyleniu standardowym próbki. Gdy wielkość próby jest duża, odchylenie standardowe próbki daje dobre …

3
Prawdziwe przykłady korelacji mylone z przyczyną
Szukam konkretnych, rzeczywistych przypadków, w których związek przyczynowy został niewłaściwie wywnioskowany na podstawie dowodów na korelację. W szczególności interesują mnie przykłady, które spełniają następujące kryteria: Istnienie związku przyczynowego zostało zaakceptowane jako fakt wystarczająco szeroki, aby mieć znaczący wpływ (na porządek publiczny, dyskurs, indywidualne decyzje itp.). Związek ten został wywnioskowany wyłącznie …



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.