Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Oblicz kwantyl sumy rozkładów z poszczególnych kwantyli
Załóżmy NNN niezależne zmienne losowe X1,...,XNX1,...,XNX_1, ..., X_N dla których kwantyle na pewnym określonym poziomie αα\alpha są znane na podstawie danych szacunkowych: α=P(X1&lt;q1)α=P(X1&lt;q1)\alpha = P(X_1 < q_1), ..., α=P(XN&lt;qN)α=P(XN&lt;qN)\alpha = P(X_N < q_N). Teraz zdefiniujmy zmienną losowąZZZ jako suma Z=∑Ni=1XiZ=∑i=1NXiZ = \sum_{i=1}^N X_i. Czy istnieje sposób na obliczenie wartości kwantylu …
9 quantiles 

1
Jak sprawiedliwe jest używanie słowa „przewidywanie” dla regresji (logistycznej)?
Rozumiem, że nawet regresja nie powoduje przyczynowości. Może jedynie dawać powiązanie między zmienną y i zmiennymi x i ewentualnie kierunkiem. Mam rację? Często znajduję frazy podobne do „x przewiduje y” nawet w większości podręczników kursów i na różnych stronach kursów online. I często nazywacie regresory jako predyktory, a y jako …



3
Jak zmienić kolejność danych 2D, aby uzyskać korelację?
Mam następujący prosty zestaw danych z dwiema zmiennymi ciągłymi; to znaczy: d = data.frame(x=runif(100,0,100),y = runif(100,0,100)) plot(d$x,d$y) abline(lm(y~x,d), col="red") cor(d$x,d$y) # = 0.2135273 Muszę zmienić dane tak, aby korelacja między zmiennymi wynosiła ~ 0,6. Muszę utrzymać średnie i inne statystyki opisowe (sd, min, max itp.) Obu zmiennych na stałym poziomie. …
9 r  correlation 

1
Szacunek ML rozkładu wykładniczego (z cenzurowanymi danymi)
W analizie przeżycia zakładasz, że czas przeżycia rv jest rozkładany wykładniczo. Biorąc pod uwagę teraz, że mam „wyniki” iid rv . Tylko część tych wyników jest w rzeczywistości „w pełni zrealizowana”, tzn. Pozostałe obserwacje są nadal „żywe”.XiXiX_ix1,…,xnx1,…,xnx_1,\dots,x_nXiXiX_i Jeśli chciałbym przeprowadzić oszacowanie ML dla parametru częstości rozkładu, jak mogę wykorzystać niezrealizowane …


1
Jak obliczyć funkcję prawdopodobieństwa
Żywotność 3 elementów elektronicznych wynosi a . Zmienne losowe modelowano jako losową próbkę wielkości 3 z rozkładu wykładniczego z parametrem . Funkcja prawdopodobieństwa wynosi dlaX1= 3 ,X2)= 1,5 ,X1=3),X2)=1.5,X_{1} = 3, X_{2} = 1.5,X3)= 2,1X3)=2.1X_{3} = 2.1θθ\thetaθ &gt; 0θ&gt;0\theta > 0 fa3)( x | θ ) =θ3)e x p ( …

1
Dopasowanie heteroscedastycznego uogólnionego modelu liniowego do odpowiedzi dwumianowych
Mam dane z następującego schematu eksperymentalnego: moje obserwacje są liczbami sukcesów ( K) z odpowiedniej liczby prób ( N), zmierzonymi dla dwóch grup, z których każda składa się z Iosobników, z Tzabiegów, w których w każdej takiej kombinacji czynników występują Rpowtórzenia . Stąd też zupełnie mam 2 * I * …

1
Oczekiwanie na produkty wyższego rzędu o normalnych rozkładach
Mam dwie normalnie rozmieszczone zmienne i ze średnią zerową i macierzą kowariancji . Jestem zainteresowany próbą obliczenia wartości w kategoriach wpisów .X1X1X_1X2X2X_2ΣΣ\SigmaE[X21X22]E[X12X22]E[X_1^2 X_2^2]ΣΣ\Sigma Użyłem prawa całkowitego prawdopodobieństwa, aby uzyskać ale nie jestem pewien, do czego sprowadza się wewnętrzne oczekiwanie. Czy jest tu inna metoda?E[X21X22]=E[X21E[X22|X1]]E[X12X22]=E[X12E[X22|X1]]E[X_1^2 X_2^2] = E[X_1^2 E[X_2^2 | X_1]] …


1
Rozwiązanie do ćwiczenia 2.2a.16 „Solidnych statystyk: podejście oparte na funkcjach wpływu”
Na stronie 180 szczegółowych statystyk: Podejście oparte na funkcjach wpływu można znaleźć następujące pytanie: 16: Pokaż, że zawsze dla estymatorów niezmienniczych dla lokalizacji ε∗≤12ε∗≤12\varepsilon^*\leq\frac{1}{2}. Znajdź odpowiednią górną granicę w punkcie podziału próby skończonejε∗nεn∗\varepsilon^*_n, zarówno w przypadku, gdy nnn jest nieparzysty lub nnn jest parzysty. Druga część (po kropce) jest właściwie …

1
Przedział ufności dla średniego efektu leczenia z ważenia oceny skłonności?
Staram się oszacować średni efekt leczenia na podstawie danych obserwacyjnych, stosując ważenie wyniku skłonności (szczególnie IPTW). Myślę, że obliczam ATE poprawnie, ale nie wiem, jak obliczyć przedział ufności ATE, biorąc pod uwagę wagi wyniku odwrotnej skłonności. Oto równanie, którego używam do obliczenia średniego efektu leczenia (odniesienie Stat Med. 10 września …

3
Oszacować masę owoców w torbie na podstawie tylko powiązanych danych?
Instruktor na moim uniwersytecie zadał takie pytanie (nie na zadanie domowe, ponieważ lekcja się skończyła, a mnie nie było). Nie mogę wymyślić, jak do tego podejść. Pytanie dotyczy 2 torebek, z których każda zawiera asortyment różnych rodzajów owoców: Pierwsza torba zawiera następujące losowo wybrane owoce: + ------------- + -------- + …

1
Jak sprawdzić medianę populacji?
Mam próbkę 250 jednostek. Rozkład jest asymetryczny. Chcę przetestować hipotezę, że mediana populacji różni się od 3,5, więc myślę, że odpowiedni byłby test z jedną próbą. Wiem, że test rang Wilcoxona nie jest odpowiedni, ponieważ rozkład nie jest symetryczny. Czy można użyć testu znakowego? Jeśli tak nie jest, czy ktoś …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.