Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Oczekiwana liczba rzutów kostkami wymaga, aby suma była większa lub równa K?
6-stronna kostka jest rzutowana iteracyjnie. Jaka jest oczekiwana liczba rzutów wymagana do uzyskania sumy większej lub równej K? Przed edycją P(Sum>=1 in exactly 1 roll)=1 P(Sum>=2 in exactly 1 roll)=5/6 P(Sum>=2 in exactly 2 rolls)=1/6 P(Sum>=3 in exactly 1 roll)=5/6 P(Sum>=3 in exactly 2 rolls)=2/6 P(Sum>=3 in exactly 3 rolls)=1/36 …


5
Testowanie hipotezy Poissona dla dwóch parametrów
Tak więc, dla zabawy, pobieram niektóre dane połączeń z call center, w którym pracuję, i próbuję przetestować na nich kilka hipotez, a konkretnie liczbę połączeń odebranych w ciągu tygodnia, i dopasowuję je rozkładem Poissona. Ze względu na przedmiot mojej pracy istnieją dwa rodzaje tygodni, nazwijmy jeden z nich w tygodniach, …

1
Jaka jest różnica między uwarunkowaniem regresorów a traktowaniem ich jako ustalonych?
Czasami zakładamy, że regresory są stałe, tzn. Nie są stochastyczne. Myślę , że to oznacza, że ​​wszystkie nasze predyktory, oszacowania parametrów itp. Są zatem bezwarunkowe, prawda? Czy mogę nawet posunąć się tak daleko, że nie są już zmiennymi losowymi? Jeśli z drugiej strony przyjmiemy, że większość regresorów w ekonomii twierdzi, …

2
Wnioski z wyników analizy głównego składnika
Usiłuję zrozumieć wyniki analizy głównych składników wykonanych w następujący sposób: > head(iris) Sepal.Length Sepal.Width Petal.Length Petal.Width Species 1 5.1 3.5 1.4 0.2 setosa 2 4.9 3.0 1.4 0.2 setosa 3 4.7 3.2 1.3 0.2 setosa 4 4.6 3.1 1.5 0.2 setosa 5 5.0 3.6 1.4 0.2 setosa 6 5.4 3.9 …
9 r  pca  interpretation 

2
Jest asymptotycznie skuteczny w warunkach heteroscedastyczności
Wiem, że OLS jest bezstronny, ale nieskuteczny przy heteroscedastyczności w ustawieniu regresji liniowej. W Wikipedii http://en.wikipedia.org/wiki/Minimum_mean_square_error Estymator MMSE jest asymptotycznie obiektywny i zbiega się w rozkładzie do rozkładu normalnego: , gdzie I (x) to informacja Fishera dla x. Zatem estymator MMSE jest asymptotycznie wydajny.n−−√(x^−x)→dN(0,I−1(x))n(x^−x)→dN(0,I−1(x))\sqrt{n}(\hat{x} - x) \xrightarrow{d} \mathcal{N}\left(0 , I^{-1}(x)\right) …

1
LASSO dla modeli objaśniających: zmniejszone parametry czy nie?
Przeprowadzam analizę, w której głównym celem jest zrozumienie danych. Zestaw danych jest wystarczająco duży do weryfikacji krzyżowej (10k), a predyktory obejmują zarówno zmienne ciągłe, jak i zmienne, a wynik jest ciągły. Głównym celem było sprawdzenie, czy sensowne jest wyrzucenie niektórych predyktorów, aby ułatwić interpretację modelu. Pytania: Moje pytanie brzmi: „które …

1
Jak wygenerować równomiernie losowe ortogonalne macierze determinanty dodatniej?
Mam chyba głupie pytanie, które muszę przyznać, że jestem zdezorientowany. Wyobraź sobie powtarzające się generowanie równomiernie rozmieszczonej losowej macierzy ortogonalnej (ortonormalnej) o pewnym rozmiarze . Czasami wygenerowana macierz ma wyznacznik a czasem ma wyznacznik . (Istnieją tylko dwie możliwe wartości. Z punktu widzenia rotacji ortogonalnej oznacza, że ​​oprócz rotacji istnieje …

1
Ograniczenia MCMC / EM? MCMC zamiast EM?
Obecnie uczę się hierarchicznych modeli bayesowskich przy użyciu JAGS z R, a także pymc przy użyciu Pythona ( „Bayesian Methods for Hackers” ). Mogę uzyskać intuicję z tego postu : „skończysz ze stosem liczb, które wyglądają” tak, jakby „udało ci się w jakiś sposób pobrać niezależne próbki ze skomplikowanej dystrybucji, …



6
Jakie są dobre przykłady do pokazania studentom studiów licencjackich?
Będę uczyć statystyki jako asystent nauczyciela w drugiej połowie tego semestru dla studentów studiów licencjackich zorientowanych na CS. Większość uczniów, którzy wzięli udział w zajęciach, nie ma motywacji, aby uczyć się tego przedmiotu i wzięła go tylko z powodu głównych wymagań. Chcę, aby przedmiot był interesujący i użyteczny, a nie …

2
Wyniki regresji mają nieoczekiwany górny limit
Próbuję przewidzieć wynik równowagi i wypróbowałem kilka różnych metod regresji. Zauważyłem jedną rzecz, że przewidywane wartości wydają się mieć pewien górny limit. To znaczy, faktyczny bilans wynosi , ale moje przewidywania sięgają około . Poniższy wykres pokazuje rzeczywistą vs przewidywaną równowagę (przewidywaną za pomocą regresji liniowej):[ 0,0 , 1,0 )[0,0,1.0)[0.0, …

1
Jeśli są niezależną wersją beta, pokaż to również wersja beta
Oto problem, który pojawił się podczas egzaminu semestralnego na naszej uczelni kilka lat temu, z którym staram się rozwiązać. Jeśli są niezależnymi zmiennymi losowymi o gęstości odpowiednio gęstości i to pokaż, że następuje po .X1,X2X1,X2X_1,X_2ββ\betaβ(n1,n2)β(n1,n2)\beta(n_1,n_2)β(n1+12,n2)β(n1+12,n2)\beta(n_1+\dfrac{1}{2},n_2)X1X2−−−−−√X1X2\sqrt{X_1X_2}β(2n1,2n2)β(2n1,2n2)\beta(2n_1,2n_2) Użyłem metody jakobianu, aby uzyskać, że gęstość jest następująca: Y=X1X2−−−−−√Y=X1X2Y=\sqrt{X_1X_2}fY(y)=4y2n1B(n1,n2)B(n1+12,n2)∫1y1x2(1−x2)n2−1(1−y2x2)n2−1dxfY(y)=4y2n1B(n1,n2)B(n1+12,n2)∫y11x2(1−x2)n2−1(1−y2x2)n2−1dxf_Y(y)=\dfrac{4y^{2n_1}}{B(n_1,n_2)B(n_1+\dfrac{1}{2},n_2)}\int_y^1\dfrac{1}{x^2}(1-x^2)^{n_2-1}(1-\dfrac{y^2}{x^2})^{n_2-1}dx Właściwie w tym momencie jestem …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.