Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Niezbędny i wystarczający warunek wspólnego MGF dla niezależności
Załóżmy, że mam funkcję generującą moment połączony dla wspólnego rozkładu z CDF . Czy jest koniecznym i wystarczającym warunkiem niezależności i ? Sprawdziłem kilka podręczników, w których wspomniałem tylko o konieczności:MX,Y(s,t)MX,Y(s,t)M_{X,Y}(s,t)FX,Y(x,y)FX,Y(x,y)F_{X,Y}(x,y)MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)M_{X,Y}(s,t)=M_{X,Y}(s,0)⋅M_{X,Y}(0,t)XXXYYY FX,Y(x,y)=FX(x)⋅FY(y)⟹MX,Y(s,t)=MX(s)⋅MY(t)FX,Y(x,y)=FX(x)⋅FY(y)⟹MX,Y(s,t)=MX(s)⋅MY(t)F_{X,Y}(x,y)=F_X(x)\cdot F_Y(y) \implies M_{X,Y}(s,t)=M_X(s) \cdot M_Y(t) Ten wynik jest oczywisty, ponieważ niezależność implikuje . Ponieważ MGF marginesów są określone …


2
Jak dopasować krzywą, jak obliczyć 95% przedział ufności dla moich dopasowanych parametrów?
Dopasowuję krzywe do moich danych, aby wyodrębnić jeden parametr. Nie jestem jednak pewien, jaka jest pewność tego parametru i jak obliczyć / wyrazić jego % przedział ufności.959595 Powiedzmy, że dla zestawu danych zawierającego dane, które wykładniczo zanika, dopasowuję krzywą do każdego zestawu danych. Informacje, które chcę wyodrębnić, to wykładnik . …

4
Porównywanie oszacowania maksymalnego prawdopodobieństwa (MLE) i twierdzenia Bayesa
W twierdzeniu bayesowskim , a z książki, którą czytam, nazywa się prawdopodobieństwo , ale zakładam, że to tylko prawdopodobieństwo warunkowe od podane , prawda? p(x|y)xyp(y|x)=p(x|y)p(y)p(x)p(y|x)=p(x|y)p(y)p(x)p(y|x) = \frac{p(x|y)p(y)}{p(x)}p(x|y)p(x|y)p(x|y)xxxyyy Do największej wiarygodności stara się maksymalizować , prawda? Jeśli tak, to jestem bardzo zdezorientowany, ponieważ są zmiennymi losowymi, prawda? Aby zmaksymalizować jest po …


4
Testowanie hipotez za pomocą Big Data
Jak przeprowadzasz testy hipotez z użyciem dużych zbiorów danych? Napisałem następujący skrypt MATLAB, aby podkreślić moje zamieszanie. Wystarczy wygenerować dwie losowe serie i przeprowadzić prostą regresję liniową jednej zmiennej na drugiej. Wykonuje tę regresję kilka razy, używając różnych wartości losowych i zgłasza średnie. Co się dzieje, gdy zwiększam rozmiar próbki, …



3
Co to jest stacjonarny proces drugiego rzędu?
Zastanawiałem się, jak zdefiniowano jego „stacjonarny proces drugiego rzędu” we Wstępie do szeregów czasowych i prognoz Brockwella i Davisa : Klasa modeli liniowych szeregów czasowych, która obejmuje klasę modeli autoregresyjnej średniej ruchomej (ARMA), stanowi ogólne ramy do badania procesów stacjonarnych. W rzeczywistości każdy stacjonarny proces drugiego rzędu jest albo procesem …

1
Osiągalne korelacje dla wykładniczych zmiennych losowych
Jaki jest zakres możliwych do uzyskania korelacji dla pary wykładniczo rozkładanych zmiennych losowych i , gdzie to parametry stawki?X 2 ∼ E x p ( λ 2 ) λ 1 , λ 2 > 0X1∼Exp(λ1)X1∼Exp(λ1)X_1 \sim {\rm Exp}(\lambda_1)X2∼Exp(λ2)X2∼Exp(λ2)X_2 \sim {\rm Exp}(\lambda_2)λ1,λ2>0λ1,λ2>0\lambda_1, \lambda_2 > 0

2
Prognozowanie godzinowych szeregów czasowych z częstotliwością dzienną, tygodniową i roczną
Ważna edycja: Chciałbym jak dotąd podziękować Dave'owi i Nickowi za ich odpowiedzi. Dobrą wiadomością jest to, że dostałem pętlę do pracy (zasada zapożyczona z postu prof. Hydnmana na temat prognozowania partii). Aby skonsolidować zaległe zapytania: a) Jak zwiększyć maksymalną liczbę iteracji dla auto.arima - wydaje się, że przy dużej liczbie …

2
Heteroskedastyczność i normalność reszt
Mam regresję liniową, która, jak sądzę, jest całkiem dobra (dotyczy projektu uniwersyteckiego, więc tak naprawdę nie muszę być bardzo dokładna). Chodzi o to, że jeśli wykreślę wartości rezydualne w stosunku do wartości przewidywanych, to (według mojego nauczyciela) jest wskazówka heteroskedastyczności. Ale jeśli wykreślę wykres QQ reszt, jasne jest, że są …


1
testy vs testy?
Próbuję dowiedzieć się dokładnie, jaka jest różnica między -tests i -tests.ztttzzz O ile wiem, do obu klas testów używa się tej samej statystyki testu, coś w rodzaju b^- Cseˆ( b^)b^−Cse^(b^)\frac{\hat{b} - C}{\widehat{\operatorname{se}}(\hat{b})} gdzie to przykładowa statystyka, C to jakaś stała odniesienia (lokalizacji) (która zależy od szczegółowych danych testu), a \ …

1
Manipulacja modelem regresji logistycznej
Chciałbym zrozumieć, co robi następujący kod. Osoba, która napisała kod, już tu nie pracuje i jest prawie całkowicie nieudokumentowana. Zostałem poproszony o zbadanie go przez kogoś, kto myśli „ to bayesowski model regresji logistycznej ” bglm <- function(Y,X) { # Y is a vector of binary responses # X is …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.