Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Co wyższe, lub
Miałem więc test prawdopodobieństwa i tak naprawdę nie mogłem odpowiedzieć na to pytanie. Poprosił tylko o coś takiego: „Biorąc pod uwagę, że jest zmienną losową, 0 , użyj poprawnej nierówności, aby udowodnić, co jest wyższe lub równe, E (X ^ 2) ^ 3 lub E (X ^ 3) ^ 2 …

2
Oczekiwanie pierwiastka kwadratowego z sumy niezależnych kwadratowych zmiennych losowych
Niech będą niezależnymi i identycznie rozmieszczonymi standardowymi jednolitymi zmiennymi losowymi.X1,…,Xn∼U(0,1)X1,…,Xn∼U(0,1)X_1,\dots,X_n \sim U(0,1) Let Yn=∑inX2iI seek: E[Yn−−√]Let Yn=∑inXi2I seek: E[Yn]\text{Let }\quad Y_n=\sum_i^nX_i^2 \quad \quad \text{I seek: } \quad \mathbb{E}\big[\sqrt{Y_n } \big] Oczekiwanie na jest łatwe:YnYnY_n E[X2]E[Yn]=∫10y2y√=13=E[∑inX2i]=∑inE[X2i]=n3E[X2]=∫01y2y=13E[Yn]=E[∑inXi2]=∑inE[Xi2]=n3\begin{align} \mathbb{E}\left[X^2\right] &=\int_0^1\frac{y}{2\sqrt{y}}=\frac{1}{3}\\ \mathbb{E}\left[Y_n\right] &=\mathbb{E}\left[\sum_i^nX_i^2\right] = \sum_i^n\mathbb{E}\left[X_i^2\right]=\frac{n}{3} \end{align} Teraz część nudna. Aby ubiegać się o LOTUS, …

2
Czy właściwość niezmienniczości estymatora ML jest bezsensowna z perspektywy Bayesa?
Casella i Berger podają właściwość niezmienniczości estymatora ML w następujący sposób: Wydaje mi się jednak, że określają „prawdopodobieństwo” ηη\eta w całkowicie doraźny i bezsensowny sposób: Jeśli zastosuję podstawowe zasady teorii prawdopodobieństwa do prostego przypadku, gdzieś η=τ(θ)=θ2η=τ(θ)=θ2\eta=\tau(\theta)=\theta^2Zamiast tego otrzymuję następujące informacje: L(η|x)=p(x|θ2=η)=p(x|θ=−η–√∨θ=η–√)=:p(x|A∨B)L(η|x)=p(x|θ2=η)=p(x|θ=−η∨θ=η)=:p(x|A∨B)L(\eta|x)=p(x|\theta^2=\eta)=p(x|\theta = -\sqrt \eta \lor \theta = \sqrt \eta)=:p(x|A \lor …

1
Czy implikuje niezależność i ?
Czy implikuje niezależność i ?Cov(f(X),Y)=0∀f(.)Cov(f(X),Y)=0∀f(.)\mathbb{Cov} \left(f(X),Y\right) = 0 \; \forall \; f(.)XXXYYY Znam tylko z następującą definicję niezależności pomiędzy i .XXXYYY fx,y(x,y)=fx(x)fy(y)fx,y(x,y)=fx(x)fy(y) f_{x,y}(x,y) = f_x(x)f_y(y)

1
Termin wariancji w rozkładzie wariancji odchylenia regresji liniowej
W „Elementach uczenia statystycznego” wyrażenie dekompozycji wariancji odchylenia modelu liniowego podano jako gdzie jest rzeczywistą funkcją docelową, to wariancja błędu losowego w modeluErr(x0)=σ2ϵ+E[f(x0)−Ef^(x0)]2+||h(x0)||2σ2ϵ,Err(x0)=σϵ2+E[f(x0)−Ef^(x0)]2+||h(x0)||2σϵ2,Err(x_0)=\sigma_\epsilon^2+E[f(x_0)-E\hat f(x_0)]^2+||h(x_0)||^2\sigma_\epsilon^2,f(x0)f(x0)f(x_0)σ2ϵσϵ2 \sigma_\epsilon^2y=f(x)+ϵy=f(x)+ϵy=f(x)+\epsilon i f^(x)f^(x)\hat f(x) jest estymatorem liniowym f(x)f(x)f(x). Problem wariancji niepokoi mnie tutaj, ponieważ równanie implikuje, że wariancja byłaby zerowa, gdyby cele były bezszumowe, to znaczy …

2
Uczenie się przez wzmocnienie w środowisku niestacjonarnym [zamknięte]
Zamknięte . To pytanie musi być bardziej skoncentrowane . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby skupiało się tylko na jednym problemie, edytując ten post . Zamknięte 22 dni temu . P1: Czy istnieją ogólnie przyjęte lub powszechnie akceptowane metody radzenia sobie ze środowiskiem niestacjonarnym w …


4
Czy po dopasowaniu modelu liniowego możliwe jest rozłożenie dopasowanych reszt na odchylenie i wariancję?
Chciałbym sklasyfikować punkty danych jako wymagające bardziej złożonego modelu lub niepotrzebujące bardziej złożonego modelu. Moje obecne myślenie polega na dopasowaniu wszystkich danych do prostego modelu liniowego i obserwacji wielkości reszt, aby dokonać tej klasyfikacji. Następnie przeczytałem trochę na temat wkładu błędu i wariancji w błąd i zdałem sobie sprawę, że …

1
Wykryto wielowymiarowe, skorelowane dane oraz najważniejsze cechy / zmienne towarzyszące; testowanie wielu hipotez?
Mam zestaw danych z około 5000 często skorelowanych cech / zmiennych towarzyszących i odpowiedzią binarną. Dane zostały mi przekazane, nie zebrałem ich. Używam Lasso i funkcji zwiększania gradientu do budowy modeli. Używam iteracji, zagnieżdżonej weryfikacji krzyżowej. Podaję największe (bezwzględne) 40 współczynników Lasso i 40 najważniejszych cech drzew o podwyższonym gradiencie …

1
Pomóż w interpretacji danych zliczania GLMM za pomocą lme4 glmer and glmer.nb - Dwumian ujemny kontra Poisson
Mam pytania dotyczące specyfikacji i interpretacji GLMM. 3 pytania są zdecydowanie statystyczne, a 2 dotyczą bardziej R. Piszę tutaj, ponieważ ostatecznie myślę, że problemem jest interpretacja wyników GLMM. Obecnie próbuję dopasować GLMM. Korzystam z danych amerykańskiego spisu ludności z bazy danych podłużnych dróg . Moje obserwacje są traktatami spisowymi. Moją …


1
Dlaczego przedział wiarygodności Bayesa w tej regresji wielomianowej jest tendencyjny, a przedział ufności jest prawidłowy?
Rozważ poniższy wykres, w którym symulowałem dane, w następujący sposób. Patrzymy na wynik binarny dla którego prawdziwe prawdopodobieństwo bycia 1 wskazuje czarna linia. Zależność funkcjonalna między współzmienną i jest wielomianem trzeciego rzędu z łączem logistycznym (więc jest nieliniowa w podwójnym kierunku).yobsyobsy_{obs}xxxp(yobs=1|x)p(yobs=1|x)p(y_{obs}=1 | x) Zielona linia to dopasowanie regresji logistycznej GLM, …

2
GAMM z zerowymi danymi
Czy można dopasować GAMM (uogólniony model mieszany dodatków) dla danych z zerowym napełnieniem w R? Jeśli nie, to czy można dopasować GAM (uogólniony model addytywny) dla danych z zerowym napełnieniem z ujemnym dwumianowym lub quasi-rozkładem Poissona w R? (Znalazłem funkcje COZIGAM :: zigam i mgcv: ziP dla rozkładu Poissona)

1
Adaptacyjny GAM wygładza w mgcv
Książka Simona Wooda na temat GAM i związany z nią pakiet R mgcv są zarówno bardzo szczegółowe, jak i pouczające, jeśli chodzi o teorię GAM i dopasowanie modelu do rzeczywistych i symulowanych danych. W przypadku wygładzania 1D naprawdę nie ma się czym martwić, z wyjątkiem decyzji o wdrożeniu cyklicznych vs. …
9 r  mgcv 

1
Czy z możemy stwierdzić, że są niezależne?
Cóż, nie możemy zobaczyć, na przykład https://en.wikipedia.org/wiki/Subindependence dla interesującego kontrprzykładu. Ale prawdziwe pytanie brzmi: czy jest jakiś sposób na wzmocnienie tej kondycji, aby nastąpiła niezależność? Na przykład, czy istnieje jakiś zestaw funkcji więc jeśli dla wszystkich to nastąpi niezależność? A jak duży musi być taki zestaw funkcji, nieskończony?sol1, ... ,solng1,…,gng_1, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.