Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Czy ktoś może zilustrować, w jaki sposób może istnieć zależność i zerowa kowariancja?
Czy ktoś może zilustrować, tak jak Greg, ale bardziej szczegółowo, w jaki sposób zmienne losowe mogą być zależne, ale mają zerową kowariancję? Greg, plakat tutaj, podaje przykład używając koła tutaj . Czy ktoś może wyjaśnić ten proces bardziej szczegółowo, stosując sekwencję kroków ilustrujących ten proces na kilku etapach? Ponadto, jeśli …

6
Interpretacja wyników ur.df R (test na pierwiastek Dickeya-Fullera)
Korzystam z następującego testu root root (Dickey-Fuller) na szeregu czasowym, używając ur.df()funkcji w urcapakiecie. Polecenie to: summary(ur.df(d.Aus, type = "drift", 6)) Dane wyjściowe to: ############################################### # Augmented Dickey-Fuller Test Unit Root Test # ############################################### Test regression drift Call: lm(formula = z.diff ~ z.lag.1 + 1 + z.diff.lag) Residuals: Min 1Q …

1
Obliczanie kanonicznej funkcji łącza w GLM
Myślałem, że kanoniczna funkcja połączenia pochodzi z naturalnego parametru rodziny wykładniczej. Powiedzmy, rozważ rodzinę f ( y , θ , ψ ) = exp { y θ - b ( θ )g(⋅)g(⋅)g(\cdot) a następnieθ=θ(μ)jest kanoniczną funkcją łącza. Weźmyjako przykładrozkład Bernoulliego, mamy P(Y=y)=μy(1-μ)1-y=exp{ylogμf(y,θ,ψ)=exp{yθ−b(θ)a(ψ)−c(y,ψ)}f(y,θ,ψ)=exp⁡{yθ−b(θ)a(ψ)−c(y,ψ)} f(y,\theta,\psi)=\exp\left\{\frac{y\theta-b(\theta)}{a(\psi)}-c(y,\psi)\right\} θ=θ(μ)θ=θ(μ)\theta=\theta(\mu) Tak więc kanoniczna funkcja łączag(μ)=logμP(Y=y)=μy(1−μ)1−y=exp{ylogμ1−μ+log(1−μ)}P(Y=y)=μy(1−μ)1−y=exp⁡{ylog⁡μ1−μ+log⁡(1−μ)} P(Y=y)=\mu^{y}(1-\mu)^{1-y}=\exp\left\{y\log\frac{\mu}{1-\mu}+\log{(1-\mu)}\right\} …

1
Alternatywa dla blokowania bootstrap dla wielowymiarowych szeregów czasowych
Obecnie używam następującego procesu do ładowania wielowymiarowego szeregu czasowego w R: Określ rozmiary bloków - uruchom funkcję b.starw nppakiecie, która tworzy rozmiar bloku dla każdej serii Wybierz maksymalny rozmiar bloku Uruchom tsbootw dowolnej serii, używając wybranego rozmiaru bloku Użyj indeksu z danych wyjściowych bootstrap, aby zrekonstruować wielowymiarowe szeregi czasowe Ktoś …


5
Jak zmierzyć „dobrze zaokrąglone” podmioty uczestniczące w SE?
Stack Exchange, jak wszyscy wiemy, to zbiór stron z pytaniami i odpowiedziami na różne tematy. Zakładając, że każda strona jest od siebie niezależna, biorąc pod uwagę statystyki użytkownika, jak obliczyć jego „zaokrąglenie” w porównaniu do następnego faceta? Jakie narzędzie statystyczne powinienem zastosować? Szczerze mówiąc, nie do końca wiem, jak matematycznie …





1
Różnica między regresją PLS a modelowaniem ścieżki PLS. Krytyka PLS
Pytanie zostało zadane tutaj, ale nikt nie udzielił dobrej odpowiedzi. Myślę więc, że dobrym pomysłem jest powtórzenie tego, a także chciałbym dodać więcej komentarzy / pytań. Pierwsze pytanie brzmi: jaka jest różnica między „modelowaniem ścieżki PLS” a „regresją PLS”? Mówiąc bardziej ogólnie, czym jest modelowanie równań strukturalnych (SEM), modelowanie ścieżek …


1
Dlaczego LKJcorr jest dobrym rozwiązaniem dla macierzy korelacji?
Czytam rozdział 13 „Przygody w kowariancji” w ( znakomitej ) książce „ Rethinking statystyczny” Richarda McElreath, w której przedstawia on następujący model hierarchiczny: ( Rjest macierzą korelacji) Autor wyjaśnia, że LKJcorrjest to słabo pouczający uprzedni, który działa jako uprzedni regularyzujący dla matrycy korelacji. Ale dlaczego tak jest? Jakie cechy LKJcorrrozkładu …

2
Test Kołmogorowa – Smirnowa: wartość p i statystyki testu ks zmniejszają się wraz ze wzrostem wielkości próby
Dlaczego wartości p i statystyki testu ks zmniejszają się wraz ze wzrostem wielkości próby? Weź ten kod Python jako przykład: import numpy as np from scipy.stats import norm, ks_2samp np.random.seed(0) for n in [10, 100, 1000, 10000, 100000, 1000000]: x = norm(0, 4).rvs(n) y = norm(0, 4.1).rvs(n) print ks_2samp(x, y) …

1
Związek między macierzą Hesji a macierzą kowariancji
Podczas gdy ja studiuję oszacowanie maksymalnego prawdopodobieństwa, aby wnioskować w oszacowaniu maksymalnego prawdopodobieństwa, musimy znać wariancję. Aby dowiedzieć się o wariancji, muszę poznać Dolną Granicę Kramera, która wygląda jak matryca Hesji z Drugim Pochyleniem krzywizny. Jestem trochę pomieszany, aby zdefiniować związek między macierzą kowariancji a macierzą hessian. Mam nadzieję usłyszeć …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.