Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Suma graniczna iid Gamma jest zmienna
Niech X1,X2,…X1,X2,…X_1,X_2,\ldots będą ciągiem niezależnie i identycznie rozmieszczonych zmiennych losowych z funkcją gęstości prawdopodobieństwa; f(x)={12x2e−x0if x>0;otherwise.f(x)={12x2e−xif x>0;0otherwise. f(x) = \left\{ \begin{array}{ll} \frac{1}{2}x^2 e^{-x} & \mbox{if $x>0$};\\ 0 & \mbox{otherwise}.\end{array} \right. limn→∞P[X1+X2+…+Xn≥3(n−n−−√)]≥12limn→∞P[X1+X2+…+Xn≥3(n−n)]≥12\lim_{n\to \infty} P[X_1+X_2+\ldots+X_n\ge 3(n-\sqrt{n})] \ge \frac{1}{2} Co próbowałem Na pierwszy rzut oka myślałem, że powinien użyć nierówności Czebyszewa, ponieważ pytanie …

2
Czy twierdzenie Mercer'a działa odwrotnie?
Kolega ma funkcję i dla naszych celów jest to czarna skrzynka. Funkcja mierzy podobieństwo dwóch obiektów.s ( a , b )ssss ( a , b )s(a,b)s(a,b) Wiemy na pewno, że ma następujące właściwości:sss Podobieństwa są liczbami rzeczywistymi od 0 do 1 włącznie. Tylko obiekty, które są identyczne, mają wyniki równe …

1
Asymptotyczna normalność formy kwadratowej
Niech być losowy wektor wyciągnąć . Rozważmy próbki . Zdefiniuj i . Niech i .xx\mathbf{x}PPP{xi}ni=1∼i.i.d.P{xi}i=1n∼i.i.d.P\{ \mathbf{x}_i \}_{i=1}^n \stackrel{i.i.d.}{\sim} P C :=1x¯n:=1n∑ni=1xix¯n:=1n∑i=1nxi\bar{\mathbf{x}}_n := \frac{1}{n} \sum_{i=1}^n \mathbf{x}_iC^:=1n∑ni=1(xi−x¯n)(xi−x¯n)⊤C^:=1n∑i=1n(xi−x¯n)(xi−x¯n)⊤\hat{C} := \frac{1}{n} \sum_{i=1}^n (\mathbf{x}_i - \bar{\mathbf{x}}_n) (\mathbf{x}_i - \bar{\mathbf{x}}_n)^\topμ:=Ex∼P[x]μ:=Ex∼P[x]\boldsymbol{\mu} := \mathbb{E}_{\mathbf{x}\sim P}[\mathbf{x}]C:=covx∼P[x,x]C:=covx∼P[x,x]C:=\mathrm{cov}_{\mathbf{x} \sim P}[\mathbf{x}, \mathbf{x}] Przyjmij, że według centralnego twierdzenia granicznego n−−√(x¯n−μ)→dN(0,C),n(x¯n−μ)→dN(0,C), \sqrt{n} \big( \bar{\mathbf{x}}_n …

2
Estymator Bayesa jest odporny na uprzedzenia selekcyjne
Czy estymatory Bayesa są odporne na stronniczość selekcji? Większość artykułów omawiających oszacowanie w dużym wymiarze, np. Dane o sekwencji całego genomu, często porusza kwestię błędu selekcji. Błąd selekcji wynika z faktu, że chociaż mamy tysiące potencjalnych predyktorów, tylko kilka zostanie wybranych, a wnioskowanie zostanie przeprowadzone na wybranych. Proces przebiega zatem …

2
Jeśli
Próbuję udowodnić stwierdzenie: Jeśli i Y ∼ N ( 0 , σ 2 2 ) są niezależnymi zmiennymi losowymi,X∼N(0,σ21)X∼N(0,σ12)X\sim\mathcal{N}(0,\sigma_1^2)Y∼N(0,σ22)Y∼N(0,σ22)Y\sim\mathcal{N}(0,\sigma_2^2) następnie jest również normalną zmienną losową.XYX2+Y2√XYX2+Y2\frac{XY}{\sqrt{X^2+Y^2}} W przypadku specjalnym (powiedzmy) mamy dobrze znany wynik, że X Yσ1=σ2=σσ1=σ2=σ\sigma_1=\sigma_2=\sigmailekroćXiYsą niezależnymizmiennymiN(0,σ2). W rzeczywistości bardziej ogólnie wiadomo, żeXYXYX2+Y2√∼N(0,σ24)XYX2+Y2∼N(0,σ24)\frac{XY}{\sqrt{X^2+Y^2}}\sim\mathcal{N}\left(0,\frac{\sigma^2}{4}\right)XXXYYYN(0,σ2)N(0,σ2)\mathcal{N}(0,\sigma^2) są niezależnymiN(0,σ2XYX2+Y2√,X2−Y22X2+Y2√XYX2+Y2,X2−Y22X2+Y2\frac{XY}{\sqrt{X^2+Y^2}},\frac{X^2-Y^2}{2\sqrt{X^2+Y^2}}zmienne.N(0,σ24)N(0,σ24)\mathcal{N}\left(0,\frac{\sigma^2}{4}\right) Dowód ostatniego wyniku następuje za …

5
Ukrywanie modelu regresji przed profesorem (pancernik regresyjny) [zamknięte]
Zamknięte . To pytanie wymaga szczegółów lub jasności . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Dodaj szczegóły i wyjaśnij problem, edytując ten post . Zamknięte 2 lata temu . Pracuję nad zadaniem domowym, w którym mój profesor chciałby, abyśmy stworzyli prawdziwy model regresji, symulowali próbkę danych, a on …

2
Wzmocnienie modelu regresji logistycznej
Adaboost to kompleksowa metoda, która łączy wielu słabych uczniów, tworząc silną. Wszystkie przykłady adaboost, które przeczytałem, wykorzystują pnie decyzji / drzewa jako słabych uczniów. Czy mogę korzystać z różnych słabych uczniów w Adaboost? Na przykład, jak zaimplementować adaboost (ogólnie wzmocnienie), aby wzmocnić model regresji logistycznej? Jedną z głównych różnic w …


2
Czy wprowadzi to uprzedzenia do liczb losowych?
Załóżmy, że plik danych ma ponad 80 milionów zer i zer, losowo generowanych. Z tego pliku chcemy utworzyć listę losowych liczb całkowitych dziesiętnych. Taki jest plan przeprowadzenia tej konwersji. Podziel 80 milionów cyfr na grupy 4 cyfr binarnych. Konwertuj każdy 4-cyfrowy plik binarny na dziesiętny. Odrzuć wszystkie wartości dziesiętne większe …


3
Czułość skali konwolucyjnej sieci neuronowej
Na przykład załóżmy, że budujemy estymator wieku na podstawie obrazu osoby. Poniżej mamy dwie osoby w garniturach, ale pierwsza jest wyraźnie młodsza niż druga. (źródło: tinytux.com ) Sugeruje to wiele funkcji, na przykład struktura twarzy. Jednak najbardziej wymowną cechą jest stosunek wielkości głowy do wielkości ciała : (źródło: wikimedia.org ) …

1
Czy należy stosować korekcje stopni swobody do wnioskowania na temat parametrów GLM?
To pytanie jest inspirowane odpowiedzią Martijna tutaj . Załóżmy, że dopasowujemy GLM do rodziny jednoparametrowej, takiej jak model dwumianowy lub Poissona, i że jest to procedura pełnego prawdopodobieństwa (w przeciwieństwie do quasipoissonu). Zatem wariancja jest funkcją średniej. Z dwumianowym: oraz z Poisson .var [ X] = E[ X] E[ 1 …


1
Interpretacja pochodnej Radon-Nikodym między miarami prawdopodobieństwa?
W niektórych momentach widziałem zastosowanie pochodnej Radona-Nikodyma jednej miary prawdopodobieństwa w stosunku do drugiej, szczególnie w dywergencji Kullbacka-Leiblera, gdzie jest to pochodna miary prawdopodobieństwa modelu dla jakiegoś dowolnego parametru w odniesieniu do rzeczywistego parametru :θ 0θθ\thetaθ0θ0\theta_0 reP.θreP.θ0dPθdPθ0\frac {dP_\theta}{dP_{\theta_0}} Gdzie są to oba miary prawdopodobieństwa w przestrzeni punktów danych, zależne od …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.