Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Teoretyczna motywacja do wykorzystania prawdopodobieństwa logarytmu vs prawdopodobieństwa
Próbuję zrozumieć na głębszym poziomie wszechobecność prawdopodobieństwa logarytmicznego (a być może bardziej ogólnie log-prawdopodobieństwo) w statystyce i teorii prawdopodobieństwa. Log-prawdopodobieństwa pojawiają się wszędzie: zwykle pracujemy z prawdopodobieństwem log dla analizy (np. Dla maksymalizacji), informacja Fishera jest definiowana w kategoriach drugiej pochodnej prawdopodobieństwa log, entropia jest oczekiwanym prawdopodobieństwem log , Rozbieżność …




2
Czy istnieje założenie regresji logistycznej?
Czy istnieje założenie dotyczące zmiennej odpowiedzi regresji logistycznej? Załóżmy na przykład, że mamy punktów danych. Wygląda na to, że odpowiedź pochodzi z dystrybucji Bernoulliego z . Dlatego powinniśmy mieć rozkładów Bernoulliego z innym parametrem .100010001000YiYiY_ipi=logit(β0+β1xi)pi=logit(β0+β1xi)p_i=\text{logit}(\beta_0+\beta_1 x_i)100010001000ppp Są więc „niezależni”, ale nie są „identyczni”. Czy mam rację? PS. Nauczyłem się regresji …

2
Załóżmy że . Pokaż
Jak najłatwiej sprawdzić, czy poniższe stwierdzenie jest prawdziwe? Załóżmy że . Pokaż .Y1,…,Yn∼iidExp(1)Y1,…,Yn∼iidExp(1)Y_1, \dots, Y_n \overset{\text{iid}}{\sim} \text{Exp}(1)∑ni=1(Yi−Y(1))∼Gamma(n−1,1)∑i=1n(Yi−Y(1))∼Gamma(n−1,1)\sum_{i=1}^{n}(Y_i - Y_{(1)}) \sim \text{Gamma}(n-1, 1) Zauważ, że .Y(1)=min1≤i≤nYiY(1)=min1≤i≤nYiY_{(1)} = \min\limits_{1 \leq i \leq n}Y_i Przez X∼Exp(β)X∼Exp(β)X \sim \text{Exp}(\beta) oznacza to, że fX(x)=1βe−x/β⋅1{x>0}fX(x)=1βe−x/β⋅1{x>0}f_{X}(x) = \dfrac{1}{\beta}e^{-x/\beta} \cdot \mathbf{1}_{\{x > 0\}} . Łatwo zauważyć, że Y(1)∼Exponential(1/n)Y(1)∼Exponential(1/n)Y_{(1)} …

3
Dlaczego w funkcji gęstości rozkładu beta występuje -1?
Dystrybucja beta pojawia się w dwóch parametryzacjach (lub tutaj ) f(x)∝xα(1−x)β(1)(1)f(x)∝xα(1−x)β f(x) \propto x^{\alpha} (1-x)^{\beta} \tag{1} lub ten, który wydaje się być używany częściej f(x)∝xα−1(1−x)β−1(2)(2)f(x)∝xα−1(1−x)β−1 f(x) \propto x^{\alpha-1} (1-x)^{\beta-1} \tag{2} Ale dlaczego dokładnie jest „ ” w drugiej formule?−1−1-1 Pierwsze sformułowanie wydaje się intuicyjnie bardziej bezpośrednio odpowiadać rozkładowi dwumianowemu g(k)∝pk(1−p)n−k(3)(3)g(k)∝pk(1−p)n−k …

5
Dlaczego statystycy zdefiniowali macierze losowe?
Studiowałem matematykę dziesięć lat temu, więc mam doświadczenie matematyczne i statystyczne, ale to pytanie mnie zabija. To pytanie jest dla mnie trochę filozoficzne. Dlaczego statystycy opracowali wszelkiego rodzaju techniki do pracy z przypadkowymi macierzami? To znaczy, czy losowy wektor nie rozwiązał problemu? Jeśli nie, jaka jest średnia z różnych kolumn …

5
Czy statystyki bayesowskie powodują, że metaanaliza staje się przestarzała?
Zastanawiam się tylko, czy statystyki bayesowskie byłyby konsekwentnie stosowane od pierwszego badania do ostatniego, jeśli to sprawia, że ​​metaanaliza staje się przestarzała. Na przykład załóżmy 20 badań, które zostały wykonane w różnych punktach czasowych. Oszacowania lub dystrybucji pierwszego badania dokonano z nieinformacyjnym wyprzedzeniem . Drugie badanie wykorzystuje wcześniejszy rozkład tylny. …

6
Intuicyjne wyjaśnienie terminu w wariancie estymatora najmniejszych kwadratów
Jeśli ma pełną pozycję, istnieje odwrotność i otrzymujemy oszacowanie najmniejszych kwadratów: iXXXXTXXTXX^TXβ^=(XTX)−1XYβ^=(XTX)−1XY\hat\beta = (X^TX)^{-1}XYVar(β^)=σ2(XTX)−1Var⁡(β^)=σ2(XTX)−1\operatorname{Var}(\hat\beta) = \sigma^2(X^TX)^{-1} Jak intuicyjnie wyjaśnić we wzorze wariancji? Technika wyprowadzania jest dla mnie jasna.(XTX)−1(XTX)−1(X^TX)^{-1}



3
co sprawia, że ​​sieci neuronowe są nieliniowym modelem klasyfikacji?
Próbuję zrozumieć matematyczne znaczenie nieliniowych modeli klasyfikacji: Właśnie przeczytałem artykuł mówiący o sieciach neuronowych będących nieliniowym modelem klasyfikacji. Ale zdaję sobie sprawę, że: Pierwsza warstwa: h1=x1∗wx1h1+x2∗wx1h2h1=x1∗wx1h1+x2∗wx1h2h_1=x_1∗w_{x1h1}+x_2∗w_{x1h2} h2=x1∗wx2h1+x2∗wx2h2h2=x1∗wx2h1+x2∗wx2h2h_2=x_1∗w_{x2h1}+x_2∗w_{x2h2} Kolejna warstwa y=b∗wby+h1∗wh1y+h2∗wh2yy=b∗wby+h1∗wh1y+h2∗wh2yy=b∗w_{by}+h_1∗w_{h1y}+h_2∗w_{h2y} Można to uprościć =b'+(x1∗wx1h1+x2∗wx1h2)∗wh1y+(x1∗wx2h1+x2∗wx2h2)∗wh2y=b′+(x1∗wx1h1+x2∗wx1h2)∗wh1y+(x1∗wx2h1+x2∗wx2h2)∗wh2y=b′+(x_1∗w_{x1h1}+x_2∗w_{x1h2})∗w_{h1y}+(x_1∗w_{x2h1}+x_2∗w_{x2h2})∗w_{h2y} = b ' + x1( wh 1 rok∗ wx 1 godz. 1+ wx 2 godz. 1∗ …

1
Czy naprawdę przeprowadzamy analizę regresji wielowymiarowej z * milionami * współczynników / zmiennych niezależnych?
Spędzam trochę czasu ucząc się uczenia maszynowego (przepraszam za rekurencję :) i nie mogłem zaintrygować się regułą wyboru Gradient Descent zamiast bezpośredniego rozwiązywania równań dla obliczania współczynników regresji, w przypadku wielowymiarowej regresji liniowej. Ogólna zasada: jeśli liczba funkcji (współczynniki odczytu / zmienne niezależne) wynosi od lub powyżej miliona, przejdź do …

4
Czy wariancja jest bardziej fundamentalną koncepcją niż odchylenie standardowe?
Na tej stronie psychometrii przeczytałem to [A] Ta wariancja głębokiego poziomu jest bardziej fundamentalną koncepcją niż odchylenie standardowe. Witryna tak naprawdę nie wyjaśnia dalej, dlaczego wariancja ma być bardziej fundamentalna niż standardowe odchylenie, ale przypomniała mi, że przeczytałem kilka podobnych rzeczy na tej stronie. Na przykład w tym komentarzu @ …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.