Próbuję zrozumieć na głębszym poziomie wszechobecność prawdopodobieństwa logarytmicznego (a być może bardziej ogólnie log-prawdopodobieństwo) w statystyce i teorii prawdopodobieństwa. Log-prawdopodobieństwa pojawiają się wszędzie: zwykle pracujemy z prawdopodobieństwem log dla analizy (np. Dla maksymalizacji), informacja Fishera jest definiowana w kategoriach drugiej pochodnej prawdopodobieństwa log, entropia jest oczekiwanym prawdopodobieństwem log , Rozbieżność …
Mam stąd dane o winie , które składają się z 11 liczbowych zmiennych niezależnych z zależną oceną związaną z każdym wpisem o wartościach od 0 do 10. To sprawia, że jest to świetny zestaw danych, aby użyć modelu regresji do zbadania relacji między zmiennymi a powiązanymi ocena. Czy jednak regresja …
W artykule DeepMind na temat Deep Q-Learning dla gier wideo Atari ( tutaj ) używają one chciwości epsilon do eksploracji podczas treningu. Oznacza to, że gdy akcja zostanie wybrana podczas treningu, zostanie wybrana albo jako akcja o najwyższej wartości q, albo akcja losowa. Wybór między tymi dwoma jest losowy i …
Frank Harrell założył blog ( Statistics Thinking) . W swoim pierwszym poście wymienia niektóre kluczowe cechy swojej filozofii statystycznej. Między innymi obejmuje: Jeśli to możliwe, ustaw wielkość próbki jako zmienną losową Co to znaczy „uczynić wielkość próby zmienną losową”? Jakie są zalety tego? Dlaczego może to być lepsze?
Czy istnieje założenie dotyczące zmiennej odpowiedzi regresji logistycznej? Załóżmy na przykład, że mamy punktów danych. Wygląda na to, że odpowiedź pochodzi z dystrybucji Bernoulliego z . Dlatego powinniśmy mieć rozkładów Bernoulliego z innym parametrem .100010001000YiYiY_ipi=logit(β0+β1xi)pi=logit(β0+β1xi)p_i=\text{logit}(\beta_0+\beta_1 x_i)100010001000ppp Są więc „niezależni”, ale nie są „identyczni”. Czy mam rację? PS. Nauczyłem się regresji …
Jak najłatwiej sprawdzić, czy poniższe stwierdzenie jest prawdziwe? Załóżmy że . Pokaż .Y1,…,Yn∼iidExp(1)Y1,…,Yn∼iidExp(1)Y_1, \dots, Y_n \overset{\text{iid}}{\sim} \text{Exp}(1)∑ni=1(Yi−Y(1))∼Gamma(n−1,1)∑i=1n(Yi−Y(1))∼Gamma(n−1,1)\sum_{i=1}^{n}(Y_i - Y_{(1)}) \sim \text{Gamma}(n-1, 1) Zauważ, że .Y(1)=min1≤i≤nYiY(1)=min1≤i≤nYiY_{(1)} = \min\limits_{1 \leq i \leq n}Y_i Przez X∼Exp(β)X∼Exp(β)X \sim \text{Exp}(\beta) oznacza to, że fX(x)=1βe−x/β⋅1{x>0}fX(x)=1βe−x/β⋅1{x>0}f_{X}(x) = \dfrac{1}{\beta}e^{-x/\beta} \cdot \mathbf{1}_{\{x > 0\}} . Łatwo zauważyć, że Y(1)∼Exponential(1/n)Y(1)∼Exponential(1/n)Y_{(1)} …
Dystrybucja beta pojawia się w dwóch parametryzacjach (lub tutaj ) f(x)∝xα(1−x)β(1)(1)f(x)∝xα(1−x)β f(x) \propto x^{\alpha} (1-x)^{\beta} \tag{1} lub ten, który wydaje się być używany częściej f(x)∝xα−1(1−x)β−1(2)(2)f(x)∝xα−1(1−x)β−1 f(x) \propto x^{\alpha-1} (1-x)^{\beta-1} \tag{2} Ale dlaczego dokładnie jest „ ” w drugiej formule?−1−1-1 Pierwsze sformułowanie wydaje się intuicyjnie bardziej bezpośrednio odpowiadać rozkładowi dwumianowemu g(k)∝pk(1−p)n−k(3)(3)g(k)∝pk(1−p)n−k …
Studiowałem matematykę dziesięć lat temu, więc mam doświadczenie matematyczne i statystyczne, ale to pytanie mnie zabija. To pytanie jest dla mnie trochę filozoficzne. Dlaczego statystycy opracowali wszelkiego rodzaju techniki do pracy z przypadkowymi macierzami? To znaczy, czy losowy wektor nie rozwiązał problemu? Jeśli nie, jaka jest średnia z różnych kolumn …
Zastanawiam się tylko, czy statystyki bayesowskie byłyby konsekwentnie stosowane od pierwszego badania do ostatniego, jeśli to sprawia, że metaanaliza staje się przestarzała. Na przykład załóżmy 20 badań, które zostały wykonane w różnych punktach czasowych. Oszacowania lub dystrybucji pierwszego badania dokonano z nieinformacyjnym wyprzedzeniem . Drugie badanie wykorzystuje wcześniejszy rozkład tylny. …
Jeśli ma pełną pozycję, istnieje odwrotność i otrzymujemy oszacowanie najmniejszych kwadratów: iXXXXTXXTXX^TXβ^=(XTX)−1XYβ^=(XTX)−1XY\hat\beta = (X^TX)^{-1}XYVar(β^)=σ2(XTX)−1Var(β^)=σ2(XTX)−1\operatorname{Var}(\hat\beta) = \sigma^2(X^TX)^{-1} Jak intuicyjnie wyjaśnić we wzorze wariancji? Technika wyprowadzania jest dla mnie jasna.(XTX)−1(XTX)−1(X^TX)^{-1}
Zamknięte . To pytanie jest oparte na opiniach . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby można było na nie odpowiedzieć faktami i cytatami, edytując ten post . Zamknięte 2 lata temu . Jakie jest Twoje zdanie na temat nadpróbkowania w klasyfikacji ogólnie, aw szczególności algorytmu …
Spędzam trochę czasu ucząc się uczenia maszynowego (przepraszam za rekurencję :) i nie mogłem zaintrygować się regułą wyboru Gradient Descent zamiast bezpośredniego rozwiązywania równań dla obliczania współczynników regresji, w przypadku wielowymiarowej regresji liniowej. Ogólna zasada: jeśli liczba funkcji (współczynniki odczytu / zmienne niezależne) wynosi od lub powyżej miliona, przejdź do …
Na tej stronie psychometrii przeczytałem to [A] Ta wariancja głębokiego poziomu jest bardziej fundamentalną koncepcją niż odchylenie standardowe. Witryna tak naprawdę nie wyjaśnia dalej, dlaczego wariancja ma być bardziej fundamentalna niż standardowe odchylenie, ale przypomniała mi, że przeczytałem kilka podobnych rzeczy na tej stronie. Na przykład w tym komentarzu @ …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.