Oszacowanie parametrów rozkładu t-Studenta


23

Jakie są estymatory największego prawdopodobieństwa dla parametrów rozkładu t Studenta? Czy istnieją w formie zamkniętej? Szybkie wyszukiwanie w Google nie dało mi żadnych wyników.

Dzisiaj interesuje mnie przypadek jednowymiarowy, ale prawdopodobnie będę musiał rozszerzyć model na wiele wymiarów.

EDYCJA: Właściwie najbardziej interesuje mnie lokalizacja i parametry skali. Na razie mogę założyć, że parametr stopni swobody jest stały, i ewentualnie użyć jakiegoś schematu numerycznego, aby później znaleźć optymalną wartość.


Według mojej wiedzy nie istnieją one w formie zamkniętej. Może być wymagane podejście z podejściem gradientowym.
— Pat

Chociaż rozkład t Studenta ma jeden parametr, w liczbie mnogiej odnosi się do „parametrów”. Czy może podajesz parametry lokalizacji i / lub skali?
— whuber

@ Whuber, dziękuję za komentarz, naprawdę interesują mnie parametry lokalizacji i skali, bardziej niż stopnie swobody.
— Grzenio

Przy danych równanie prawdopodobieństwa dla parametru lokalizacji jest algebraicznie równoważne wielomianowi stopnia 2 n - 1 . Czy uważasz, że zero takiego wielomianu ma być podane w „formie zamkniętej”? n2)n-1
— whuber

@ whuber, czy są jakieś specjalne przypadki dla małych n, np. n = 3?
— Grzenio

Odpowiedzi:


27

Forma zamknięta nie istnieje dla T, ale bardzo intuicyjne i stabilne podejście odbywa się za pomocą algorytmu EM. Ponieważ student jest mieszanką normalnych w skali, możesz napisać swój model jako

yja=μ+mija

gdzie oraz w i ∼ G a ( νmija|σ,wja∼N.(0,σ2)wja-1). Oznacza to, że warunkowo nawimle są tylko ważone średnie i odchylenie standardowe. To jest krok „M”wja∼solza(ν2),ν2))wja

Ď 2=ΣIWI(Yi - μ )2

μ^=∑jawjayja∑jawja
σ^2)=∑jawja(yja-μ^)2)n

Teraz „E” zastępuje krok z jego oczekiwaniem podane wszystkie dane. Jest to podane jako:wja

w^ja=(ν+1)σ2)νσ2)+(yja-μ)2)

więc wystarczy powtórzyć powyższe dwa kroki, zastępując „prawą stronę” każdego równania bieżącymi oszacowaniami parametrów.

μσ2)σ2)(ν+1)σolre2)νν

Należy zauważyć, że funkcja prawdopodobieństwa dziennika może mieć więcej niż jeden punkt stacjonarny, więc algorytm EM może zbiegać się w tryb lokalny zamiast trybu globalnego. Tryby lokalne można znaleźć, gdy parametr lokalizacji zostanie uruchomiony zbyt blisko wartości odstającej. Zatem rozpoczęcie od mediany jest dobrym sposobem na uniknięcie tego.


1
To cudownie. Od jakiegoś czasu bawiłem się pomysłem dopasowania studenta do EM, właśnie dlatego, że wygląda jak mieszanka gaussów. Czy masz cytat / odniesienie do podanych równań aktualizacji? Posiadanie tego jeszcze bardziej zwiększyłoby niesamowitość tego postu.
— Pat

Właściwie myślę, że sam go znalazłem, dla modelu mieszanego t-Studenta (którego tak zamierzam użyć do różnych rzeczy): Mieszanki rozkładów T-Studenta jako solidne ramy dla sztywnej rejestracji. Demetrios Gerogiannis, Christophoros Nikou, Aristidis Likas. Przetwarzanie obrazu i obrazu 27 (2009) 1285–1294.
— Pat

Link w mojej odpowiedzi na to pytanie ma bardzo ogólną strukturę EM dla obciążeń i obciążeń funkcji prawdopodobieństwa - kwantylowych, studenckich, logistycznych i wykonuje regresję ogólną. Twój konkretny przypadek to „regresja” bez zmiennych towarzyszących - tylko przechwytuj - więc ładnie pasuje do tego frameworka. Ponadto istnieje wiele karnych terminów, które możesz włączyć do tych ram.
— probabilityislogic

ν

Myślę, że to odniesienie jest lepsze niż @ Pat. „SZACUNEK ML DYSTRYBUCJI Z WYKORZYSTANIEM EM I JEGO ROZSZERZEŃ, ECM I ECME.” Musisz być bardzo ostrożny przy wyborze początkowej wartości parametru podczas działania algorytmu EM ze względu na lokalny optymalny problem. Innymi słowy, musisz wiedzieć coś o swoich danych. Zazwyczaj w swoich badaniach unikam zastosowania rozkładu t.

4

Poniższy artykuł odnosi się dokładnie do problemu, który napisałeś.

Liu C. i Rubin DB 1995. „Szacowanie ML rozkładu t przy użyciu EM i jego rozszerzeń, ECM i ECME”. Statistica Sinica 5: 19–39.

Zapewnia ogólne oszacowanie parametru wielowymiarowego rozkładu t, z lub bez wiedzy o stopniu swobody. Procedurę można znaleźć w rozdziale 4 i jest ona bardzo podobna do logiki prawdopodobieństwa dla 1-wymiaru.


7
Wygląda na to, że artykuł, do którego się odwołujesz, zawiera przydatną odpowiedź na pytanie, ale odpowiedzi są lepsze, gdy są samodzielne i nie wymagają zewnętrznych zasobów (tutaj, na przykład, możliwe jest, że OP lub czytelnicy nie mają dostępu do tego artykułu) ). Czy mógłbyś trochę rozwinąć swoją odpowiedź, aby była bardziej samodzielna?
— Patrick Coulombe,

3

Γ(ν+12))νπΓ(ν2))(1+t2)ν)-ν+12)=Γ(ν+12))νπΓ(ν2))exp⁡{[ln⁡(1+t2)ν)][-ν+12)]}
νnnν→∞

1
Nawet w ustawieniu Gaussa prawdopodobieństwo dziennika jest nieliniowe w swoich parametrach :-).
— whuber

Właściwie interesują mnie parametry lokalizacji i skali, bardziej niż stopnie swobody. Zobacz edycję pytania i przepraszamy za nieprecyzyjne.
— Grzenio

2

Niedawno odkryłem estymator w formie zamkniętej dla skali rozkładu t Studenta. Według mojej najlepszej wiedzy jest to nowy wkład, ale chętnie przyjmę komentarze sugerujące wszelkie powiązane wyniki. Artykuł opisuje tę metodę w kontekście rodziny rozkładów „wykładniczych sprzężonych”. Wartość t Studenta jest określana jako Sprzężony Gaussa, gdzie termin sprzężenia jest odwrotnością stopnia swobody. Statystyka w formie zamkniętej jest średnią geometryczną próbek. Zakładając wartość sprzężenia lub stopień swobody, oszacowanie skali jest określane przez pomnożenie średniej geometrycznej próbek przez funkcję obejmującą sprzężenie i liczbę harmoniczną.

https://arxiv.org/abs/1804.03989 Zastosowanie średniej geometrycznej jako statystyki dla skali sprzężonych rozkładów Gaussa, Kenric P. Nelson, Mark A. Kon, Sabir R. Umarov

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.