Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Dlaczego test F w Gaussowskich modelach liniowych jest najbardziej wydajny?
W przypadku Gaussowskiego modelu liniowego gdzie zakłada się, że leży w pewnej przestrzeni wektorowej a ma standardowy rozkład normalny na , statystyka testu dla , gdzie jest przestrzeń wektorową, to zwiększa się do jedną z funkcji odchyleń statystyki: Skąd możemy wiedzieć, że ta statystyka zapewnia najsilniejszy test dla H_0Y=μ+σGY=μ+σGY=\mu+\sigma Gμμ\muWWWGGGRnRn\mathbb{R}^nFFFH0:{μ∈U}H0:{μ∈U}H_0\colon\{\mu …

3
Jak przekształcić rozkład lepeptyczny w normalność?
Załóżmy, że mam zmienną leptokurtyczną, którą chciałbym przekształcić do normalności. Jakie transformacje mogą wykonać to zadanie? Doskonale zdaję sobie sprawę z tego, że przekształcanie danych nie zawsze może być pożądane, ale dla celów akademickich załóżmy, że chcę „wbić” dane w normalność. Ponadto, jak można zauważyć na podstawie wykresu, wszystkie wartości …

5
W jaki sposób kurtoza rozkładu jest związana z geometrią funkcji gęstości?
Kurtoza ma mierzyć szczytowość i płaskość rozkładu. Funkcja gęstości rozkładu, jeśli istnieje, może być postrzegana jako krzywa i ma cechy geometryczne (takie jak krzywizna, wypukłość, ...) związane z jej kształtem. Zastanawiam się więc, czy kurtoza rozkładu jest związana z niektórymi cechami geometrycznymi funkcji gęstości, które mogą wyjaśnić geometryczne znaczenie kurtozy?

2
Test vs -test do porównywania szans na przeziębienie w 2 grupach
Właśnie przeczytałem w dość szanowanym (popularnym) magazynie naukowym (niemiecki premier, 02/2013, s. 36) o ciekawym eksperymencie (niestety bez źródła). Przyciągnęło to moją uwagę, ponieważ intuicyjnie wątpiłem w znaczenie wyniku, ale dostarczone informacje były wystarczające do odtworzenia testów statystycznych. Naukowcy zastanawiali się, czy przeziębienie w zimne dni zwiększa szanse na przeziębienie. …



1
Stosunek prawdopodobieństw do stosunku plików PDF
Korzystam z Bayesa, aby rozwiązać problem klastrowania. Po kilku obliczeniach kończę z koniecznością uzyskania stosunku dwóch prawdopodobieństw: P(A)/P(B)P(A)/P(B)P(A)/P(B) być w stanie uzyskać . Te prawdopodobieństwa są uzyskiwane przez integrację dwóch różnych wielowymiarowych KDE 2D, jak wyjaśniono w tej odpowiedzi :P(H|D)P(H|D)P(H|D) P(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A) = \iint_{x, y : \hat{f}(x, y) < \hat{f}(r_a, s_a)} …


5
Rekurencyjny (online) uregulowany algorytm najmniejszych kwadratów
Czy ktoś może skierować mnie w stronę internetowego (rekurencyjnego) algorytmu regularyzacji Tichonowa (uregulowane najmniejsze kwadraty)? W trybie offline obliczyłem β^=(XTX+λI)−1XTYβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TY przy użyciu mojego oryginalnego zestawu danych, w którym znaleziono λλλ przy użyciu n-krotnej weryfikacji krzyżowej. Nową wartość yyy można przewidzieć dla danego xxx używając y=xTβ^y=xTβ^y=x^T\hat\beta . W trybie online ciągle …


2
Czy MLE zawsze oznacza, że ​​znamy plik PDF naszych danych, a EM oznacza, że ​​nie?
Mam kilka prostych pytań koncepcyjnych, które chciałbym wyjaśnić w odniesieniu do MLE (oszacowanie maksymalnego prawdopodobieństwa) i jaki ma związek z EM (maksymalizacja oczekiwań). Jak rozumiem, jeśli ktoś powie „Użyliśmy MLE”, czy to automatycznie oznacza, że ​​ma wyraźny model pliku PDF swoich danych? Wydaje mi się, że odpowiedź na to pytanie …

10
Typowe słowa, które mają szczególne znaczenie statystyczne
Nie jestem statystykiem, ale moje prace badawcze obejmują statystyki (analizowanie danych, czytanie literatury itp.). Ponownie przypomniano mi z komentarza do jednego z moich zamieszczonych tutaj pytań , że istnieją pewne popularne słowa, które mają szczególne znaczenie lub konotacje dla tych, którzy są dobrze wyćwiczeni w dziedzinie statystyki. Pomocna będzie lista …

2
Jak mogę połączyć p-bootstrapowane wartości p w wielokrotnie przypisywanych zestawach danych?
Niepokoi mnie problem, że chciałbym uruchomić wartość p dla oszacowania podstawie danych wielokrotnego przypisania (MI), ale nie jest dla mnie jasne, jak połączyć wartości p w zestawach MI.θθ\theta W przypadku zestawów danych MI standardowe podejście do uzyskania całkowitej wariancji oszacowań wykorzystuje reguły Rubina. Zobacz tutaj, aby zapoznać się z zestawieniem …

2
Intuicja za funkcją gęstości rozkładów T.
Studiuję o rozkładzie t-Studenta i zacząłem się zastanawiać, jak można wyprowadzić funkcję gęstości rozkładów t (z wikipedii, http://en.wikipedia.org/wiki/Student%27s_t-distribution ): fa( t ) = Γ ( v + 12))v π--√Γ ( w2))( 1 + t2)v)- v + 12)f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} gdzie to stopnie swobody, a to funkcja gamma. Jaka jest …

2
Dlaczego niektórzy ludzie testują założenia modelu przypominającego regresję na swoich surowych danych, a inni testują je na poziomie resztkowym?
Jestem doktorantem z psychologii eksperymentalnej i staram się doskonalić swoje umiejętności i wiedzę na temat analizy moich danych. Do piątego roku studiów w psychologii myślałem, że modele podobne do regresji (np. ANOVA) zakładają następujące rzeczy: normalność danych jednorodność wariancji danych i tak dalej Moje studia licencjackie doprowadziły mnie do przekonania, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.