Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Jak przekonwertować odległość (euklidesowa) na wynik podobieństwa
Korzystam z oznacza grupowanie głosów w klastrze. Kiedy porównuję wypowiedź do danych głośników w klastrze, otrzymam (na podstawie odległości euklidesowej) średnie zniekształcenie. Odległość ta może wynosić . Chcę przekonwertować tę odległość na wynik podobieństwa . Proszę o wskazówki, jak to osiągnąć.[ 0 , ∞ ] [ 0 , 1 ]kkk[0,∞][0,∞][0,\infty][0,1][0,1][0,1]


1
Czy dopasowanie modelu Coxa do interakcji między warstwami i zmiennymi kowariancyjnymi różni się od dopasowania dwóch modeli Coxa?
W Strategii modelowania regresji autorstwa Harrella (druga edycja) znajduje się sekcja (S. 20.1.7) omawiająca modele Coxa, w tym interakcję między zmienną towarzyszącą, której główny wpływ na przeżycie chcemy również oszacować (wiek w przykładzie poniżej) i zmienna towarzysząca, której głównego efektu nie chcemy oszacować (płeć w poniższym przykładzie). Konkretnie: załóżmy, że …

1
Jaka jest wariancja długoterminowa?
Jak definiuje się wariancję długookresową w dziedzinie analizy szeregów czasowych? Rozumiem, że jest wykorzystywany w przypadku, gdy w danych występuje struktura korelacji. Więc nasz proces stochastyczny nie byłby rodziną i losowych zmiennych, a raczej tylko identycznie rozmieszczonymi?X1,X2…X1,X2…X_1, X_2 \dots Czy mogę podać standardowe odniesienie jako wprowadzenie do koncepcji i trudności …

3
Czy losowy las i wzmocnienie jest parametryczny czy nieparametryczny?
Czytając doskonałe modelowanie statystyczne: Dwie kultury (Breiman 2001) , możemy uchwycić całą różnicę między tradycyjnymi modelami statystycznymi (np. Regresja liniowa) a algorytmami uczenia maszynowego (np. Bagging, Random Forest, Boosted trees ...). Breiman krytykuje modele danych (parametryczne), ponieważ opierają się one na założeniu, że obserwacje są generowane przez znany, formalny model …


1
Pytanie związane z Borel-Cantelli Lemma
Uwaga: Borel-Cantelli Lemma tak mówi ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 Następnie, jeśli ∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty za pomocą Borel-Cantelli Lemma Chcę to pokazać po pierwsze, limn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n)Istnieje \ …


1
Biodrowy estymator regresji osiągający lepsze wyniki niż obiektywny w modelu błędu w modelu zmiennych
Pracuję nad niektórymi danymi syntetycznymi dla modelu błędu w zmiennej dla niektórych badań. Obecnie mam pojedynczą zmienną niezależną i zakładam, że znam wariancję prawdziwej wartości zmiennej zależnej. Dzięki tym informacjom mogę uzyskać obiektywny estymator dla współczynnika zmiennej zależnej. Model: y=0,5x-10+e2e1~N(0,σ2)σe2~N(0,1)x~=x+e1x~=x+e1\tilde{x} = x + e_1 y=0.5x−10+e2y=0.5x−10+e2y = 0.5x -10 + e_2 …

1
Parametry a zmienne ukryte
Pytałem o to wcześniej i naprawdę miałem problemy z określeniem, co czyni parametr modelu, a co czyni go zmienną ukrytą. Więc patrząc na różne wątki na ten temat na tej stronie, głównym rozróżnieniem wydaje się być: Zmienne utajone nie są obserwowane, ale mają z nimi powiązany rozkład prawdopodobieństwa, ponieważ są …

3
Dlaczego ślad
W modelu możemy oszacować przy użyciu równania normalnego :y=Xβ+ϵy=Xβ+ϵ{y} = X \beta + \epsilonββ\beta β^=(X′X)−1X′y,β^=(X′X)−1X′y,\hat{\beta} = (X'X)^{-1}X'y, i moglibyśmy dostaćy^=Xβ^.y^=Xβ^.\hat{y} = X \hat{\beta}. Wektor reszt szacowany jest przez ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,\hat{\epsilon} = y - X \hat{\beta} = (I - X (X'X)^{-1} X') y = Q y = Q (X \beta + \epsilon) …

1
Błąd addytywny czy błąd mnożenia?
Jestem stosunkowo nowy w statystyce i byłbym wdzięczny za pomoc w lepszym zrozumieniu tego. W mojej dziedzinie znajduje się powszechnie stosowany model formularza: P.t= Po( Vt)αPt=Po(Vt)αP_t = P_o(V_t)^\alpha Kiedy ludzie dopasowują model do danych, zwykle linearyzują go i dopasowują do poniższych log( Pt) = log( Po) + dziennik α( Vt) …




Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.