Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych




3
Dopasowanie rozkładu t w R: parametr skalowania
Jak dopasować parametry rozkładu t, tj. Parametry odpowiadające „średniej” i „odchyleniu standardowemu” rozkładu normalnego. Zakładam, że są one nazywane „średnimi” i „skalowaniem / stopniami swobody” dla rozkładu t? Poniższy kod często powoduje błędy „nieudana optymalizacja”. library(MASS) fitdistr(x, "t") Czy najpierw muszę skalować x, czy przeliczać na prawdopodobieństwa? Jak najlepiej to …

5
Dlaczego k-znaczy nie daje globalnego minimum?
Czytałem, że algorytm k-średnich jest zbieżny tylko z lokalnym minimum, a nie globalnym minimum. Dlaczego to? Mogę logicznie myśleć o tym, w jaki sposób inicjalizacja mogłaby wpłynąć na końcowe grupowanie i istnieje możliwość nieoptymalnego grupowania, ale nie znalazłem niczego, co matematycznie to udowodni. Ponadto, dlaczego k-oznacza proces iteracyjny? Czy nie …

1
Jak zinterpretować wynik prognozy.coxph?
Po dopasowaniu modelu koxmodelu możliwe jest przewidywanie i wyszukiwanie względnego ryzyka nowych danych. Nie rozumiem, w jaki sposób obliczane jest ryzyko względne dla osoby i do czego jest ono powiązane (tj. Średnia populacji)? Wszelkie zalecenia dotyczące zasobów, które pomogą zrozumieć (nie jestem bardzo zaawansowany w analizie przeżycia, więc im prościej, …

1
Związek między funkcją generującą moment a funkcją charakterystyczną
Próbuję zrozumieć związek między funkcją generującą moment a funkcją charakterystyczną. Funkcja generowania momentu jest zdefiniowana jako: MX(t)=E(exp(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n!MX(t)=E(exp⁡(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n! M_X(t) = E(\exp(tX)) = 1 + \frac{t E(X)}{1} + \frac{t^2 E(X^2)}{2!} + \dots + \frac{t^n E(X^n)}{n!} Wykorzystanie rozszerzenia szeregowego , Mogę znaleźć wszystkie momenty rozkładu dla zmiennej losowej X.exp(tX)=∑∞0(t)n⋅Xnn!exp⁡(tX)=∑0∞(t)n⋅Xnn!\exp(tX) = \sum_0^{\infty} \frac{(t)^n \cdot …

1
Współczynnik ujemny w uporządkowanej regresji logistycznej
Załóżmy, że mamy porządkową odpowiedź y:{Bad, Neutral, Good}→{1,2,3}y:{Bad, Neutral, Good}→{1,2,3}y:\{\text{Bad, Neutral, Good}\} \rightarrow \{1,2,3\} i zbiór zmiennych X:=[x1,x2,x3]X:=[x1,x2,x3]X:=[x_1,x_2,x_3] który naszym zdaniem wyjaśni yyy . Następnie wykonujemy uporządkowaną regresję logistyczną XXX (macierz projektowa) na yyy (odpowiedź). Załóżmy, że szacowany współczynnik x1x1x_1 , to nazwać p 1 , w uporządkowane regresji logistycznej …

8
Jak interpolacja jest związana z pojęciem regresji?
Wyjaśnij krótko Co należy rozumieć przez interpolację. Jak wiąże się to z pojęciem regresji? interpolacja to sztuka czytania między wierszami tabeli, a w matematyce elementarnej termin ten zwykle oznacza proces obliczania wartości pośrednich funkcji z zestawu danych lub tabelarycznych wartości tej funkcji. Nie mogę udzielić odpowiedzi na drugie pytanie. Proszę …

3
Jak działa standardowy błąd?
Ostatnio przyglądałem się wewnętrznym działaniom standardowego błędu i nie byłem w stanie zrozumieć, jak to działa. Rozumiem błąd standardowy, ponieważ jest to standardowe odchylenie rozkładu średnich próbek. Moje pytania to: • skąd wiemy, że błąd standardowy oznacza odchylenie standardowe próbki, gdy zwykle pobieramy tylko jedną próbkę? • dlaczego równanie do …

2
Wsteczna transformacja współczynników regresji
Wykonuję regresję liniową z transformowaną zmienną zależną. Dokonano następującej transformacji, aby utrzymać założenie normalności reszt. Nietransformowana zmienna zależna została ujemnie wypaczona, a następująca transformacja zbliżyła ją do normy: Y=50−Yorig−−−−−−−−√Y=50−YorigY=\sqrt{50-Y_{orig}} gdzie jest zmienną zależną w oryginalnej skali.YorigYorigY_{orig} Myślę, że warto zastosować transformację współczynników aby wrócić do oryginalnej skali. Używając następującego równania …

1
Jak wybierać między ANOVA i ANCOVA w zaprojektowanym eksperymencie?
Przeprowadzam eksperyment, który obejmuje: DV: Zużycie plastra (ciągłe lub może być kategoryczne) IV: Zdrowa wiadomość, niezdrowa wiadomość, brak wiadomości (kontrola) (3 grupy, w których ludzie są losowo przydzielani - kategorycznie) Jest to zmanipulowana wiadomość o zdrowiu plasterka. Następujące wartości IV można uznać za indywidualne zmienne różnicowe: Impulsywność (może być kategoryczna, …

1
Dlaczego zakładamy, że błąd jest zwykle dystrybuowany?
Zastanawiam się, dlaczego używamy założenia Gaussa podczas modelowania błędu. Na kursie ML Stanforda prof. Ng opisuje to zasadniczo na dwa sposoby: Jest to matematycznie wygodne. (Jest to związane z dopasowaniem najmniejszych kwadratów i łatwe do rozwiązania za pomocą pseudoinwersji) Ze względu na centralne twierdzenie graniczne możemy założyć, że istnieje wiele …


1
Konwencje notacji zmiennych losowych i ich rozkłady
Mylę się co do prawidłowych oznaczeń znaczeń, a także znaczeń niektórych zapisów dotyczących zmiennych losowych i ich rozkładów. Poniżej wymienię rzeczy, które moim zdaniem są prawdziwe, a także rzeczy, których nie rozumiem i chciałbym wprowadzić / wprowadzić poprawki. Dla ułatwienia odsyłam do każdego punktu / pytania numer. Jeśli wyszczególnienie pozycji …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.