Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Obliczanie prawdopodobieństwa z RMSE
Mam model przewidywania trajektorii (x w funkcji czasu) z kilkoma parametrami. W tej chwili obliczam błąd średniej kwadratowej (RMSE) między przewidywaną trajektorią a eksperymentalnie zarejestrowaną trajektorią. Obecnie minimalizuję tę różnicę (RMSE), używając simplex (fminsearch w Matlabie). Chociaż ta metoda działa dobrze, ale chcę porównać kilka różnych modeli, myślę, że muszę …

2
Bez modelowania wielopoziomowego, jak poradzić sobie z replikacją w ramach badania w metaanalizie, gdzie badanie jest jednostką replikacji?
Opis badania: Zauważyłem częsty błąd w metaanalizach w odniesieniu do obsługi replikacji w ramach badania. Nie jest dla mnie jasne, czy błąd unieważnia badania po sformułowaniu założeń. Jednak, jak rozumiem, założenia te naruszają podstawową przesłankę statystyki. Na przykład, badania Badania efektów chemicznej w reakcji .YXXXYYY Analiza jest przeprowadzana na logarytmicznym …

2
Jaka jest wariancja maksimum próbki?
Szukam granic wariancji maksimum zestawu zmiennych losowych. Innymi słowy, szukam formuł zamkniętych dla bBB , takich że Var ( maksjaXja) ≤ B,Var(maxiXi)≤B, \mbox{Var}(\max_i X_i) \leq B \enspace, Gdzie X= { X1, … , XM.}X={X1,…,XM}X = \{ X_1, \ldots, X_M \} jest stałym zestawem M.MM zmiennych losowych o skończonych środkach μ1, …


2
Dlaczego tak nazywane są „dyskryminacyjne” modele Gaussa?
Modele analizy dyskryminacyjnej Gaussa uczą się a następnie stosują regułę Bayesa do oceny Dlatego są to modele generatywne. Dlaczego zatem nazywa się to analizą dyskryminacyjną? Jeśli dzieje się tak, ponieważ w końcu wyprowadzamy krzywą dyskryminacyjną między klasami, dzieje się tak w przypadku wszystkich modeli generatywnych.P(x|y)P(x|y)P(x|y)P(y|x)=P(x|y)Pprior(y)Σg∈YP(x|g)Pprior(g).P(y|x)=P(x|y)Pprior(y)Σg∈YP(x|g)Pprior(g).P(y|x) = \frac{P(x|y)P_{prior}(y)}{\Sigma_{g \in Y} P(x|g) …

2
Hesjan o prawdopodobieństwie profilu wykorzystany do standardowego oszacowania błędu
To pytanie jest motywowane tym . Poszukałem dwóch źródeł i oto, co znalazłem. A. van der Vaart, Statystyki asymptotyczne: Rzadko jest możliwe jednoznaczne obliczenie prawdopodobieństwa profilu, ale jego liczbowa ocena jest często wykonalna. Wówczas prawdopodobieństwo profilu może służyć do zmniejszenia wymiaru funkcji wiarygodności. Funkcje wiarygodności profilu są często używane w …


4
Raportowanie wyników regresji logistycznej
Mam następujące dane wyjściowe regresji logistycznej: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.5716 0.1734 3.297 0.000978 *** R1 -0.4662 0.2183 -2.136 0.032697 * R2 -0.5270 0.2590 -2.035 0.041898 * Czy należy to zgłosić w następujący sposób: Współczynnik beta, iloraz szans, wartość, wartość P. Jeśli tak, jak mogę uzyskać …
13 logistic 


2
Opis ładowania początkowego do sprawdzania poprawności i wyboru modelu
Wydaje mi się, że rozumiem, jak działają podstawy ładowania początkowego , ale nie jestem pewien, czy rozumiem, jak mogę użyć ładowania początkowego do wyboru modelu lub uniknąć nadmiernego dopasowania. Na przykład, aby wybrać model, czy po prostu wybierzesz model, który daje najniższy błąd (może wariancję?) We wszystkich próbkach ładowania początkowego? …

3
Jak zgłaszać współczynniki ryzyka z proporcjonalnego modelu zagrożeń Coxa w języku angielskim?
Rozumiem, że współczynnik ryzyka z modelu proporcjonalnego hazardu Coxa porównuje wpływ na współczynnik ryzyka danego czynnika z grupą odniesienia. Jak zgłosiłbyś to publiczności, która nie zna statystyk? Spróbujmy sformułować przykład. Powiedzmy, że zapisujemy ludzi do badania, ile czasu minie, zanim kupią kanapę. Mamy cenzurę po 3 latach. W tym przykładzie …

2
Jaki jest najlepszy sposób na poznanie podstaw prawdopodobieństwa wymaganego dla algorytmów uczenia maszynowego?
Kilka lat temu odbyłem kurs prawdopodobieństwa na uniwersytecie, ale teraz przechodzę przez algorytmy uczenia maszynowego, a niektóre matematyki są po prostu oszałamiające. Właśnie teraz uczę się algorytmu EM (maksymalizacja oczekiwań) i wydaje się, że istnieje duże rozróżnienie między tym, co jest wymagane, a tym, co mam. Nie pytam o książkę …

4
Narysować wiele wykresów na jednym wykresie w R?
Korzystając z następującego kodu, próbowałem narysować cztery wykresy na wykresie w R. Nie jestem zadowolony z tej figury, ponieważ między wykresami jest dużo miejsca, dlatego szerokość wykresów nie jest wystarczająca do analizy wykresów. Czy ktoś mógłby mi pomóc w stworzeniu ładnego wykresu zawierającego cztery wykresy? Jak mogę zachować etykiety osi …

1
Powielanie tabeli 18.1 z „Elementów uczenia statystycznego”
Tabela 18.1 w Elementy uczenia statystycznego podsumowuje wydajność kilku klasyfikatorów w zestawie danych 14 klas. Porównuję nowy algorytm z lasso i elastyczną siecią dla takich problemów z klasyfikacją wieloklasową. Korzystając z glmnetwersji 1.5.3 (R 2.13.0), nie jestem w stanie odtworzyć punktu 7. ( wielomianowy L_1) w tabeli, w której podano …

1
Ustalenie prawdziwej średniej z głośnych obserwacji
Mam duży zestaw punktów danych w postaci (średnia, stdev). Chciałbym zredukować to do jednego (lepszego) środka i (miejmy nadzieję) mniejszego odchylenia standardowego. Oczywiście mógłbym po prostu obliczyć , jednak nie bierze to pod uwagę faktu, że niektóre punkty danych są znacznie dokładniejsze niż inne.∑datameanN∑datameanN\frac{\sum data_{mean}}{N} Krótko mówiąc, chciałbym wykonać średnią …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.