Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Rozbieżność Kullbacka-Leiblera dla dwóch próbek
Próbowałem zaimplementować oszacowanie liczbowe dywergencji Kullbacka-Leiblera dla dwóch próbek. Aby debugować implementację, narysuj próbki z dwóch rozkładów normalnych N(0,1)N(0,1)\mathcal N (0,1) i N(1,2)N(1,2)\mathcal N (1,2) . Dla prostego oszacowania wygenerowałem dwa histogramy i próbowałem liczbowo aproksymować całkę. Utknąłem z obsługą tych części histogramu, w których przedziały jednego z histogramów mają …

5
Jak przetestować efekt interakcji za pomocą testu nieparametrycznego (np. Testu permutacji)?
Mam dwie zmienne jakościowe / nominalne. Każda z nich może przyjąć tylko dwie różne wartości (więc mam w sumie 4 kombinacje). Każda kombinacja wartości zawiera zestaw wartości liczbowych. Mam więc 4 zestawy liczb. Żeby było bardziej konkretnie, powiedzmy, że mam male / femalei young / oldjako zmienne nominalne i mam …

2
Czy stronniczość jest własnością estymatora, czy poszczególnych szacunków?
Jako przykład często spotykam studentów, którzy wiedzą, że zaobserwowany jest tendencyjnym estymatorem populacji . Następnie, pisząc swoje raporty, mówią:R2R2R^2R2R2R^2 „Obliczyłem Obserwowany i Skorygowany , i były one dość podobne, co sugeruje tylko niewielką ilość błędu w uzyskanej wartości Obserwowanego ”.R2R2R^2R2R2R^2R2R2R^2 Rozumiem to ogólnie, gdy mówimy o uprzedzeniach, zwykle mówimy o …


2
dystrybucja grubych palców
Krótkie pytanie: czy istnieje rozkład grubych palców? Jestem pewien, że jeśli istnieje, to ma inną nazwę. Nie wiem, jak sformułować to jako funkcję analityczną. Czy możesz mi pomóc znaleźć istniejącą wersję lub zacząć formułować ją w coś czystszego niż gigantyczna symulacja? Jest to rozkład liczb faktycznie trafionych, gdy dana liczba …




3
D Cohena dla testu t próbki zależnej
Szybkie pytanie: widziałem d Cohena obliczonego na dwa różne sposoby dla testu t zależnych próbek (np. Projekt wewnątrz próbek testujący skuteczność leku z punktami czasowymi przed / po). Wykorzystując standardowe odchylenie wyniku zmiany w mianowniku równania dla d Cohena. Wykorzystanie standardowego odchylenia wyniku przedtestowego w mianowniku równania dla d Cohena. …

1
Zapobieganie awariom próbkowania wygładzonego Pareto (PSIS-LOO)
Niedawno zacząłem używać wygładzania ważności Pareto z pominięciem krzyżowej walidacji (PSIS-LOO), opisanej w tych artykułach: Vehtari, A., i Gelman, A. (2015). Pareto wygładził próbkowanie ważności. prefiks arXiv ( link ). Vehicletari, A., Gelman, A., i Gabry, J. (2016). Praktyczna ocena modelu Bayesa przy użyciu krzyżowej weryfikacji typu „out-one-out” i WAIC. …

3
W CLT dlaczego
Niech X1,...,XnX1,...,XnX_1,...,X_n będą niezależnymi obserwacjami z rozkładu, który ma średnią μμ\mu i wariancję σ2&lt;∞σ2&lt;∞\sigma^2 < \infty , gdy n→∞n→∞n \rightarrow \infty , to n−−√X¯n−μσ→N(0,1).nX¯n−μσ→N(0,1).\sqrt{n}\frac{\bar{X}_n-\mu}{\sigma} \rightarrow N(0,1). Dlaczego oznacza to, że X¯n∼N(μ,σ2n)?X¯n∼N(μ,σ2n)?\bar{X}_n \sim N\left(\mu, \frac{\sigma^2}{n}\right)?

2
Dlaczego błędy typu II nie są tak podkreślane w literaturze statystycznej?
Widziałem wiele przypadków, w których błędy typu I są uwzględniane (oznaczane przez wartość alfa) w różnych artykułach badawczych. Rzadko zdarza mi się, aby badacz wziął pod uwagę moc lub błąd typu II. Błędy typu II mogą być bardzo ważne, prawda? Przypadkowo odrzuciliśmy alternatywną hipotezę, gdy była ona rzeczywiście fałszywa. Dlaczego …

1
Czy kiedykolwiek dobrym pomysłem jest „częściowe uznanie” (ciągły wynik) szkolenia regresji logistycznej?
Trenuję regresję logistyczną, aby przewidzieć, którzy biegacze najprawdopodobniej zakończą wyczerpujący wyścig wytrzymałościowy. Bardzo niewielu biegaczy kończy wyścig, więc mam poważny brak równowagi klas i małą próbkę sukcesów (może kilkadziesiąt). Czuję, że mógłbym uzyskać dobry „sygnał” od dziesiątek biegaczy, którzy prawie to zrobili. (Moje dane treningowe mają nie tylko ukończenie, ale …


3
Przypadki użycia RBF SVM (vs regresja logistyczna i losowy las)
Obsługiwane maszyny wektorowe z jądrem funkcji podstawy radialnej to nadzorowany klasyfikator ogólnego przeznaczenia. Chociaż znam teoretyczne podstawy tych maszyn wirtualnych i ich mocne strony, nie znam przypadków, w których są one preferowaną metodą. Czy istnieje klasa problemów, dla których SVM RBF są lepsze od innych technik ML? (Pod względem punktacji …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.