Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Co to jest „dystrybucja ściśle pozytywna”?
Czytam „Przyczynowość” Judei Pearl (drugie wydanie 2009), aw sekcji 1.1.5 Warunkowa niezależność i grafoidy stwierdza: Poniżej znajduje się (częściowa) lista właściwości spełnianych przez warunkową zależność niezależności (X_ || _Y | Z). Symetria: (X_ || _ Y | Z) ==> (Y_ || _X | Z). Rozkład: (X_ || _ YW | …

2
Wykrywanie punktu przełączania z programowaniem probabilistycznym (pymc)
Obecnie czytam „książkę” z zakresu programowania probabilistycznego i metod bayesowskich dla hakerów . Przeczytałem kilka rozdziałów i zastanawiałem się nad pierwszym rozdziałem, w którym pierwszy przykład z pymc polega na wykryciu czarownicy w wiadomościach tekstowych. W tym przykładzie zmienna losowa wskazująca, kiedy ma miejsce punkt przełączania, jest oznaczona . Po …

1
Kiedy odpowiednia reguła punktacji jest lepszym oszacowaniem uogólnienia w warunkach klasyfikacji?
Typowym podejściem do rozwiązania problemu z klasyfikacją jest identyfikacja klasy modeli kandydujących, a następnie dokonanie wyboru modelu za pomocą procedury takiej jak walidacja krzyżowa. Zazwyczaj wybiera się model z najwyższą dokładnością lub jakąś powiązaną funkcję, która koduje informacje specyficzne dla problemu, takie jakfaβFβ\text{F}_\beta. Zakładając, że celem końcowym jest stworzenie dokładnego …

1
Dlaczego funkcjonalna forma 1. etapu w 2SLS nie jest ważna?
W dzisiejszej prezentacji mówca przedstawił powyższe twierdzenie. Powiedział, że nawet jeśli pierwszy etap zostanie błędnie określony, oszacowania współczynników drugiego etapu będą nadal aktualne. Jako student o niskim wykształceniu nie mogłem prosić o wyjaśnienia, dlatego błagałem o pomoc!

2
Bayesowska analiza tabel awaryjnych: Jak opisać wielkość efektu
Pracuję nad przykładami z Doing Bayesian Data Analysis Kruschke , a konkretnie wykładniczą ANOVA wykładniczą Poissona w rozdz. 22, który przedstawia jako alternatywę dla częstych testów chi-kwadrat niezależności dla tabel awaryjnych. Widzę, w jaki sposób otrzymujemy informacje o interakcjach, które występują częściej lub rzadziej niż można by się spodziewać, gdyby …

2
SD większa niż średnia, nieujemna skala
Dostałem artykuł opisujący badanie bardzo podobne do tego, które moje laboratorium chce prowadzić. Zauważyłem jednak, że dla zmiennej zainteresowania, Czas trwania, SD są większe niż średnia ... ponieważ jest to czas trwania mierzony w minutach, nigdy nie może być ujemny i wydaje mi się to bardzo dziwne. Stało się to …

2
Konwergencja w dystrybucji \ CLT
Biorąc pod uwagę, że , warunkowe rozbieżność. o jest . ma marginalne rozproszenie. Poissona ( ) jest dodatnią stałą.N=nN=nN = nYYYχ2(2n)χ2(2n)\chi ^2(2n)NNNθθ\thetaθθ\theta Pokaż, że jako , w rozkładzie.θ→∞θ→∞\theta \rightarrow \infty (Y−E(Y))/Var(Y)−−−−−−√→N(0,1) (Y−E(Y))/Var⁡(Y)→N(0,1)\space \space (Y - E(Y))/ \sqrt{\operatorname{Var}(Y)} \rightarrow N(0,1) Czy ktoś mógłby zasugerować strategie rozwiązania tego problemu. Wygląda na to, …

1
Równoważność wartości AIC i pw wyborze modelu
W komentarzu do odpowiedzi na to pytanie stwierdzono, że zastosowanie AIC w wyborze modelu było równoważne z zastosowaniem wartości p 0,154. Próbowałem w R, gdzie użyłem algorytmu wyboru podzbioru „wstecznego”, aby wyrzucić zmienne z pełnej specyfikacji. Po pierwsze, sekwencyjnie wyrzucając zmienną o najwyższej wartości p i zatrzymując się, gdy wszystkie …

2
Jak wizualizowałbyś segmentowany lejek? (i czy możesz to zrobić za pomocą Pythona?)
Widziałem ten post w Moz, który przedstawiał segmentowy lejek marketingowy: Tego rodzaju rzeczy miałyby w mojej pracy dużą wartość. Nie mam pojęcia, jak wizualizować nieprzetworzone dane, aby pokazać taki segmentowy lejek. Chodzi o to, że potencjalni klienci pochodzą z różnych źródeł (których używamy do segmentacji danych) i przechodzą przez kilka …




1
Wartość odcięcia odległości Cooka
Czytałem o odległości kucharza, aby zidentyfikować wartości odstające, które mają duży wpływ na moją regresję. W oryginalnym badaniu Cooka powiedział, że wskaźnik odcięcia 1 powinien być porównywalny do zidentyfikowania czynników wpływających. Wykorzystują jednak różne inne badania4n4n\frac{4}{n} lub 4n−k−14n−k−1\frac{4}{n-k-1} jako punkt odcięcia. W moim badaniu żadna z moich reszt nie ma …

2
Błąd nastawienia optymistycznego - szacunki błędu prognozowania
Książka Elements of Statistics Learning (dostępna w PDF online) omawia stronniczość optymisim (7.21, strona 229). Stwierdza, że ​​nastawienie optymistyczne stanowi różnicę między błędem treningu a błędem w próbie (błąd zaobserwowany, jeśli próbkujemy nowe wartości wyników w każdym z oryginalnych punktów szkolenia) (poniżej). Następnie stwierdza, że ​​to uprzedzenie optymistyczne ( ) …

2
R wykrywa wzrost / spadek trendu szeregów czasowych
Mam wiele szeregów czasowych z okresami: dzień, tydzień lub miesiąc. Z stl()funkcją lub z loess(x ~ y)widzę, jak wyglądają trendy poszczególnych szeregów czasowych. Muszę wykryć, czy trend szeregów czasowych rośnie, czy maleje. Jak sobie z tym poradzić? Próbowałem obliczyć współczynniki regresji liniowej lm(x ~ y)i grać ze współczynnikiem nachylenia. ( …
9 r  time-series  trend 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.