Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Dlaczego ważne jest rozróżnienie między regresją „liniową” a „nieliniową”?
Jakie jest znaczenie rozróżnienia między modelami liniowymi i nieliniowymi? Pytanie Nieliniowy vs. uogólniony model liniowy: jak odnosisz się do regresji logistycznej, Poissona itp.? a jego odpowiedzią było niezwykle pomocne wyjaśnienie liniowości / nieliniowości uogólnionych modeli liniowych. Rozróżnienie modeli liniowych od nieliniowych wydaje się niezwykle ważne, ale nie jest dla mnie …

2
Suma ocen ratingowych vs. szacunkowe wyniki czynnikowe?
Byłbym zainteresowany otrzymywaniem sugestii, kiedy używać „ wyników czynnikowych ” zamiast zwykłej sumy wyników podczas konstruowania skal. Tj. „Wyrafinowane” w porównaniu z „nierafinowanymi” metodami oceny czynnika. Od DiStefano i in. (2009; pdf ), podkreślenie dodane: Istnieją dwie główne klasy metod obliczania wyniku czynnikowego: wyrafinowane i nierafinowane. Nierafinowane metody są stosunkowo …

1
Specjalny rozkład prawdopodobieństwa
Jeśli jest rozkładem prawdopodobieństwa z niezerowymi wartościami na , dla jakiego typu (typów) istnieje stała taka, że dla wszystkich ?p(x)p(x)p(x)[0,+∞)[0,+∞)[0,+\infty)p(x)p(x)p(x)c>0c>0c\gt 0∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^20<ϵ<10<ϵ<10\lt\epsilon\lt 1 Powyższa nierówność jest w rzeczywistości rozbieżnością Kullbacka-Leiblera między rozkładem a jego skompresowaną wersją . Dowiedziałem się, że ta nierówność dotyczy rozkładów wykładniczych, gamma i …

2
Czy twierdzenie Słuckiego jest nadal aktualne, gdy obie sekwencje zbiegają się w nie-zdegenerowanej zmiennej losowej?
Jestem zdezorientowany niektórymi szczegółami na temat twierdzenia Słuckiego : Niech , będą dwiema sekwencjami losowych elementów skalarnych / wektorowych / macierzowych.{ Y n }{ Xn}{Xn}\{X_n\}{ Yn}{Yn}\{Y_n\} Jeśli zbiega się w rozkładzie do losowego elementu a zbiega się w prawdopodobieństwie do stałej , to pod warunkiem, że c jest odwracalne, gdzie …

1
Oczekiwana wartość , współczynnik determinacji, pod hipotezą zerową
Jestem ciekawy stwierdzenia dokonanego na dole pierwszej strony tego tekstu dotyczącego korektyR2adjustedRadjusted2R^2_\mathrm{adjusted} R2adjusted=1−(1−R2)(n−1n−m−1).Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). Tekst stanowi: Logika korekty jest następująca: w zwykłej regresji wielokrotnej predyktor losowy wyjaśnia średnio proporcję 1/(n–1)1/(n–1)1/(n – 1) zmiany odpowiedzi, tak że mmm losowych predyktorów wyjaśnia razem, średnio m/(n–1)m/(n–1)m/(n – 1) wariantu odpowiedzi; innymi słowy, oczekiwana …

2
Pochodna procesu gaussowskiego
Uważam, że pochodna procesu Gaussa (GP) jest innym GP, więc chciałbym wiedzieć, czy istnieją równania w postaci zamkniętej dla równań predykcyjnych pochodnej GP? W szczególności używam kwadratowego wykładniczego jądra kowariancji (zwanego również gaussowskim) i chcę wiedzieć o przewidywaniu pochodnej procesu Gaussa.

2
Jak wybrać optymalną szerokość pojemnika podczas kalibracji modeli prawdopodobieństwa?
Tło: Istnieje kilka świetnych pytań / odpowiedzi na temat kalibracji modeli, które przewidują prawdopodobieństwo wystąpienia wyniku. Na przykład Wynik Briera i jego rozkład na rozdzielczość, niepewność i wiarygodność . Wykresy kalibracyjne i regresja izotoniczna . Metody te często wymagają zastosowania metody binowania na przewidywanych prawdopodobieństwach, dzięki czemu zachowanie wyniku (0, …



1
Identyczne współczynniki oszacowane w modelu Poissona vs Quasi-Poissona
W modelowaniu danych dotyczących liczby roszczeń w środowisku ubezpieczeniowym zacząłem od Poissona, ale zauważyłem nadmierną dyspersję. Quasi-Poisson lepiej modelował większy związek średniej wariancji niż podstawowy Poisson, ale zauważyłem, że współczynniki były identyczne zarówno w modelach Poissona, jak i Quasi-Poissona. Jeśli to nie jest błąd, dlaczego tak się dzieje? Jakie są …


1
Test dobroci dopasowania w regresji logistycznej; które „dopasowanie” chcemy przetestować?
Mam na myśli pytanie i odpowiedzi: Jak porównać (prawdopodobieństwo) zdolność predykcyjną modeli opracowanych na podstawie regresji logistycznej? autor: @Clark Chong oraz odpowiedzi / komentarze @Frank Harrell. oraz na pytanie Stopnie swobody w teście Hosmer-Lemeshowχ2χ2\chi^2 i w komentarzach. Przeczytałem artykuł DW Hosmer, T. Hosmer, S. Le Cessie, S. Lemeshow, „Porównanie testów …

1
Zwykła regresja logistyczna w Pythonie
Chciałbym uruchomić porządkową regresję logistyczną w Pythonie - dla zmiennej odpowiedzi z trzema poziomami i kilkoma czynnikami objaśniającymi. statsmodelsPakiet obsługuje binarny logit i wielomianu logitowe modele (MNLogit), ale nie uporządkowaną logit. Ponieważ podstawowa matematyka nie różni się tak bardzo, zastanawiam się, czy można ją łatwo wdrożyć za pomocą tych? (Alternatywnie, …

4
Wskazówki, że problem jest odpowiedni dla regresji liniowej
Uczę się regresji liniowej za pomocą Wstępu do analizy regresji liniowej autorstwa Montgomery'ego, Pecka i Vininga . Chciałbym wybrać projekt analizy danych. Naiwnie uważam, że regresja liniowa jest odpowiednia tylko wtedy, gdy podejrzewa się, że istnieją liniowe zależności funkcjonalne między zmiennymi objaśniającymi a zmiennymi odpowiedzi. Ale niewiele rzeczywistych aplikacji wydaje …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.