Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
W R, jak obliczyć wartość p dla obszaru pod ROC
Trudno mi znaleźć sposób na obliczenie wartości p dla obszaru pod charakterystyką operatora odbiornika (ROC). Mam zmienną ciągłą i wynik testu diagnostycznego. Chcę sprawdzić, czy AUROC jest statystycznie istotny. Znalazłem wiele pakietów zajmujących się krzywymi ROC: pROC, ROCR, caTools, weryfikacja, Epi. Ale nawet po wielu godzinach spędzonych na czytaniu dokumentacji …
13 r  p-value  roc 

1
Logma sprzężona z Gamma GLM a logarytmiczny Gaussian GLM a logarytm transformowany LM
Z moich wyników wynika, że ​​GLM Gamma spełnia większość założeń, ale czy jest to opłacalne ulepszenie w stosunku do transformowanego logarytmicznie LM? Większość literatury, którą znalazłem, dotyczyła Poissona lub dwumianowego GLM. Uważam, że artykuł OCENA OGÓLNYCH ZAŁOŻEŃ MODELI LINIOWYCH Z WYKORZYSTANIEM LANDOMIZACJI jest bardzo przydatny, ale brakuje w nim faktycznych …

5
Wielokrotna imputacja brakujących wartości
Chciałbym użyć imputacji do zastąpienia brakujących wartości w moim zbiorze danych z pewnymi ograniczeniami. Na przykład chciałbym, aby zmienna przypisana x1była większa lub równa sumie moich dwóch innych zmiennych, powiedzmy x2i x3. Chcę też x3zostać przypisany przez jeden 0lub >= 14i chcę x2zostać przypisany przez jeden 0lub >= 16. Próbowałem …

4
Rozróżnienie między modelem liniowym a nieliniowym
Przeczytałem kilka wyjaśnień na temat właściwości modeli liniowych vs nieliniowych, ale czasami nie jestem pewien, czy model pod ręką jest liniowy czy nieliniowy. Na przykład, czy następujący model jest liniowy czy nieliniowy? yt=β0+β1B(L;θ)Xt+εtyt=β0+β1B(L;θ)Xt+εty_t=\beta_0 + \beta_1B(L;\theta)X_t+\varepsilon_t Z: B(L;θ)=∑k=1Kb(k;θ)LkB(L;θ)=∑k=1Kb(k;θ)LkB(L;\theta)=\sum_{k=1}^{K}b(k;\theta)L^k LkXt=Xt−kLkXt=Xt−kL^kX_t=X_{t-k} Gdzie reprezentuje (rozkładającą się) wykładniczą funkcję wielomianową modelu Almon:b(k;θ)b(k;θ)b(k;\theta) b ( k …


1
Warunki istnienia matrycy informacyjnej Fishera
Różne podręczniki przytaczają różne warunki istnienia matrycy informacyjnej Fishera. Kilka takich warunków wymieniono poniżej, z których każdy pojawia się w niektórych, ale nie we wszystkich, definicjach „matrycy informacji Fishera”. Czy istnieje standardowy, minimalny zestaw warunków? Z 5 poniższych warunków, które można usunąć? Jeśli można spełnić jeden z warunków, dlaczego według …


4
Jak wybrać początkowe wartości dopasowania nieliniowego najmniejszego kwadratu
Powyższe pytanie mówi wszystko. Zasadniczo moje pytanie dotyczy ogólnej funkcji dopasowania (może być arbitralnie skomplikowane), która będzie nieliniowa w parametrach, które próbuję oszacować, w jaki sposób wybrać wartości początkowe, aby zainicjować dopasowanie? Próbuję robić nieliniowe najmniejsze kwadraty. Czy jest jakaś strategia lub metoda? Czy zostało to zbadane? Jakieś referencje? Czy …

2
Zależność między współczynnikami korelacji phi, Matthewsa i Pearsona
Czy współczynniki korelacji phi i Matthewsa to ta sama koncepcja? W jaki sposób są one powiązane lub równoważne ze współczynnikiem korelacji Pearsona dla dwóch zmiennych binarnych? Zakładam, że wartości binarne to 0 i 1. Korelacja Pearsona między dwiema zmiennymi losowymi Bernoulliego i wynosi:xxxyyy ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]−−−−−−−−−−√=E[xy]−E[x]E[y]Var[x]Var[y]−−−−−−−−−−√=n11n−n1∙n∙1n0∙n1∙n∙0n∙1−−−−−−−−−−√ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]=E[xy]−E[x]E[y]Var[x]Var[y]=n11n−n1∙n∙1n0∙n1∙n∙0n∙1 \rho = \frac{\mathbb{E} [(x - \mathbb{E}[x])(y …

1
Czy można porównywać wartości AIC, o ile modele są oparte na tym samym zestawie danych?
Robię prognozowanie w R, używając pakietu prognozy Roba Hyndmana . Papier należący do paczki można znaleźć tutaj . W artykule, po wyjaśnieniu algorytmów automatycznego prognozowania, autorzy implementują algorytmy na tym samym zbiorze danych. Jednak po oszacowaniu zarówno wygładzania wykładniczego, jak i modelu ARIMA, formułują stwierdzenie, którego nie rozumiem (na stronie …

3
Alternatywa dla jednokierunkowej wariancji ANOVA
Chciałbym porównać średnie dla trzech grup równych rozmiarów (równy rozmiar próbki jest mały, 21). Średnie każdej grupy są normalnie rozmieszczone, ale ich wariancje są nierówne (testowane przez Levene'a). Czy transformacja jest najlepszą drogą w tej sytuacji? Czy powinienem najpierw rozważyć coś jeszcze?

1
Zrozumienie MCMC i algorytmu Metropolis-Hastings
W ciągu ostatnich kilku dni starałem się zrozumieć, jak działa Markov Chain Monte Carlo (MCMC). W szczególności starałem się zrozumieć i wdrożyć algorytm Metropolis-Hastings. Do tej pory myślę, że mam ogólne zrozumienie algorytmu, ale jest kilka rzeczy, które nie są dla mnie jeszcze jasne. Chcę użyć MCMC, aby dopasować niektóre …

3
Ogólna pozycja z wielu list rankingowych
Przejrzałem wiele literatury dostępnej online, w tym forum bez powodzenia i mając nadzieję, że ktoś może pomóc w problemach statystycznych, z którymi się obecnie spotykam: Mam 5 list danych rankingowych, każda zawierająca 10 pozycji w rankingu od pozycji 1 (najlepsza) do pozycji 10 (najgorsza). Ze względów kontekstowych 10 pozycji na …


3
Odległość euklidesowa i podobieństwo
Właśnie pracuję z książką Collective Intelligence (autor: Toby Segaran) i natknąłem się na euklidesową ocenę odległości. W książce autor pokazuje, jak obliczyć podobieństwo między dwiema tablicami rekomendacji (tj. .person×movie↦score)person×movie↦score)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) Oblicza odległość euklidesową dla dwóch osób i według p 2 d ( p 1 , p 2 …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.