Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak dopasować model mieszanki do grupowania
Mam dwie zmienne - X i Y i muszę ustawić klaster maksymalnie (i optymalnie) = 5. Załóżmy, że idealny wykres zmiennych wygląda następująco: Chciałbym zrobić z tego 5 klastrów. Coś takiego: Dlatego myślę, że jest to model mieszany z 5 klastrami. Każda grupa ma punkt środkowy i okrąg zaufania wokół …

2
Wartości P równe 0 w teście permutacji
Mam dwa zestawy danych i chciałbym wiedzieć, czy są one znacząco różne, czy nie (pochodzi od „ Dwie grupy są znacząco różne? Test do użycia ”). Zdecydowałem się użyć testu permutacji, wykonując następujące czynności w języku R: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # dataset1 lncrna <- lncrna[,1] …

2
Wyprowadzenie transformacji normalizującej dla GLM
\newcommand{\E}{\mathbb{E}} Jaka jest transformacja normalizująca dla rodziny wykładniczej pochodny? A(⋅)=∫duV1/3(μ)A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)} Mówiąc dokładniej : Próbowałem postępować zgodnie ze szkicem rozszerzenia Taylora na stronie 3, slajd 1 tutaj, ale mam kilka pytań. Gdy z rodziny wykładniczej, transformacja h (X) i \ kappa _i oznaczają i ^ {th} kumulant, slajdy twierdzą, …

1
Regresja w ustawieniu
Próbuję zobaczyć, czy wybrać regresję grzbietu , LASSO , regresję głównego składnika (PCR), czy częściowe najmniejsze kwadraty (PLS) w sytuacji, gdy istnieje duża liczba zmiennych / cech ( ppp ) i mniejsza liczba próbek ( n<pn<pn np>10np>10np>10n Zmienne ( i Y ) są skorelowane ze sobą w różnym stopniu.XXXYYY Moje …

4
Jak dziwna jest grupa wypadków lotniczych?
Oryginalne pytanie (7/25/14): Czy ten cytat z mediów informacyjnych ma sens, czy jest lepszy statystyczny sposób patrzenia na tempo ostatnich wypadków lotniczych? Jednak Barnett zwraca również uwagę na teorię rozkładu Poissona, co oznacza, że ​​krótkie przerwy między wypadkami są w rzeczywistości bardziej prawdopodobne niż długie. „Załóżmy, że zdarza się średnio …



3
Prognozowanie wariancji danych heteroscedastycznych
Próbuję wykonać regresję danych heteroscedastycznych, w których próbuję przewidzieć wariancje błędów, a także wartości średnie w odniesieniu do modelu liniowego. Coś takiego: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} Słowami, dane składa się z powtarzalnych pomiarów przy różnych wartościach i . Sądzę pomiary …


3
Sugestie dotyczące uczenia się z uwzględnieniem kosztów w warunkach wysoce niezrównoważonych
Mam zestaw danych z kilkoma milionami wierszy i ~ 100 kolumnami. Chciałbym wykryć około 1% przykładów w zestawie danych, które należą do wspólnej klasy. Mam ograniczenie minimalnej precyzji, ale z powodu bardzo asymetrycznego kosztu nie jestem zbytnio zainteresowany żadnym konkretnym wycofaniem (o ile nie mam 10 pozytywnych wyników!) Jakie są …


2
Regresja grzbietowa - interpretacja bayesowska
Słyszałem, że regresję grzbietu można wyprowadzić jako średnią rozkładu z tyłu, jeśli uprzednio zostanie odpowiednio wybrany. Czy intuicja, że ​​ograniczenia określone przez współczynniki regresji przez wcześniejsze (np. Standardowe rozkłady normalne około 0) są identyczne / zastępuje karę ustawioną na kwadrat wielkości współczynników? Czy przeor musi mieć charakter gaussowski, aby zachować …


3
SVM dla niezrównoważonych danych
Chcę spróbować użyć maszyn wektorów wsparcia (SVM) w moim zestawie danych. Zanim jednak spróbowałem rozwiązać problem, zostałem ostrzeżony, że maszyny SVM nie radzą sobie dobrze z bardzo niezrównoważonymi danymi. W moim przypadku mogę mieć aż 95-98% zera i 2-5% 1. Próbowałem znaleźć zasoby, które mówiły o używaniu SVM na rzadkich …

1
Co to znaczy wyjaśniać wariancję?
W szczególności zastanawiam się, dlaczego mamy tę koncepcję wielokrotności R (którą rozumiem jako korelację między obserwowanymi i przewidywanymi wynikami w regresji wielokrotnej), a następnie osobną koncepcję kwadratu R, który jest po prostu kwadratem lub R. Zostałem poinformowany, że R-kwadrat to wyjaśniona zmienność procentowa, a R nie, ale nie rozumiem rozróżnienia …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.