Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy powinienem podejmować decyzje w oparciu o miary uśrednione w skali mikro lub średnio?
Przeprowadziłem 10-krotną weryfikację krzyżową różnych algorytmów klasyfikacji binarnej, z tym samym zestawem danych, i otrzymałem uśrednione wyniki Mikro- i Makro. Należy wspomnieć, że był to problem klasyfikacji wielu marek. W moim przypadku prawdziwe negatywy i prawdziwe pozytywy są ważone jednakowo. Oznacza to, że prawidłowe przewidywanie prawdziwych negatywów jest równie ważne, …

1
Dlaczego quasi-Poissona w GLM nie traktuje się jako specjalnego przypadku ujemnego dwumianu?
Próbuję dopasować uogólnione modele liniowe do niektórych zestawów danych zliczania, które mogą być rozproszone lub nie. Dwa obowiązujące tutaj rozkłady kanoniczne to Poisson i ujemny dwumianowy (Negbin), z EV i wariancjąμμ\mu V.rP.= μVarP=μVar_P = \mu V.rN.b= μ + μ2)θVarNB=μ+μ2θVar_{NB} = \mu + \frac{\mu^2}{\theta} który może być wyposażony w R z …

3
Rozkład różnicy między dwoma rozkładami normalnymi
Mam dwie funkcje gęstości prawdopodobieństwa rozkładów normalnych: f1(x1|μ1,σ1)=1σ12π−−√e−(x−μ1)22σ21f1(x1|μ1,σ1)=1σ12πe−(x−μ1)22σ12f_1(x_1 \; | \; \mu_1, \sigma_1) = \frac{1}{\sigma_1\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_1)^2}{2\sigma_1^2} } i f2(x2|μ2,σ2)=1σ22π−−√e−(x−μ2)22σ22f2(x2|μ2,σ2)=1σ22πe−(x−μ2)22σ22f_2(x_2 \; | \; \mu_2, \sigma_2) = \frac{1}{\sigma_2\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_2)^2}{2\sigma_2^2} } Szukam funkcji gęstości prawdopodobieństwa separacji między i . Myślę, że to oznacza, że ​​szukam funkcji gęstości …


4
Dlaczego mieszane dane stanowią problem dla algorytmów klastrowych opartych na euklidesie?
Większość klasycznych algorytmów grupowania i zmniejszania wymiarów (grupowanie hierarchiczne, analiza głównych składników, średnie k, samoorganizujące się mapy ...) są zaprojektowane specjalnie dla danych liczbowych, a ich dane wejściowe są postrzegane jako punkty w przestrzeni euklidesowej. Jest to oczywiście problem, ponieważ wiele rzeczywistych pytań obejmuje mieszane dane: na przykład, jeśli studiujemy …



4
Jak obliczyć przedziały ufności dla rozkładu niestandardowego?
Mam 383 próbki, które mają duże odchylenie dla niektórych wspólnych wartości, jak obliczyć 95% CI dla średniej? Obliczony przeze mnie wskaźnik CI wydaje się bardzo odległy, co zakładam, ponieważ moje dane nie wyglądają jak krzywa podczas tworzenia histogramu. Myślę więc, że muszę użyć czegoś takiego jak ładowanie systemu, którego nie …

2
W prostej regresji liniowej, skąd bierze się wzór na wariancję reszt?
Zgodnie z tekstem, którego używam, wzór na wariancję reszty podaje:ithithi^{th} σ2(1−1n−(xi−x¯¯¯)2Sxx)σ2(1−1n−(xi−x¯)2Sxx)\sigma^2\left ( 1-\frac{1}{n}-\frac{(x_{i}-\overline{x})^2}{S_{xx}} \right ) I trudno w wierzyć od końcowa jest różnica pomiędzy obserwowanych wartości i wartość zmontowanym; jeśliby obliczyć wariancję różnicy, przynajmniej oczekiwałbym pewnych „plusów” w wynikowym wyrażeniu. Każda pomoc w zrozumieniu pochodnej będzie mile widziana.ithithi^{th}ithithi^{th}ithithi^{th}

3
Znaczenie „liczby parametrów” w AIC
Podczas obliczania AIC AIC=2k−2lnLAIC=2k−2lnLAIC = 2k - 2 ln L k oznacza „liczbę parametrów”. Ale co liczy się jako parametr? Na przykład w modelu y=ax+by=ax+by = ax + b Czy aib są zawsze liczone jako parametry? Co jeśli nie dbam o wartość przechwytywania, czy mogę to zignorować, czy nadal się …
21 aic 


2
Jak opisać lub wizualizować model wielokrotnej regresji liniowej
Próbuję dopasować model wielokrotnej regresji liniowej do moich danych za pomocą kilku parametrów wejściowych, powiedzmy 3. F(x)F(x)=Ax1+Bx2+Cx3+dor=(A B C)T(x1 x2 x3)+d(i)(ii)(i)F(x)=Ax1+Bx2+Cx3+dor(ii)F(x)=(A B C)T(x1 x2 x3)+d\begin{align} F(x) &= Ax_1 + Bx_2 + Cx_3 + d \tag{i} \\ &\text{or} \\ F(x) &= (A\ B\ C)^T (x_1\ x_2\ x_3) + d \tag{ii} \end{align} …

2
Co oznacza standardowy błąd oszacowania maksymalnego prawdopodobieństwa?
Jestem matematykiem, samokształcącym się statystyką i walczącym szczególnie z językiem. W książce, której używam, występuje następujący problem: Losowa zmienna jest podana jako -dystrybucja z . (Oczywiście ze względu na to pytanie można wziąć dowolny rozkład w zależności od jednego parametru). Następnie podaje się próbkę pięciu wartości , , , , …

2
Jeśli grupowanie k-średnich jest formą modelowania mieszanki Gaussa, czy można go zastosować, gdy dane nie są normalne?
Czytam Bishopa o algorytmie EM dla GMM i związku między GMM a k-średnich. W tej książce jest napisane, że k-średnich jest trudną wersją GMM. Zastanawiam się, czy to implikuje, że jeśli dane, które próbuję skupić, nie są gaussowskie, nie mogę użyć k-średnich (a przynajmniej nie nadaje się do użycia)? Na …

1
Dwa sposoby wykorzystania bootstrap do oszacowania przedziału ufności współczynników w regresji
model liniowy do moich danych: yja= β0+ β1xja+ ϵja,ϵja∼ N.( 0 , σ2)) .yi=β0+β1xi+ϵi,ϵi∼N(0,σ2). y_{i}=\beta_{0}+\beta_{1}x_{i}+\epsilon_{i}, \quad\epsilon_{i} \sim N(0,\sigma^{2}). Chciałbym oszacować przedział ufności (CI) współczynników ( , ) za pomocą metody bootstrap. Istnieją dwa sposoby zastosowania metody ładowania początkowego: β 1β0β0\beta_{0}β1β1\beta_{1} Próbka sparowanego predyktora odpowiedzi: Losowo ponownie pary i zastosuj regresję …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.