Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Którego jądra SVM należy użyć do problemu klasyfikacji binarnej?
Jestem początkującym, jeśli chodzi o obsługę maszyn wektorowych. Czy istnieją jakieś wytyczne, które mówią, które jądro (np. Liniowe, wielomianowe) najlepiej nadaje się do określonego problemu? W moim przypadku muszę klasyfikować strony internetowe według tego, czy zawierają one określone informacje, czy nie, tj. Mam problem z klasyfikacją binarną. Czy możesz ogólnie …

3
Koncepcyjne rozróżnienie między heteroscedastycznością a niestacjonarnością
Mam problem z rozróżnieniem pojęć skrzeczności i stacjonarności. Jak rozumiem, heteroscedastyczność różni się zmiennością w subpopulacjach, a niestacjonarność jest zmieniającą się średnią / wariancją w czasie. Jeśli jest to prawidłowe (choć uproszczone) zrozumienie, czy niestacjonarność jest po prostu konkretnym przypadkiem heteroscedastyczności w czasie?

1
Ogromne współczynniki regresji logistycznej - co to znaczy i co robić?
Otrzymuję ogromne współczynniki podczas regresji logistycznej, patrz współczynniki z krajULKV: > summary(m5) Call: glm(formula = cbind(ml, ad) ~ rok + obdobi + kraj + resid_usili2 + rok:obdobi + rok:kraj + obdobi:kraj + kraj:resid_usili2 + rok:obdobi:kraj, family = "quasibinomial") Deviance Residuals: Min 1Q Median 3Q Max -2.7796 -1.0958 -0.3101 1.0034 2.8370 …

5
Reprezentowanie danych eksperymentalnych
Kłócę się z moim doradcą o wizualizację danych. Twierdzi, że reprezentując wyniki eksperymentalne, wartości należy narysować wyłącznie „ markerami ”, jak pokazano na poniższym obrazie. Podczas gdy krzywe powinny reprezentować tylko „ model ” Z drugiej strony uważam, że krzywa jest w wielu przypadkach niepotrzebna w celu ułatwienia czytelności, jak …


1
Obliczanie nieznanej wartości p
Niedawno debugowałem skrypt R i znalazłem coś bardzo dziwnego, autor zdefiniował własną funkcję wartości p pval <- function(x, y){ if (x+y<20) { # x + y is small, requires R.basic p1<- nChooseK(x+y,x) * 2^-(x+y+1); p2<- nChooseK(x+y,y) * 2^-(x+y+1); pvalue = max(p1, p2) } else { # if x+y is large, …

1
Znajdowanie rozkładu statystyki
Studiowanie do testu. Nie mogłem odpowiedzieć na to. Niech będzie iid zmiennych losowych. DefiniowaćX1 , ja,X2 , ja,X3 , ja, i = 1 , … , nX1,i,X2,i,X3,i,i=1,…,nX_{1,i},X_{2,i},X_{3,i}, i=1,\ldots,nN.( 0 , 1 )N(0,1)\mathcal{N}(0,1) W.ja= (X1 , ja+X2 , jaX3 , ja) /1 +X2)3 , ja-------√, i = 1 , … , …


2
„Zapomnienie” o przeorze w środowisku bayesowskim?
Jest dobrze wiadomo, że jak masz więcej dowodów (powiedzmy w postaci większej dla IID przykładach), Bayesa przed dostaje „zapomniał”, a większość wnioskowania jest wpływ dowodów (lub prawdopodobieństwa).nnnnnn Łatwo jest to zobaczyć w różnych konkretnych przypadkach (takich jak Bernoulli z wcześniejszą wersją Beta lub innymi typami przykładów) - ale istnieje sposób, …
9 bayesian  prior 

1
Zamieszanie związane z liniowymi układami dynamicznymi
Czytałem tę książkę Bishopa: Rozpoznawanie wzorców i uczenie maszynowe. Miałem zamieszanie związane z wyprowadzeniem liniowego układu dynamicznego. W LDS zakładamy, że zmienne ukryte są ciągłe. Jeśli Z oznacza ukryte zmienne, a X oznacza obserwowane zmienne p(zn|zn−1)=N(zn|Azn−1,τ)p(zn|zn−1)=N(zn|Azn−1,τ)p(z_n|z_{n-1}) = N(z_n|Az_{n-1},\tau) p(xn|zn)=N(xn,Czn,Σ)p(xn|zn)=N(xn,Czn,Σ)p(x_n|z_n) = N(x_n,Cz_n,\Sigma) p(z1)=N(z1|u0,V0)p(z1)=N(z1|u0,V0)p(z_1) = N(z_1|u_0,V_0) W LDS do obliczenia tylnego rozkładu …

1
Centralne momenty rozkładów symetrycznych
Próbuję pokazać, że centralny moment rozkładu symetrycznego: wynosi zero dla liczb nieparzystych. Na przykład trzeci centralny momentZacząłem od pokazania, żeNie jestem pewien, dokąd się udać, jakieś sugestie? Czy jest lepszy sposób, aby to udowodnić?fax( a + x ) =fax( a - x )fx(a+x)=fx(a−x){\bf f}_x{\bf (a+x)} = {\bf f}_x{\bf(a-x)}E [ ( …



2
Interwał ocenzurowany model proporcjonalnych hazardów Coxa w R.
Biorąc pod uwagę czasy przeżycia ocenzurowane w odstępach, w jaki sposób mogę wykonać model ocenzurowanych interwałów Coxa PH R? Rseek search wyświetla pakiet intcox, którego już nie ma w Rrepozytorium. Jestem prawie pewien, że coxphfunkcja w survivalpakiecie nie może obsłużyć ocenzurowanych interwałów przeżycia. Nie chcę też przypisywać danych, a następnie …

2
Regresja SVM z danymi podłużnymi
Mam około 500 zmiennych na pacjenta, każda zmienna ma jedną stałą wartość i jest mierzona w trzech różnych punktach czasowych (po 2 miesiącach i po 1 roku). Za pomocą regresji chciałbym przewidzieć wynik leczenia nowych pacjentów. Czy można stosować regresję SVM z takimi danymi podłużnymi?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.