Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak znaleźć oczekiwaną odległość między dwoma równomiernie rozmieszczonymi punktami?
Gdybym miał zdefiniować współrzędne i gdzie(X1,Y1)(X1,Y1)(X_{1},Y_{1})(X2),Y2))(X2,Y2)(X_{2},Y_{2}) X1,X2)∼ Unif ( 0 , 30 ) i Y1,Y2)∼ Unif ( 0 , 40 ) .X1,X2∼Unif(0,30) and Y1,Y2∼Unif(0,40).X_{1},X_{2} \sim \text{Unif}(0,30)\text{ and }Y_{1},Y_{2} \sim \text{Unif}(0,40). Jak znajdę oczekiwaną wartość odległości między nimi? Myślałem, ponieważ odległość jest obliczana przez byłby oczekiwaną wartością po prostu bądź ?(X1-X2))2)+ …

1
Jak określić macierz kontrastu (w R) dla różnicy między jednym poziomem a średnią innych?
Mam model regresji, który wygląda następująco: Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y = \beta_0+\beta_1X_1 + \beta_2X_2 + \beta_3X_3 +\beta_{12}X_1X_2+\beta_{13}X_1X_3+\beta_{123}X_1X_2X_3 ... lub w notacji R: y ~ x1 + x2 + x3 + x1:x2 + x1:x3 + x1:x2:x3 Powiedzmy X1X1X_1 i X2X2X_2 są zmiennymi kategorialnymi i X3X3X_3jest liczbowy. Komplikacja jest takaX1X1X_1 ma trzy poziomy X1a,X1b,X1cX1a,X1b,X1cX_{1a}, X_{1b}, …
9 r  contrasts 

3
Testy równoważności dla danych nienormalnych?
Mam pewne dane, które niekoniecznie zakładam, że pochodzą z normalnych rozkładów i chciałbym przeprowadzić testy równoważności między grupami. W przypadku normalnych danych istnieją techniki takie jak TOST (dwa jednostronne testy t). Czy istnieje coś analogicznego do TOST dla danych niestandardowych?

3
Wybór klastrów dla k-średnich: przypadek 1 klastra
Czy ktoś zna dobrą metodę ustalenia, czy klastrowanie przy użyciu kmeans jest w ogóle odpowiednie? To znaczy, co jeśli twoja próbka jest rzeczywiście jednorodna? Wiem, że model mieszanki (za pośrednictwem mclust w R) zapewni statystyki dopasowania dla przypadku klastra 1: k, ale wydaje się, że wszystkie techniki oceny kmeans wymagają …
9 r  clustering  k-means 


1
Funkcja generowania momentu wewnętrznego iloczynu dwóch losowych wektorów gaussowskich
Czy ktoś może zasugerować, jak mogę obliczyć funkcję generującą moment wewnętrznego iloczynu dwóch losowych wektorów Gaussa, z których każdy jest rozłożony jako N.( 0 ,σ2))N.(0,σ2))\mathcal N(0,\sigma^2), niezależne od siebie? Czy jest dostępny jakiś standardowy wynik? Każdy wskaźnik jest bardzo ceniony.


3
Regresja do średniej łamigłówki
W rozdziale „Myślenie o średniej” Daniela Kahnemana podany jest przykład, a czytelnik jest proszony o prognozowanie sprzedaży poszczególnych sklepów, biorąc pod uwagę ogólną prognozę sprzedaży i liczby sprzedaży z poprzedniego roku . Na przykład (przykład książki ma 4 sklepy, używam tutaj 2 dla uproszczenia): Store 2011 2012 1 100 ? …

2
Zrozumienie wąsów z fabuły
Mam pytanie dotyczące interpretacji wąsów z fabuły. Przeczytałem: „U góry iu dołu prostokąta„ wąsy ”pokazują zakres 1,5-krotności odległości między kwantylami 0,25 i 0,75”, ale nie do końca rozumiem, co oznacza „odległość” . Nie może być tak, że chodzi o masę prawdopodobieństwa, ponieważ między kwantylem od 0,25 do 0,75 oczywiście zawsze …

2
Założenia uogólnionych modeli liniowych
Na stronie 232 „towarzysza R do regresji stosowanej” notatka Fox i Weisberg Tylko rodzina Gaussa ma stałą wariancję, a we wszystkich innych GLM wariancja warunkowa y w zależy odxx\bf{x}μ(x)μ(x)\mu(x) Wcześniej zauważają, że wariancja warunkowa Poissona wynosi a dwumianowa to .μμ\muμ(1−μ)Nμ(1−μ)N\frac{\mu(1-\mu)}{N} Dla Gaussa jest to znane i często sprawdzane założenie (homoscedastyczność). …


2
Jak mogę wyobrazić sobie znaczenie różnych danych wejściowych dla prognozy dla nieliniowego modelu czarnej skrzynki?
Buduję interaktywne narzędzie prognostyczne (w języku python) jako pomoc w prognozowaniu wykonywanym w mojej organizacji. Do tej pory proces prognozowania był w dużej mierze sterowany przez człowieka, a prognostycy asymilowali dane w swoich naturalnych sieciach neuronowych i wykorzystując swoje wyuczone wyczucie jelit do dokonywania prognoz. Z przeprowadzonej przeze mnie długoterminowej …


3
Obliczanie Jaccarda lub innego współczynnika asocjacji dla danych binarnych przy użyciu mnożenia macierzy
Chcę wiedzieć, czy istnieje jakikolwiek sposób obliczenia współczynnika Jaccard przy użyciu mnożenia macierzy. Użyłem tego kodu jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | x[,j])) jaccard[j,i]=jaccard[i,j] } } …

1
Kiedy uwzględnić efekt losowy w modelu
Jestem nowy w modelowaniu mieszanym i jestem zdezorientowany, czy należy zastosować losowy efekt w analizie, którą wykonuję. Wszelkie porady będą mile widziane. moje badanie bada, jak dobrze nowo opracowany wskaźnik liczebności ssaków może przewidzieć wartość ustalonego, ale bardziej pracochłonnego wskaźnika. Zmierzyłem te wskaźniki w wielu obszarach leśnych, z wieloma działkami …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.