Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy istnieje funkcja w R, która pobiera znalezione centra klastrów i przypisuje klastry do nowego zestawu danych
Mam dwie części wielowymiarowego zestawu danych, nazwijmy je trainitest . Chcę zbudować model na podstawie zestawu danych pociągu, a następnie zweryfikować go na zestawie danych testowych. Liczba klastrów jest znana. Próbowałem zastosować klastrowanie k-średnich w R i otrzymałem obiekt zawierający centra klastrów: kClust <- kmeans(train, centers=N, nstart=M) Czy w R …
14 r  clustering  k-means 


4
Czy zastosowanie ARMA-GARCH wymaga stacjonarności?
Zamierzam użyć modelu ARMA-GARCH do finansowych szeregów czasowych i zastanawiałem się, czy seria powinna być stacjonarna przed zastosowaniem tego modelu. Wiem, że stosuję model ARMA, seria powinna być stacjonarna, jednak nie jestem pewien co do ARMA-GARCH, ponieważ uwzględniam błędy GARCH, które sugerują grupowanie zmienności i niestałą wariancję, a zatem szereg …


1
Test sumy rang Wilcoxona w R.
Mam wyniki tego samego testu zastosowane do dwóch niezależnych próbek: x <- c(17, 12, 13, 16, 9, 19, 21, 12, 18, 17) y <- c(10, 6, 15, 9, 8, 11, 8, 16, 13, 7, 5, 14) I chcę obliczyć test sumy rang Wilcoxona. Kiedy ręcznie obliczam statystykę , otrzymuję: T …

3
Wyjaśniono przekleństwo uczenia maszynowego dotyczące wymiarowości?
Mam problem ze zrozumieniem przekleństwa wymiarowości. W szczególności natknąłem się na to podczas wykonywania scikit-learnsamouczka w Pythonie. Czy ktoś może wyjaśnić poniżej w prostszy sposób? Przepraszam, staram się zrozumieć od dłuższego czasu i nie mogę zrozumieć, w jaki sposób wymyślili obliczenia liczby przykładów szkoleń, aby uzyskać skuteczny estymator KNN? Oto …

1
Zrozumienie Metropolis-Hastings z asymetrycznym rozkładem propozycji
Próbowałem zrozumieć algorytm Metropolis-Hastings, aby napisać kod do oszacowania parametrów modelu (tj. ). Według bibliografii algorytm Metropolis-Hastings ma następujące kroki:f(x)=a∗xf(x)=a∗xf(x)=a*x WygenerujYt∼q(y|xt)Yt∼q(y|xt)Y_t \sim q(y|x^t) Xt+1={Yt,xt,with probabilityρ(xt,Yt),with probability1−ρ(xt,Yt),Xt+1={Yt,with probabilityρ(xt,Yt),xt,with probability1−ρ(xt,Yt),X^{t+1}=\begin{cases} Y^t, & \text{with probability} \quad \rho(x^t,Y_t), \\ x^t, & \text{with probability} \quad 1-\rho(x^t,Y_t), \end{cases} gdzieρ(x,y)=min(f(y)f(x)∗q(x|y)q(y|x),1)ρ(x,y)=min(f(y)f(x)∗q(x|y)q(y|x),1)\rho(x,y)=\min \left( \frac{f(y)}{f(x)}*\frac{q(x|y)}{q(y|x)},1 \right) Jak chciałbym zadać kilka …

1
Losowy las i prognozy
Próbuję zrozumieć, jak działa Losowy Las. Rozumiem, jak buduje się drzewa, ale nie rozumiem, w jaki sposób Losowy Las przewiduje prognozy na podstawie próbki z torby. Czy ktoś mógłby mi podać proste wyjaśnienie? :)

3
Przedział ufności dla różnicy między proporcjami
Zastanawiam się, czy ktoś mógłby mi powiedzieć, czy poprawnie obliczyłem przedział ufności dla różnicy między dwiema proporcjami. Wielkość próby wynosi 34, z czego 19 to kobiety, a 15 to mężczyźni. Dlatego różnica w proporcjach wynosi 0,1176471. Obliczam 95% przedział ufności dla różnicy między -0,1183872 a 0,3536814. Gdy przedział ufności przechodzi …

1
Współczynniki regresji, czyli pytania o Kronmal
Niedawno losowe przeglądanie pytań wywołało wspomnienie podpowiedzi jednego z moich profesorów sprzed kilku lat ostrzegających o stosowaniu współczynników w modelach regresji. Zacząłem więc o tym czytać, prowadząc ostatecznie do Kronmal 1993. Chcę się upewnić, że poprawnie interpretuję jego sugestie dotyczące sposobu ich modelowania. Dla modelu o stosunku o tym samym …


2
Rzut monetą, procesy decyzyjne i wartość informacji
Wyobraź sobie następującą konfigurację: masz 2 monety, monetę A, która jest gwarantowana , oraz monetę B, która może, ale nie musi być uczciwa. Zostaniesz poproszony o wykonanie 100 rzutów monetą, a Twoim celem jest maksymalizacja liczby głów . Wcześniejsze informacje na temat monety B były takie, że została ona odwrócona …

1
R-kwadrat w odchyleniu wersetów w modelu liniowym w uogólnionym modelu liniowym?
Oto mój kontekst dla tego pytania: Z tego co mogę powiedzieć, nie możemy uruchomić zwykłej regresji metodą najmniejszych kwadratów w R, gdy używamy danych ważonych i surveypakietu. Tutaj musimy użyć svyglm(), który zamiast tego uruchamia uogólniony model liniowy (który może być tym samym? Jestem tutaj rozmyty pod względem tego, co …


2
Matematyka za drzewami klasyfikacji i regresji
Czy ktoś może wyjaśnić matematykę związaną z klasyfikacją w CART? Chcę zrozumieć, jak przebiegają dwa główne etapy. Na przykład przeszkoliłem klasyfikator CART na zestawie danych i użyłem testowego zestawu danych, aby oznaczyć jego predykcyjne działanie, ale: Jak wybiera się początkowy korzeń drzewa? Dlaczego i jak powstaje każda gałąź? Mój zestaw …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.