Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Podzbiór wektorów szeregów czasowych R.
Mam szereg czasowy i chcę go rozdzielić, zachowując go jako szereg czasowy, zachowując początek, koniec i częstotliwość. Załóżmy na przykład, że mam szereg czasowy: > qs <- ts(101:110, start=c(2009, 2), frequency=4) > qs Qtr1 Qtr2 Qtr3 Qtr4 2009 101 102 103 2010 104 105 106 107 2011 108 109 110 …
25 r  time-series 

1
Wyjaśnienie skończonego współczynnika korygującego
Rozumiem, że gdy próbkowanie ze skończonej populacji, a nasza próbka stanowi więcej niż 5% populacji, musimy skorygować średni i standardowy błąd próby za pomocą tego wzoru: faP.do= N- nN.- 1----√FPC=N−nN−1\hspace{10mm} FPC=\sqrt{\frac{N-n}{N-1}} Gdzie to wielkość populacji, a to wielkość próby.nN.NNnnn Mam 3 pytania dotyczące tej formuły: Dlaczego próg wynosi 5%? Jak …



3
Jakie zalety ma metryka Wassersteina w porównaniu do dywergencji Kullbacka-Leiblera?
Jaka jest praktyczna różnica między miarą Wassersteina a dywergencją Kullbacka-Leiblera ? Metryka Wassersteina jest również nazywana odległością przemieszczającego się Ziemi . Z Wikipedii: Metryka Wassersteina (lub Vasersteina) jest funkcją odległości zdefiniowaną między rozkładami prawdopodobieństwa w danej przestrzeni metrycznej M. i Rozbieżność Kullbacka – Leiblera jest miarą tego, jak jeden rozkład …

2
W jaki sposób „działa” regresja kwantylowa?
Mam nadzieję uzyskać intuicyjne i przystępne wyjaśnienie regresji kwantowej. Powiedzmy, że mam prosty zestaw danych wyniku i predyktorów .X 1 , X 2YYYX1, X2)X1,X2X_1, X_2 Jeśli na przykład uruchomię regresję przy 0,25, 0,5, 0,75 i odzyskam .β0 , .25, β1 , .25. . . β2 , 0,75β0,.25,β1,.25...β2,.75\beta_{0,.25},\beta_{1,.25}...\beta_{2,.75} Czy wartości znaleźć …

3
Analiza dziennych szeregów czasowych
Próbuję przeprowadzić analizę szeregów czasowych i jestem nowy w tej dziedzinie. Codziennie liczę wydarzenie z lat 2006-2009 i chcę dopasować do niego model szeregów czasowych. Oto postęp, który poczyniłem: timeSeriesObj = ts(x,start=c(2006,1,1),frequency=365.25) plot.ts(timeSeriesObj) Otrzymany wykres to: Aby sprawdzić, czy dane zawierają sezonowość i trendy, wykonuję kroki wymienione w tym poście …


3
Interpretowanie terminów interakcji w regresji logit ze zmiennymi kategorialnymi
Mam dane z eksperymentu ankietowego, w którym respondenci zostali losowo przydzieleni do jednej z czterech grup: > summary(df$Group) Control Treatment1 Treatment2 Treatment3 59 63 62 66 Podczas gdy trzy grupy terapeutyczne różnią się nieznacznie zastosowanym bodźcem, główne rozróżnienie, na którym mi zależy, dotyczy grup kontrolnych i leczonych. Zdefiniowałem więc zmienną …

5
Wprowadzenie do analizy przyczynowej
Jakie są dobre książki, które wprowadzają analizę przyczynową? Mam na myśli wprowadzenie, które objaśnia zasady analizy przyczynowej i pokazuje, w jaki sposób można zastosować różne metody statystyczne do zastosowania tych zasad.

3
Jakie są miary dokładności danych z wielu etykiet?
Zastanów się nad scenariuszem, w którym otrzymujesz matrycę znanych etykiet i predykowaną etykietę. Chciałbym zmierzyć dobroć macierzy PredictedLabel w porównaniu do matrycy FamousLabel. Wyzwanie polega jednak na tym, że Matryca Znanych Etykiet ma kilka wierszy tylko jeden 1, a kilka innych wierszy ma wiele 1 (te wystąpienia są oznaczone wieloma …

5
Procedura grupowania, w której każdy klaster ma taką samą liczbę punktów?
Że pewne punkty w , i chcę skupić punkty, aby:X={x1,...,xn}X={x1,...,xn}X=\{x_1,...,x_n\}RpRpR^p Każda grupa zawiera taką samą liczbę elementów . (Załóżmy, że liczba klastrów dzieli .)XXXnnn Każda klaster jest w pewnym sensie „przestrzennie spójny”, podobnie jak klastry z średnich.kkk Łatwo jest wymyślić wiele procedur klastrowania, które spełniają jedną lub drugą z nich, …


2
Dlaczego wariancja próbki zmienia się, jeśli obserwacje są powielone?
Mówi się, że wariancja jest miarą rozprzestrzeniania się. Pomyślałem więc, że wariancja 3,5jest równa wariancji, 3,3,5,5ponieważ liczby są równomiernie rozłożone. Ale tak nie jest, wariancja 3,5jest, 2podczas gdy wariancja 3,3,5,5jest 1 1/3. To mnie zastanawia, biorąc pod uwagę, że wariancja ma być miarą rozprzestrzeniania się. Więc w tym kontekście, co …
25 variance 

2
Jak działa intuicyjna obsługa regresji wektorowej?
Wszystkie przykłady SVM są związane z klasyfikacją. Nie rozumiem, w jaki sposób można użyć SVM do regresji (regressor wektora pomocniczego) w regresji. Z mojego zrozumienia, SVM maksymalizuje margines między dwiema klasami, aby znaleźć optymalną hiperpłaszczyznę. Jak mogłoby to działać w przypadku problemu regresji?
25 regression  svm 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.