Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Oczekiwana najlepsza możliwa wydajność zestawu danych
Powiedzmy, że mam prosty problem z uczeniem maszynowym, taki jak klasyfikacja. Z pewnymi punktami odniesienia w rozpoznawaniu obrazu lub dźwięku, jako człowiek jestem bardzo dobrym klasyfikatorem. Mam zatem intuicję, jak dobry może być klasyfikator. Ale przy dużej ilości danych jednym punktem jest to, że nie wiem, jak dobry jest klasyfikator, …

3
Błąd zależny od rozkładu odpowiedzi w losowej regresji leśnej
Używam pakietu randomForest w R (wersja R 2.13.1, randomForest wersja 4.6-2) do regresji i zauważyłem znaczące odchylenie w moich wynikach: błąd przewidywania zależy od wartości zmiennej odpowiedzi. Wysokie wartości są niedoszacowane, a niskie wartości są przeszacowane. Początkowo podejrzewałem, że jest to konsekwencja moich danych, ale następujący prosty przykład sugeruje, że …

1
Regresja wielokrotna z brakującą zmienną predykcyjną
Załóżmy, że otrzymaliśmy zestaw danych w postaci i . Zadanie polega na przewidywaniu na podstawie wartości . Szacujemy dwie regresje, w których: ( y,x1,x2), ⋯ ,xn)(y,x1,x2,⋯,xn)(y,x_{1},x_{2},\cdots, x_{n})( y,x1,x2), ⋯ ,xn - 1)(y,x1,x2,⋯,xn−1)(y,x_{1},x_{2},\cdots, x_{n-1})yyyxxxyy=fa1(x1, ⋯ ,xn - 1,xn)=fa2)(x1, ⋯ ,xn - 1)(1)(2)(1)y=f1(x1,⋯,xn−1,xn)(2)y=f2(x1,⋯,xn−1) \begin{align} y &=f_{1}(x_{1},\cdots, x_{n-1}, x_{n}) \tag{1} \\ y &=f_{2}(x_{1},\cdots, …

2
Dopasowanie mieszanego modelu Poissona GLM z losowym nachyleniem i punktem przecięcia
Obecnie pracuję nad serią modeli szeregów czasowych Poissona, próbując oszacować efekt zmiany sposobu zliczania (przejście z jednego testu diagnostycznego do drugiego), jednocześnie kontrolując inne trendy w czasie (powiedzmy ogólny wzrost w występowanie choroby). Mam dane dla wielu różnych stron. Chociaż majstrowałem również przy GAM, dopasowałem serię dość podstawowych GLM z …


1
Jaki model stanowi wyzwanie dla zestawu danych? (setki szeregów czasowych z dużą ilością zagnieżdżeń)
Mam dość skomplikowany zestaw danych do analizy i nie mogę znaleźć dla niego dobrego rozwiązania. Oto rzecz: 1. surowe dane są zasadniczo nagraniami owadów. Każda piosenka składa się z kilku serii, a każda seria składa się z podjednostek. Wszystkie osoby były rejestrowane przez 5 minut. Liczba serii i ich pozycja …

2
Korzystanie z modelu regresji do przewidywania: kiedy przestać?
Z moich miar eksperymentu obliczyłem prosty model regresji liniowej w celu wykonania prognoz. Przeczytałem, że nie należy obliczać prognoz dla punktów, które odbiegają zbyt daleko od dostępnych danych. Nie znalazłem jednak żadnych wskazówek, które pomogłyby mi dowiedzieć się, jak daleko mogę ekstrapolować. Na przykład, jeśli obliczę prędkość odczytu dla dysku …

3
Wybór splajnu df w ogólnym addytywnym problemie modelu Poissona
Dopasowuję niektóre dane szeregów czasowych za pomocą ogólnego modelu addytywnego Poissona za pomocą SAS PROC GAM. Mówiąc ogólnie, mam wbudowaną uogólnioną procedurę walidacji krzyżowej, która generuje co najmniej przyzwoity „punkt początkowy” dla mojego pojedynczego splajnu, który jest nieliniową funkcją czasu wraz z jednym terminem parametrycznym (tym, który I tak naprawdę …

1
Jak dopasować model Bradley – Terry – Luce w R, bez skomplikowanej formuły?
Model Bradleya-Terry'ego-Luce (BTL) stwierdza, że , gdzie to prawdopodobieństwo, że obiekt zostanie oceniony jako „lepszy”, cięższe itp., niż obiekt oraz i są parametrami.pj i= l o gjat- 1(δjot-δja)pjotja=losoljat-1(δjot-δja)p_{ji} = logit^{-1}(\delta_j - \delta_i)pI jpjajotp_{ij}jotjotjjajaiδjaδja\delta_iδjotδjot\delta_j Wydaje się, że jest to kandydat na funkcję glm, z rodziną = dwumianową. Jednak wzór byłby podobny …

3
Czym jest RMSE znormalizowany przez średnią obserwowaną wartość o nazwie?
Używam Root Mean Squared Error(RMSE) do pomiaru dokładności wartości przewidywanych przy użyciu modelu. Rozumiem, że zwrócona wartość wykorzystuje jednostki moich miar (a nie procent). Chciałbym jednak podać moje wartości procentowe. Podejście, które podjąłem, polega na normalizacji RMSEśredniej wartości moich obserwacji. Czy istnieje termin RMSE/mean?

3
auto.arima ostrzega NaNs wytworzone przy błędzie standardowym
Moje dane to szereg czasowy zatrudnionej populacji, L i przedział czasu, rok. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 In-sample …
9 r  regression  arima 

1
Przewiduj poissony GLM z przesunięciem
Wiem, że to prawdopodobnie podstawowe pytanie ... Ale nie wydaje mi się, aby znaleźć odpowiedź. Dopasowuję GLM do rodziny Poisson, a następnie próbowałem przyjrzeć się prognozom, jednak wydaje się, że uwzględniono przesunięcie: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") Dostaję skrzynki, a nie stawki ... Próbowałem też model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003)+ offset(log(population)), …

2
Jak symulować powtarzane pomiary wyników na wielu odmianach w R?
@whuber zademonstrował, jak symulować wyniki na wielu odmianach (y1y1y_1, y2)y2y_2, i y3)y3y_3) za jeden punkt czasowy. Jak wiemy, dane podłużne często pojawiają się w badaniach medycznych. Moje pytanie brzmi: w jaki sposób symulować wyniki wielokrotnych wyników wielowymiarowych w R? Na przykład wielokrotnie mierzymyy1y1y_1, y2)y2y_2, i y3)y3y_3 w 5 różnych punktach …

1
Jak uzyskać granice decyzji z liniowej SVM w R?
Potrzebuję pakietu, który może dać mi równanie dla liniowego modelu SVM. Obecnie używam e1071 tak: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset Nie jestem jednak pewien, w jaki sposób e1071::svm()wybiera klasy dodatnie i ujemne, więc myślę, …
9 r  svm  e1071 

3
Częstochowskie rozumowanie i uwarunkowania na podstawie obserwacji (przykład Wagenmakers i in.)
Nie jestem ekspertem w dziedzinie statystyki, ale zdaję sobie sprawę, że istnieje spór, czy „częstokształtna” czy „bayesowska” interpretacja prawdopodobieństwa jest „słuszna”. Od Wagenmakers i in. al p. 183: Rozważ równomierny rozkład ze średnią i szerokością . Narysuj dwie wartości losowo z tej dystrybucji, etykieta najmniejszy oraz największy , i sprawdzić, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.