Powiedzmy, że mam prosty problem z uczeniem maszynowym, taki jak klasyfikacja. Z pewnymi punktami odniesienia w rozpoznawaniu obrazu lub dźwięku, jako człowiek jestem bardzo dobrym klasyfikatorem. Mam zatem intuicję, jak dobry może być klasyfikator. Ale przy dużej ilości danych jednym punktem jest to, że nie wiem, jak dobry jest klasyfikator, …
Używam pakietu randomForest w R (wersja R 2.13.1, randomForest wersja 4.6-2) do regresji i zauważyłem znaczące odchylenie w moich wynikach: błąd przewidywania zależy od wartości zmiennej odpowiedzi. Wysokie wartości są niedoszacowane, a niskie wartości są przeszacowane. Początkowo podejrzewałem, że jest to konsekwencja moich danych, ale następujący prosty przykład sugeruje, że …
Załóżmy, że otrzymaliśmy zestaw danych w postaci i . Zadanie polega na przewidywaniu na podstawie wartości . Szacujemy dwie regresje, w których: ( y,x1,x2), ⋯ ,xn)(y,x1,x2,⋯,xn)(y,x_{1},x_{2},\cdots, x_{n})( y,x1,x2), ⋯ ,xn - 1)(y,x1,x2,⋯,xn−1)(y,x_{1},x_{2},\cdots, x_{n-1})yyyxxxyy=fa1(x1, ⋯ ,xn - 1,xn)=fa2)(x1, ⋯ ,xn - 1)(1)(2)(1)y=f1(x1,⋯,xn−1,xn)(2)y=f2(x1,⋯,xn−1) \begin{align} y &=f_{1}(x_{1},\cdots, x_{n-1}, x_{n}) \tag{1} \\ y &=f_{2}(x_{1},\cdots, …
Obecnie pracuję nad serią modeli szeregów czasowych Poissona, próbując oszacować efekt zmiany sposobu zliczania (przejście z jednego testu diagnostycznego do drugiego), jednocześnie kontrolując inne trendy w czasie (powiedzmy ogólny wzrost w występowanie choroby). Mam dane dla wielu różnych stron. Chociaż majstrowałem również przy GAM, dopasowałem serię dość podstawowych GLM z …
Czytam A. Agresti (2007), An Introduction to Categorical Data Analysis , 2nd. wydanie i nie jestem pewien, czy dobrze rozumiem ten ustęp (p.106, 4.2.1) (chociaż powinno to być łatwe): W Tabeli 3.1 dotyczącej chrapania i chorób serca w poprzednim rozdziale 254 pacjentów zgłaszało chrapanie każdej nocy, z czego 30 miało …
Mam dość skomplikowany zestaw danych do analizy i nie mogę znaleźć dla niego dobrego rozwiązania. Oto rzecz: 1. surowe dane są zasadniczo nagraniami owadów. Każda piosenka składa się z kilku serii, a każda seria składa się z podjednostek. Wszystkie osoby były rejestrowane przez 5 minut. Liczba serii i ich pozycja …
Z moich miar eksperymentu obliczyłem prosty model regresji liniowej w celu wykonania prognoz. Przeczytałem, że nie należy obliczać prognoz dla punktów, które odbiegają zbyt daleko od dostępnych danych. Nie znalazłem jednak żadnych wskazówek, które pomogłyby mi dowiedzieć się, jak daleko mogę ekstrapolować. Na przykład, jeśli obliczę prędkość odczytu dla dysku …
Dopasowuję niektóre dane szeregów czasowych za pomocą ogólnego modelu addytywnego Poissona za pomocą SAS PROC GAM. Mówiąc ogólnie, mam wbudowaną uogólnioną procedurę walidacji krzyżowej, która generuje co najmniej przyzwoity „punkt początkowy” dla mojego pojedynczego splajnu, który jest nieliniową funkcją czasu wraz z jednym terminem parametrycznym (tym, który I tak naprawdę …
Model Bradleya-Terry'ego-Luce (BTL) stwierdza, że , gdzie to prawdopodobieństwo, że obiekt zostanie oceniony jako „lepszy”, cięższe itp., niż obiekt oraz i są parametrami.pj i= l o gjat- 1(δjot-δja)pjotja=losoljat-1(δjot-δja)p_{ji} = logit^{-1}(\delta_j - \delta_i)pI jpjajotp_{ij}jotjotjjajaiδjaδja\delta_iδjotδjot\delta_j Wydaje się, że jest to kandydat na funkcję glm, z rodziną = dwumianową. Jednak wzór byłby podobny …
Używam Root Mean Squared Error(RMSE) do pomiaru dokładności wartości przewidywanych przy użyciu modelu. Rozumiem, że zwrócona wartość wykorzystuje jednostki moich miar (a nie procent). Chciałbym jednak podać moje wartości procentowe. Podejście, które podjąłem, polega na normalizacji RMSEśredniej wartości moich obserwacji. Czy istnieje termin RMSE/mean?
Moje dane to szereg czasowy zatrudnionej populacji, L i przedział czasu, rok. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 In-sample …
Wiem, że to prawdopodobnie podstawowe pytanie ... Ale nie wydaje mi się, aby znaleźć odpowiedź. Dopasowuję GLM do rodziny Poisson, a następnie próbowałem przyjrzeć się prognozom, jednak wydaje się, że uwzględniono przesunięcie: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") Dostaję skrzynki, a nie stawki ... Próbowałem też model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003)+ offset(log(population)), …
@whuber zademonstrował, jak symulować wyniki na wielu odmianach (y1y1y_1, y2)y2y_2, i y3)y3y_3) za jeden punkt czasowy. Jak wiemy, dane podłużne często pojawiają się w badaniach medycznych. Moje pytanie brzmi: w jaki sposób symulować wyniki wielokrotnych wyników wielowymiarowych w R? Na przykład wielokrotnie mierzymyy1y1y_1, y2)y2y_2, i y3)y3y_3 w 5 różnych punktach …
Potrzebuję pakietu, który może dać mi równanie dla liniowego modelu SVM. Obecnie używam e1071 tak: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset Nie jestem jednak pewien, w jaki sposób e1071::svm()wybiera klasy dodatnie i ujemne, więc myślę, …
Nie jestem ekspertem w dziedzinie statystyki, ale zdaję sobie sprawę, że istnieje spór, czy „częstokształtna” czy „bayesowska” interpretacja prawdopodobieństwa jest „słuszna”. Od Wagenmakers i in. al p. 183: Rozważ równomierny rozkład ze średnią i szerokością . Narysuj dwie wartości losowo z tej dystrybucji, etykieta najmniejszy oraz największy , i sprawdzić, …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.