Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Wybór modelu Boxa-Jenkinsa
Procedura wyboru modelu Boxa-Jenkinsa w analizie szeregów czasowych rozpoczyna się od przyjrzenia się funkcjom autokorelacji i częściowej autokorelacji w serii. Te wykresy mogą sugerować odpowiednie i q w modelu ARMA ( p , q ) . Procedura jest kontynuowana, prosząc użytkownika o zastosowanie kryteriów AIC / BIC w celu wybrania …


2
Przykłady eksploracji tekstu za pomocą R (pakiet tm)
Spędziłem trzy dni, bawiąc się tmpo przeczytaniu dokumentu roboczego przez znajomego, w którym zbadał korpus tekstowy za pomocą UCINET, pokazując chmury tekstowe, dwumodowe wykresy sieciowe i rozkład pojedynczej wartości (z grafiką, przy użyciu Staty). Wystąpiło wiele problemów: w systemie Mac OS X występują problemy z Javą za bibliotekami takimi jak …
14 r  text-mining 

1
Jak obliczyć błąd prognozy (przedziały ufności) dla bieżących okresów?
Często muszę prognozować przyszłe okresy w miesięcznych seriach danych. Dostępne są formuły do ​​obliczania przedziału ufności dla alfa dla następnego okresu w szeregu czasowym, ale nigdy nie obejmuje to sposobu traktowania drugiego okresu, trzeciego okresu itp. Wyobrażam sobie wizualnie, że jeśli jakakolwiek prognoza byłaby wykreślona z górnymi i dolnymi przedziałami …

1
Jak dostroić wygładzanie w modelu GAM mgcv
Próbuję dowiedzieć się, jak kontrolować parametry wygładzania w modelu mgcv: gam. Mam zmienną dwumianową, którą próbuję zamodelować jako przede wszystkim funkcję współrzędnych xiy na ustalonej siatce plus kilka innych zmiennych o mniejszych wpływach. W przeszłości zbudowałem dość dobry model regresji lokalnej, używając locfit pakietu i tylko wartości (x, y). Chciałbym …
14 r  smoothing  mgcv 

3
lub
Czy ktoś używa metryk L1L1L_1 lub L.5L.5L_.5 do grupowania, a nie L2L2L_2 ? Aggarwal i wsp., O zaskakującym zachowaniu wskaźników odległości w przestrzeni wielowymiarowej powiedział (w 2001) jest konsekwentnie bardziej preferowany niż metryczny euklidesowy wskaźnik odległości L 2 dla aplikacji eksploracji danych o dużych wymiarachL1L1L_1L2L2L_2 i twierdził, że lub L …

5
Oprogramowanie (lub aplikacje internetowe) do nauczania statystyk dzieci lub prawdopodobieństwa?
Chciałbym (w odległej przyszłości) uczyć statystyki dzieci. Jeśli o to chodzi, chętnie poznam oprogramowanie (oczywiście dążę do FOSS) lub aplikacji internetowych, które są pomocne w wyjaśnianiu statystycznych / probabilistycznych pomysłów dzieciom (lub dorosłym). Może to być używane przez instruktora, dzieci lub jedno i drugie. Sugerowany format odpowiedzi: nazwa oprogramowania, co …


2
Intuicyjne wyjaśnienie stacjonarności
Przez jakiś czas walczyłem ze stacjonarnością w głowie ... Czy tak o tym sądzisz? Wszelkie uwagi i dalsze przemyślenia będą mile widziane. Proces stacjonarny to taki, który generuje wartości szeregów czasowych takie, że średnia rozkład i wariancja są utrzymywane na stałym poziomie. Ściśle mówiąc, jest to znane jako słaba forma …


1
Kiedy chcesz korzystać z AdaBoost?
Jak słyszałem o klasyfikatorze AdaBoost, o którym wielokrotnie wspominałem w pracy, chciałem lepiej zrozumieć, jak działa i kiedy można go użyć. Przeczytałem wiele artykułów i samouczków na ten temat, które znalazłem w Google, ale są pewne aspekty klasyfikatora, które wciąż nie mogę zrozumieć: Większość samouczków, które widziałem, mówi o AdaBoost …


7
Czy warto modelować krótkie serie czasowe?
Oto kontekst. Interesuje mnie określenie, w jaki sposób dwie zmienne środowiskowe (temperatura, poziomy składników odżywczych) wpływają na średnią wartość zmiennej odpowiedzi w okresie 11 lat. W ciągu każdego roku dostępne są dane z ponad 100 000 lokalizacji. Celem jest ustalenie, czy w ciągu 11 lat średnia wartość zmiennych odpowiedzi zareagowała …

1
Mieszanie i korelacja w sekwencjach niskiej rozbieżności (Halton / Sobol)
Obecnie pracuję nad projektem, w którym generuję wartości losowe przy użyciu zestawów punktów o niskiej rozbieżności / quasi-losowych , takich jak zestawy punktów Halton i Sobol. Są to zasadniczo wektory ddd wymiarowe, które naśladują zmienne ddd wymiarowe jednolite (0,1), ale mają lepszy rozkład. Teoretycznie mają one pomóc w zmniejszeniu wariancji …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.