Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Współczynnik wiarygodności dziennika w podsumowaniu dokumentu
Początkowo zapytałem o to w przypadku przepełnienia stosu i zostałem skierowany do tej witryny, więc oto: Wdrażam niektóre nienadzorowane metody podsumowywania dokumentów w oparciu o selekcję / ekstrakcję treści i jestem zdezorientowany tym, co mój podręcznik nazywa „współczynnikiem wiarygodności dziennika”. Książka „ Przetwarzanie mowy i języka” Jurafsky'ego i Martina w …

4
Skalowanie danych o różnych rzędach wielkości do wydruku
Patrząc na następujący zestaw danych: Date Visits Carts carts Orders Created converted Created 2011-11-11 12277 161 9 36 2011-11-12 11871 93 5 19 2011-11-13 13072 107 8 8 2011-11-14 13594 112 4 34 2011-11-15 12741 129 8 43 2011-11-16 15491 261 16 57 2011-11-17 13418 186 17 42 Zostałem poproszony …

2
Cross Validation dla modeli mieszanych?
Mój kolega i ja dopasowujemy zakres liniowych i nieliniowych modeli efektu mieszanego w R. Jesteśmy proszeni o przeprowadzenie weryfikacji krzyżowej dopasowanych modeli, aby można było zweryfikować, czy zaobserwowane efekty są względnie ogólne. Zwykle jest to trywialne zadanie, ale w naszym przypadku musimy podzielić całe dane na część szkoleniową i część …

1
Ręczne obliczanie PACF
Próbuję powtórzyć obliczenia wykonywane przez SAS i SPSS dla częściowej funkcji autokorelacji (PACF). W SAS jest produkowany przez Proc Arima. Wartości PACF są współczynnikami autoregresji szeregu zainteresowania w stosunku do opóźnionych wartości szeregu. Moją zmienną zainteresowania jest sprzedaż, dlatego obliczam lag1, lag2 ... lag12 i uruchamiam następującą regresję OLS: Yt=za0+za1Yt …


3
Problem z oszacowaniem w śledzeniu GPS
Problem: Rozważ dwa samochody (traktowane jako obiekty punktowe) o nazwie lider i obserwator , oba wyposażone w urządzenia GPS, które komunikują się ze sobą. Celem jest podążanie za tak blisko, jak to możliwe, ponieważ ten ostatni porusza się arbitralnie na płaszczyźnie. Biorąc pod uwagę, że wszystkie urządzenia GPS mają rozkład …

1
Obliczanie niezawodności między oceniającymi w R przy zmiennej liczbie ocen?
Wikipedia sugeruje, że jednym ze sposobów spojrzenia na wiarygodność między oceniającymi jest zastosowanie modelu efektów losowych do obliczenia korelacji wewnątrzklasowej . Przykład korelacji wewnątrzklasowej mówi o spojrzeniu σ2)ασ2)α+σ2)ϵσα2σα2+σϵ2\frac{\sigma_\alpha^2}{\sigma_\alpha^2+\sigma_\epsilon^2} z modelu YI j= μ +αja+ϵI jYij=μ+αi+ϵijY_{ij} = \mu + \alpha_i + \epsilon_{ij} „gdzie Y ij jest j th obserwacji w i …

4
Znajdź przedziały gęstości prawdopodobieństwa
Mam wektor x <- c(1,2,3,4,5,5,5,6,6,6,6, 7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7, 7,7,7,7,7,7,7,7,8,8,8,8,9,9,9,10) (mój rzeczywisty wektor ma długość> 10 000) i chciałbym znaleźć przedziały, w których leży 90% gęstości. Czy quantile(x, probs=c(0.05,0.95), type=5)jest najbardziej odpowiedni, czy jest jakiś inny sposób?
9 r 




1
Linie przerywane na wykresie ACF w R.
Przeglądam książkę „Introductory Time Series with R” autorstwa Cowpertwait i Metcalfe. Na stronie 36 Napisano, że wiersze znajdują się w: . Przeczytałem tutaj R forum, że wiersze są na . - 1 / n ± 2 /n--√−1/n±2/n-1/n \pm 2/\sqrt{n}± 1,96 /n--√±1.96/n\pm 1.96/\sqrt{n} Uruchomiłem następujący kod: b = c(3,1,4,1) acf(b) i …
9 r  time-series 

1
Jak obliczyć dla statystyk zamówień o rozkładzie jednolitym?
Próbuję rozwiązać problem z moją tezą i nie widzę, jak to zrobić. Mam 4 obserwacje losowo wzięte z jednolitego rozkładu. Chcę obliczyć prawdopodobieństwo, że . jest statystyką i-tego rzędu (biorę statystykę porządku, aby moje obserwacje były uszeregowane od najmniejszej do największej). Rozwiązałem to dla prostszej sprawy, ale tutaj zagubiłem się, …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.