Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Interpolacja Fouriera / trygonometryczna
tło W artykule Epsteina (1991): Przy uzyskiwaniu dziennych wartości klimatologicznych ze średnich miesięcznych podano formułę i algorytm obliczania interpolacji Fouriera dla wartości okresowych i równomiernych. W artykule celem jest uzyskanie dziennych wartości ze środków miesięcznych poprzez interpolację. W skrócie przyjmuje się, że nieznane wartości dzienne mogą być reprezentowane przez sumę …

2
Znalezienie wariancji estymatora dla maksymalnego prawdopodobieństwa rozkładu Poissona
Jeśli są identyczne z rozkładami Poissona z parametrem Wypracowałem, że maksymalne oszacowanie prawdopodobieństwa to dla danych . Dlatego możemy zdefiniować odpowiedni estymator Moje pytanie brzmi: jak opracowałbyś wariancję tego estymatora?K1,…,KnK1,…,KnK_1, \dots, K_nββ\betaβ^(k1,…,kn)=1n∑i=1nkiβ^(k1,…,kn)=1n∑i=1nki\hat\beta (k_1, \dots, k_n) = \frac{1}{n} \sum_{i=1}^n k_ik1,…,knk1,…,knk_1, \dots, k_nT=1n∑i=1nKi.T=1n∑i=1nKi.T = \frac{1}{n} \sum_{i=1}^n K_i . W szczególności, ponieważ każdy …

1
Prognozowanie za pomocą randomForest (R), gdy na niektórych wejściach brakuje wartości (NA)
Mam dokładny randomForestmodel klasyfikacji, którego chciałbym użyć w aplikacji, która przewiduje klasę nowego przypadku. W nowym przypadku nieuchronnie brakuje wartości. Prognozy nie będą działać jako takie dla NA. Jak mam to zrobić? data(iris) # create first the new case with missing values na.row<-45 na.col<-c(3,5) case.na<-iris[na.row,] case.na[,na.col]<-NA iris.rf <- randomForest(Species ~ …

2
Standardowy błąd nachyleń w częściowej regresji liniowej ze znanymi punktami przerwania
Sytuacja Mam zestaw danych z jednym zależnym yyy i jedna zmienna niezależna xxx. Chcę dopasować do ciągłej częściowej regresji liniowejkkk znane / ustalone punkty przerwania występujące w (za1,za2), ... ,zak)(a1,a2,…,ak)(a_{1}, a_{2}, \ldots, a_{k}). Breakpoins są znane bez wątpliwości, więc nie chcę ich szacować. Następnie dopasowuję regresję (OLS) formularza yja=β0+β1xja+β2)max(xja-za1, 0 …


1
Korzystanie z narzędzi do eksploracji tekstu / przetwarzania języka naturalnego w ekonometrii
Nie jestem pewien, czy to pytanie jest w pełni odpowiednie tutaj, jeśli nie, proszę usunąć. Jestem studentką ekonomii. W przypadku projektu badającego problemy z zakresu ubezpieczeń społecznych mam dostęp do dużej liczby administracyjnych spraw (> 200 tys.), Które dotyczą oceny kwalifikowalności. Raporty te można ewentualnie powiązać z indywidualnymi informacjami administracyjnymi. …

4
(interakcja) MCMC dla multimodalnego tylnej
Próbuję próbować z tyłu, mając wiele trybów szczególnie daleko od siebie za pomocą MCMC. Wygląda na to, że w większości przypadków tylko jeden z tych trybów zawiera 95% hpd, którego szukam. Próbowałem wdrożyć rozwiązania oparte na hartowanej symulacji, ale nie przynosi to zadowalających rezultatów, ponieważ w praktyce przejście z jednego …

2
Solidny estymator MCMC marginalnego prawdopodobieństwa?
Próbuję obliczyć krańcowe prawdopodobieństwo modelu statystycznego metodami Monte Carlo: fa( x ) = ∫fa( x ∣ θ ) π( θ )reθfa(x)=∫fa(x∣θ)π(θ)reθf(x) = \int f(x\mid\theta) \pi(\theta)\, d\theta Prawdopodobieństwo jest dobrze zachowane - gładkie, wklęsłe - ale wysokie. Próbowałem ważnego próbkowania, ale wyniki są niepewne i zależą w dużej mierze od propozycji, …

2
Pomóż mi dopasować tę nieliniową regresję wielokrotną, która oparła się wszystkim poprzednim wysiłkom
EDYCJA: Od czasu opublikowania tego posta śledzę tutaj dodatkowy post . Podsumowanie poniższego tekstu: Pracuję nad modelem i próbowałem regresji liniowej, transformacji Boxa Coxa i GAM, ale nie zrobiłem dużego postępu Korzystając z tej opcji R, pracuję obecnie nad modelem do przewidywania sukcesu mniejszych graczy baseballowych na poziomie ligi głównej …

1
Umieszczenie pierwszeństwa parametru stężenia w procesie Dirichleta
Większość z tego stanowi tło, przejdź do końca, jeśli wiesz już wystarczająco dużo o mieszaninach procesowych Dirichleta . Załóżmy, że modeluję niektóre dane pochodzące z mieszanki procesów Dirichleta, tj. Pozwól i od załóżmy, żefa∼ D ( α H)fa∼re(αH.)F \sim \mathcal D(\alpha H)fafaFYja∼I I d∫fa( y| θ)F( dθ ) .Yja∼jajare∫fa(y|θ)fa(reθ).Y_i \stackrel …


1
Jaka jest różnica między podejściem częstym z metaanalizą a podejściem bayesowskim?
Powiedzmy, że przeprowadzam analizę, patrząc na konkretną miarę zdrowia. Interesuje mnie różnica w tym pomiarze między pacjentami a grupą kontrolną oraz to, czy różnica ta różni się od 0. W przeszłości były badania dotyczące tego samego pytania badawczego i miary zdrowia, ale w różnych próbkach pacjentów. W mojej analizie bayesowskiej …


1
Wizualizacja wyników z wielu ukrytych modeli klas
Używam ukrytej analizy klas do grupowania próbki obserwacji na podstawie zestawu zmiennych binarnych. Używam R i pakietu poLCA. W LCA musisz określić liczbę klastrów, które chcesz znaleźć. W praktyce ludzie zwykle uruchamiają kilka modeli, z których każdy określa inną liczbę klas, a następnie używają różnych kryteriów, aby ustalić, które jest …

3
jak interpretować termin interakcji we wzorze lm w R?
W R, jeśli wywołam lm()funkcję w następujący sposób: lm.1 = lm(response ~ var1 + var2 + var1 * var2) summary(lm.1) To daje mi liniowy model zmiennej odpowiedzi z var1, var2oraz interakcji między nimi. Jak jednak dokładnie interpretujemy liczbowo termin interakcji? Dokumentacja mówi, że jest to „krzyż” między var1i var2, ale …
9 r  regression 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.