Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Jak oszacować proces Poissona za pomocą R? (Lub: jak korzystać z pakietu NHPoisson?)
Mam bazę danych zdarzeń (tj. Zmienną dat) i powiązanych zmiennych towarzyszących. Zdarzenia są generowane przez niestacjonarny proces Poissona z parametrem będącym nieznaną (ale być może liniową) funkcją niektórych zmiennych towarzyszących. Myślę, że pakiet NHPoisson istnieje właśnie w tym celu; ale po 15 godzinach nieudanych badań wciąż nie jestem w pobliżu, …

2
Szacowanie kowariancji a posteriori rozkładu wielowymiarowego gaussa
Muszę „nauczyć się” rozkładu dwuwymiarowego gaussa z kilkoma próbkami, ale dobrą hipotezą na temat wcześniejszego rozkładu, dlatego chciałbym zastosować podejście bayesowskie. Zdefiniowałem mój wcześniejszy: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 & 0 \\ 0 & …

2
Oszacowanie parametrów rozkładu normalnego: mediana zamiast średniej?
Powszechnym podejściem do szacowania parametrów rozkładu normalnego jest użycie średniej i odchylenia standardowego / wariancji próbki. Jeśli jednak występują pewne wartości odstające, mediana i odchylenie mediany od mediany powinny być znacznie bardziej niezawodne, prawda? Na niektórych zbiorów danych Próbowałem, rozkład normalny szacowany przez N(median(x),median|x−median(x)|)N(median(x),median|x−median(x)|)\mathcal{N}(\text{median}(x), \text{median}|x - \text{median}(x)|) wydaje się produkować …


2
Określenie struktury kowariancji: zalety i wady
Jakie są korzyści ze wskazania struktury kowariancji w GLM (zamiast traktowania wszystkich nie-diagonalnych wpisów w macierzy kowariancji jako zera)? Oprócz odzwierciedlenia tego, co wiemy o danych, robi to poprawić dobroć dopasowania? poprawić dokładność predykcyjną przetrzymywanych danych? pozwalają nam oszacować zakres kowariancji? Jakie są koszty nałożenia struktury kowariancji? Czy to dodać …

1
Znaczenie terminów wyjściowych w pakiecie GBM?
Korzystam z pakietu GBM do klasyfikacji. Zgodnie z oczekiwaniami wyniki są dobre. Ale staram się zrozumieć wyniki klasyfikatora. W produkcji występuje pięć terminów. `Iter TrainDeviance ValidDeviance StepSize Improve` Czy ktoś mógłby wyjaśnić znaczenie każdego terminu, zwłaszcza znaczenie Ulepszenia .

1
Dlaczego stabilizujemy wariancję?
Natknąłem się na transformację stabilizującą wariancję podczas czytania metody Kaggle Essay Eval . Używają transformacji stabilizacji wariancji, aby przekształcić wartości kappa przed pobraniem ich średniej, a następnie przekształcić je z powrotem. Nawet po przeczytaniu wiki o transformacjach stabilizujących wariancje nie rozumiem, dlaczego tak naprawdę stabilizujemy wariancje? Jakie korzyści dzięki temu …

3
Po co stosować określoną miarę błędu prognozy (np. MAD), a nie inną (np. MSE)?
MAD = średnie odchylenie bezwzględne MSE = średni błąd kwadratu Widziałem sugestie z różnych miejsc, że MSE jest używany pomimo pewnych niepożądanych właściwości (np. Http://www.stat.nus.edu.sg/~staxyc/T12.pdf , który stwierdza na p8 „Powszechnie uważa się, że MAD jest lepszym kryterium niż MSE. Jednak matematycznie MSE jest wygodniejszy niż MAD. ”) Czy jest …
15 forecasting  error  mse  mae 

1
Wizualizacja wyników modeli mieszanych
Jednym z problemów, które zawsze miałem z modelami mieszanymi, jest wymyślanie wizualizacji danych - takich, które mogłyby skończyć się na papierze lub plakacie - gdy tylko uzyska się wyniki. Obecnie pracuję nad modelem efektów mieszanych Poissona z formułą, która wygląda mniej więcej tak: a <- glmer(counts ~ X + Y …

7
Losowy las jest przepełniony
Próbuję użyć losowej regresji leśnej w scikits-learn. Problem polega na tym, że otrzymuję naprawdę wysoki błąd testu: train MSE, 4.64, test MSE: 252.25. Tak wyglądają moje dane: (niebieski: dane rzeczywiste, zielony: przewidywane): Używam 90% na szkolenie i 10% na test. Oto kod, którego używam po wypróbowaniu kilku kombinacji parametrów: rf …

1
Regresja błędów w zmiennych: czy poprawne jest łączenie danych z trzech witryn?
Niedawno przyszedł do mnie klient, aby przeprowadzić analizę ładowania początkowego, ponieważ recenzent FDA stwierdził, że ich regresja błędów w zmiennych była nieprawidłowa, ponieważ podczas łączenia danych z witryn analiza obejmuje łączenie danych z trzech witryn, w których dwie witryny zawierały próbki, które były to samo. TŁO Klient miał nową metodę …

3
Kilka pytań na temat losowości statystycznej
Ze statystycznej randonessy Wikipedii : Losowość globalna i losowość lokalna są różne. Większość filozoficznych koncepcji losowości ma charakter globalny, ponieważ opierają się na założeniu, że „na dłuższą metę” sekwencja wygląda naprawdę losowo, nawet jeśli pewne podsekwencje nie wyglądałyby losowo. Na przykład w „prawdziwie” losowej sekwencji liczb o wystarczającej długości prawdopodobne …

5
Biblioteka Java typu open source do statystyk na poziomie oferowanym przez magisterski kurs statystyczny
Biorę udział w kursie dla absolwentów statystyki stosowanej, który wykorzystuje następujący podręcznik (aby poczuć poziom badanego materiału): koncepcje i metody statystyczne , prowadzone przez GK Bhattacharyya i RA Johnsona. Profesor wymaga od nas korzystania z SAS do odrabiania lekcji. Moje pytanie brzmi: czy istnieje biblioteka (y) Java, której można używać …
15 r  sas  java 

11
Przykłady procesów, które nie są Poissonem?
Szukam kilku dobrych przykładów sytuacji, które nie pasują do modelu z rozkładem Poissona, aby pomóc mi wyjaśnić rozkład Poissona studentom. Często wykorzystuje się liczbę klientów przybywających do sklepu w przedziale czasowym jako przykład, który można modelować za pomocą rozkładu Poissona. Szukam kontrprzykładu w podobnym stylu, tj. Sytuacji, którą można traktować …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.