Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Auto.arima vs autobox różnią się?
Po przeczytaniu postów na tej stronie wiem, że jest funkcja R auto.arima(w forecast pakiecie ). Wiem również, że IrishStat , członek tej witryny, zbudował pakiet komercyjny autobox na początku lat 80. Ponieważ te dwa pakiety istnieją dzisiaj i automatycznie wybierają modele arima dla danych zestawów danych, co robią inaczej? Czy …

3
Zmienne współliniowe w szkoleniu Multlass LDA
Trenuję wieloklasowy klasyfikator LDA z 8 klasami danych. Podczas treningu otrzymuję ostrzeżenie: „ Zmienne są współliniowe ” Dostaję dokładność szkolenia ponad 90% . Korzystam z biblioteki scikits-learn w Pythonie do trenowania i testowania danych Multi-class. Dostaję też przyzwoitą dokładność testowania (około 85% -95% ). Nie rozumiem, co oznacza błąd / …

3
Czy MLE wymaga danych ID? Czy tylko niezależne parametry?
Oszacowanie parametrów przy użyciu oszacowania maksymalnego prawdopodobieństwa (MLE) obejmuje ocenę funkcji wiarygodności, która odwzorowuje prawdopodobieństwo wystąpienia próbki (X) na wartości (x) w przestrzeni parametrów (θ) dla danej rodziny rozkładów (P (X = x | θ) ) ponad możliwymi wartościami θ (uwaga: czy mam rację?). Wszystkie przykłady, które widziałem, obejmują obliczanie …

2
Jak uruchomić dwukierunkową ANOVA na danych bez normalności ani równości wariancji w R?
Obecnie pracuję nad moją pracą magisterską i planuję prowadzić statystyki w SigmaPlot. Jednak po spędzeniu trochę czasu z moimi danymi doszedłem do wniosku, że SigmaPlot może nie nadawać się do mojego problemu (mogę się mylić), więc zacząłem pierwsze próby w R, co nie bardzo ułatwiło. Plan polegał na przeprowadzeniu prostej …

4
Czyścić dane o niespójnym formacie w R?
Często mam do czynienia z niechlujnymi danymi ankiet, które wymagają dużo czyszczenia, zanim będzie można wykonać statystyki. Robiłem to „ręcznie” w programie Excel, czasami używając formuł Excela, a czasem sprawdzając wpisy jeden po drugim. Zacząłem robić coraz więcej tych zadań, pisząc skrypty do ich wykonania w języku R, co było …
16 r  data-cleaning 

2
Obliczanie błędu standardowego w oszacowaniu średniej ważonej
Załóżmy, że w1,w2,…,wnw1,w2,…,wnw_1,w_2,\ldots,w_n i x1,x2,...,xnx1,x2,...,xnx_1,x_2,...,x_n są każdy narysowany IID go w dystrybucji z niezależnie od . W są absolutnie pozytywne. Obserwujesz wszystkie , ale nie ; raczej obserwujesz . Jestem zainteresowany oszacowaniem nazwawiwiw_ixixix_iwiwiw_iwiwiw_ixixix_i∑ixiwi∑ixiwi\sum_i x_i w_iE[x]E⁡[x]\operatorname{E}\left[x\right] podstawie tych informacji. Oczywiście estymator x¯=∑iwixi∑iwix¯=∑iwixi∑iwi \bar{x} = \frac{\sum_i w_i x_i}{\sum_i w_i} jest bezstronny i …

3
Obliczanie nowego odchylenia standardowego przy użyciu starego odchylenia standardowego po zmianie zestawu danych
Mam tablicę nnn wartości rzeczywistych, co ma średnią μo l dμolre\mu_{old} i odchylenie standardowe σo l dσolre\sigma_{old} . Jeśli element tablicy xjaxjax_i zostanie zastąpiony innym elementem , wówczas nowa średnia będziexjotxjotx_j μn e w=μold+xj−xinμnew=μold+xj−xin\mu_{new}=\mu_{old}+\frac{x_j-x_i}{n} Zaletą tego podejścia jest to, że wymaga ciągłego obliczania niezależnie od wartości . Czy istnieje jakieś …

1
Interpretacja wyników testu przyczynowego Grangera
Staram się kształcić na temat przyczynowości Granger. Przeczytałem posty na tej stronie i kilka dobrych artykułów online. Natknąłem się również na bardzo pomocne narzędzie, Bivariate Granger Causality - darmowy kalkulator statystyczny , który umożliwia wprowadzanie szeregów czasowych i obliczanie statystyk Granger. Poniżej znajduje się wynik z przykładowych danych zawartych na …

3
Znalezienie MLE dla jednoznacznego wykładniczego procesu Hawkesa
Jednowymiarowy wykładniczy proces Hawkesa jest samo-ekscytującym procesem punktowym, którego wskaźnik przybywania zdarzeń wynosi: λ(t)=μ+∑ti&lt;tαe−β(t−ti)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} gdzie to czasy przyjazdu zdarzenia.t1,..tnt1,..tn t_1,..t_n Funkcja wiarygodności dziennika to −tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln(μ+αe−β(tj−ti))−tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln⁡(μ+αe−β(tj−ti)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum\limits_{i<j}{\ln(\mu+\alpha e^{-\beta(t_j-t_i)})} które można obliczyć rekurencyjnie: −tnμ+αβ∑(e−β(tn−ti)−1)+∑ln(μ+αR(i))−tnμ+αβ∑(e−β(tn−ti)−1)+∑ln⁡(μ+αR(i)) - t_n \mu …


1
Użycie R i plm do oszacowania modeli efektów stałych, które obejmują interakcje z czasem
Używam plm()do oszacowania modeli formy z efektami stałymi y ~ x + time + time:fixed_trait gdzie fixed_traitjest zmienną, która różni się u poszczególnych osób, ale jest stała w obrębie poszczególnych osób. Punkt interakcji timeze fixed_traitjest umożliwienie efekt fixed_traitzmieniać w czasie. (Pracuję tutaj z ostatniej broszury Paula Allisona na temat ustalonych …
16 r 

3
Czy w ogóle uzasadnione jest rozwarstwienie zbioru danych według wielkości pozostałości i wykonanie porównania dwóch prób?
Uważam, że jest to metoda ad hoc i wydaje mi się bardzo podejrzana, ale być może czegoś mi brakuje. Widziałem to w regresji wielokrotnej, ale bądźmy prostymi: yi=β0+β1xi+εiyi=β0+β1xi+εi y_{i} = \beta_{0} + \beta_{1} x_{i} + \varepsilon_{i} Teraz weź pozostałości z dopasowanego modelu ei=yi−(β^0+β^1xi)ei=yi−(β^0+β^1xi) e_{i} = y_{i} - \left( \hat{\beta}_{0} + …

2
Jakie są alternatywy dla wymiaru VC do pomiaru złożoności sieci neuronowych?
Natknąłem się na kilka podstawowych sposobów pomiaru złożoności sieci neuronowych: Naiwne i nieformalne: policz liczbę neuronów, ukrytych neuronów, warstw lub ukrytych warstw Wymiar VC (Eduardo D. Sontag [1998] „Wymiar VC sieci neuronowych” [ pdf ].) Miara złożonejT.do0reT.dore0TC^0_d i asymptotycznej złożoności obliczeniowej kursu przez równoważność z . Czy są inne alternatywy? …

6
Najszybsza implementacja SVM
Bardziej ogólne pytanie. Korzystam z SVM rbf do modelowania predykcyjnego. Myślę, że mój obecny program zdecydowanie potrzebuje przyspieszenia. Używam scikit learning z prostym do dokładnego wyszukiwania siatki + sprawdzania poprawności. Każdy przebieg SVM zajmuje około minuty, ale mimo wszystkich iteracji wciąż uważam, że jest zbyt wolny. Zakładając, że w końcu …

4
Intuicja przy dystrybucji prawa energetycznego
Wiem, że pdf rozkładu prawa potęgi top(x)=α−1xmin(xxmin)−αp(x)=α−1xmin(xxmin)−α p(x) = \frac{\alpha-1}{x_{\text{min}}} \left(\frac{x}{x_{\text{min}}} \right)^{-\alpha} Ale co to intuicyjnie oznacza, jeśli na przykład ceny akcji są zgodne z podziałem prawa energetycznego? Czy to oznacza, że ​​straty mogą być bardzo wysokie, ale rzadkie?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.