Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Pytanie o przykładową funkcję autokowariancji
Czytam książkę do analizy szeregów czasowych, a wzór na próbkę autokowariancji jest zdefiniowany w książce jako: γˆ(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)γ^(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)\widehat{\gamma}(h) = n^{-1}\displaystyle\sum_{t=1}^{n-h}(x_{t+h}-\bar{x})(x_t-\bar{x}) withdla . \ bar {x} to średnia.γˆ(−h)=γˆ(h)γ^(−h)=γ^(h)\widehat{\gamma}(-h) = \widehat{\gamma}(h)\;h=0,1,...,n−1h=0,1,...,n−1\;h = 0,1, ..., n-1x¯x¯\bar{x} Czy ktoś może wyjaśnić intuicyjnie, dlaczego dzielimy sumę przez nnn a nie przez n−hn−hn-h ? Książka wyjaśnia, że …

2
Jakie są dobre zasoby dla historii analizy szeregów czasowych?
Sprawdziłem odpowiedź na to pytanie na stats.stackexchange: Jakie są dobre zasoby zapewniające historię statystyk? Rzeczywiście, książka Stiglera „Statystyki na stole” wygląda doskonale i nie mogę się doczekać, aby ją przeczytać. Ale bardziej interesuje mnie rozwój nowoczesnych modeli ARIMA. Wydaje mi się, że pamiętam, że pobudzono duży postęp w próbach przewidywania …


1
Określanie terminu Błąd () w ANOVA w powtarzanych pomiarach w R.
Mam problem z określeniem terminów błędów dla ANOVA z powtarzanymi dwukierunkowymi pomiarami w R. Moje dane obejmują szacunki gęstości drewna dla trzech położeń promieniowych (wewnętrzna, środkowa i zewnętrzna) wzdłuż rdzenia wydobytego z drzewa. Istnieje w sumie 20 gatunków drzew, 6 osobników każdego gatunku i dwa rdzenie z każdego drzewa. Aby …

2
Książka dla statystyk nieparametrycznych
Co byłoby dobrą książką dla statystyki nieparametrycznej. Nie tylko wstęp, ale poziom zaawansowany. Patrzę też na coś, czego mogę użyć do nauki, a nie do odniesienia. W szczególności szukam książki, która może zawierać podstawy metod nieparametrycznych, wnioskowania nieparametrycznego, metod oceny nieparametrycznych, np. Testu KS, testu itp., Ładowania początkowego ....ttt


3
Algorytm uczenia maszynowego do rankingu
Mam zestaw elementów które mogę opisać według cech. A zatem:XXXnnn xja: {doi 1,doi 2, ... ,doi n} ∣xja∈ Xxja:{doja1,doja2),…,dojan}∣xja∈Xx_i: \{c_{i1}, c_{i2}, \ldots, c_{in}\} \mid x_i \in X gdzie to (numeryczna) ocena dla elementu zgodnie z cechami . Moje elementy można więc oglądać jako punkty w przestrzeni n- wymiarowej.doI jdojajotc_{ij}jajaijotjotjnnn Zgodnie …



1
Co to jest wariancja punktowa?
Czytając „Elementy uczenia statystycznego ” kilkakrotnie spotkałem się z terminem „wariancja punktowa”. Chociaż mam niejasne pojęcie o tym, co to prawdopodobnie oznacza, byłbym wdzięczny za to Jak to jest zdefiniowane? Jak powstaje?
10 variance 

3
Czy istnieje górna granica liczby interwałów w histogramie?
Przeczytałem kilka artykułów i fragmentów książek, które wyjaśniają, jak wybrać dobrą liczbę interwałów (pojemników) dla histogramu zestawu danych, ale zastanawiam się, czy istnieje twarda maksymalna liczba interwałów na podstawie liczby punktów w zestaw danych lub inne kryterium. Wstęp: Powód, dla którego pytam, jest to, że próbuję napisać oprogramowanie na podstawie …

2
REML vs ML stepAIC
Czuję się przytłoczony po próbie zagłębienia się w literaturze na temat tego, jak uruchomić moją analizę modeli mieszanych, a następnie użyć AIC do wyboru najlepszego modelu lub modeli. Nie sądzę, że moje dane są tak skomplikowane, ale szukam potwierdzenia, że ​​to, co zrobiłem, jest prawidłowe, a następnie doradzam, jak postępować. …

1
Interpretowanie współczynników interakcji między zmienną jakościową a ciągłą
Mam pytanie dotyczące interpretacji współczynników interakcji między zmienną ciągłą a kategoryczną. oto mój model: model_glm3=glm(cog~lg_hag+race+pdg+sex+as.factor(educa)+(lg_hag:as.factor(educa)), data=base_708) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 21.4836 2.0698 10.380 < 2e-16 *** lg_hag 8.5691 3.7688 2.274 0.02334 * raceblack -8.4715 1.7482 -4.846 1.61e-06 *** racemexican -3.0483 1.7073 -1.785 0.07469 . racemulti/other -4.6002 …

3
Winbugs i inne MCMC bez informacji do wcześniejszej dystrybucji
Co dzieje się, gdy nie masz pojęcia o rozkładzie parametrów? Jakie podejście powinniśmy zastosować? Przez większość czasu dążymy do podkreślenia, czy dana zmienna ma jakikolwiek wpływ na obecność / nieobecność określonego gatunku, a zmienna jest akceptowana lub nie, zgodnie ze znaczeniem zmiennej. Oznacza to, że przez większość czasu nie myślimy …
10 r  bayesian  mcmc  bugs  winbugs 

5
Czy można najpierw dopasować model Bayesa, a następnie zacząć osłabiać priory?
Podczas częstych statystyk istnieje długa lista dużych „no-nosów”, takich jak przeglądanie wyników testów statystycznych przed podjęciem decyzji o zebraniu większej ilości danych. Zastanawiam się na ogół, czy istnieje podobna lista numerów zerowych dla metodologii stosowanych w statystyce bayesowskiej, a konkretnie, czy jedna z nich jest następująca. Niedawno zdałem sobie sprawę, …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.