Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
W R, biorąc pod uwagę wynik optymalizacji z macierzą hessianową, jak obliczyć przedziały ufności parametrów za pomocą macierzy hessianowej?
Biorąc pod uwagę wynik optymalizacji z macierzą hessianową, jak obliczyć przedziały ufności parametrów za pomocą macierzy hessianowej? fit<-optim(..., hessian=T) hessian<-fit$hessian Najbardziej interesuje mnie kontekst analizy maksymalnego prawdopodobieństwa, ale ciekawy jestem, czy można rozszerzyć tę metodę.

1
Jak rozłożyć szereg czasowy z wieloma składnikami sezonowymi?
Mam szereg czasowy, który zawiera podwójne składniki sezonowe i chciałbym rozłożyć szereg na następujące składniki szeregu czasowego (trend, składnik sezonowy 1, składnik sezonowy 2 i składnik nieregularny). O ile mi wiadomo, procedura STL do dekompozycji serii w R dopuszcza tylko jeden komponent sezonowy, więc próbowałem dekomponować serię dwa razy. Po …

1
Obliczanie mocy statystycznej
Jak rozumiem, muszę znać co najmniej trzy aspekty (spośród czterech) mojego proponowanego badania, aby przeprowadzić analizę mocy, a mianowicie: rodzaj testu - Zamierzam użyć Pearsona i ANCOVA / Regresja - GLM poziom istotności (alfa) - Zamierzam użyć 0,05 oczekiwany rozmiar efektu - zamierzam użyć średniej wielkości efektu (0,5) wielkość próbki …


2
Na „sile” słabych uczniów
Mam kilka ściśle powiązanych pytań dotyczących słabych uczniów uczących się w zespole (np. Przyspieszenie). Może to zabrzmieć głupio, ale jakie są zalety korzystania ze słabych w porównaniu z silnymi uczniami? (np. dlaczego nie wzmocnić za pomocą „silnych” metod uczenia się?) Czy istnieje jakaś „optymalna” siła dla słabych uczniów (np. Przy …

4
Interpretacja różnicy między rozkładem logarytmicznym a rozkładem mocy (rozkład stopni sieciowych)
Po pierwsze, nie jestem statystykiem. Jednak robiłem analizę sieci statystycznej dla mojego doktoratu. W ramach analizy sieci przedstawiłem komplementarną funkcję skumulowanego rozkładu (CCDF) stopni sieciowych. Odkryłem, że w przeciwieństwie do konwencjonalnych dystrybucji sieciowych (np. WWW), dystrybucję najlepiej dopasowuje rozkład logarytmiczny. Próbowałem dopasować ją do prawa mocy i używając skryptów Matlaba …

2
Dobry zasób online z poradami na temat graficznego powiązania dwóch zmiennych numerycznych w różnych warunkach
Kontekst: Przez ten czas zyskałem zestaw heurystyk, jak efektywnie wykreślić powiązanie między dwiema zmiennymi numerycznymi. Wyobrażam sobie, że większość ludzi pracujących z danymi miałaby podobny zestaw reguł. Przykładami takich reguł mogą być: Jeśli jedna ze zmiennych jest dodatnio wypaczona, rozważ wykreślenie tej osi na skali logarytmicznej. Jeśli istnieje wiele punktów …

3
Obsługuje regresję wektorową do przewidywania wielowymiarowych szeregów czasowych
Czy ktoś próbował przewidywać szeregi czasowe przy użyciu regresji wektorów pomocniczych? Rozumiem maszyny wektorów pomocniczych i częściowo rozumiem regresję wektorów pomocniczych, ale nie rozumiem, jak można ich użyć do modelowania szeregów czasowych, zwłaszcza szeregów czasowych na wielu odmianach. Próbowałem przeczytać kilka artykułów, ale są one na zbyt wysokim poziomie. Czy …



2
Najlepsze podejście do wyboru modelu Bayesian czy walidacja krzyżowa?
Próbując wybrać spośród różnych modeli lub liczby funkcji do uwzględnienia, powiedzmy przewidywanie, że mogę wymyślić dwa podejścia. Podziel dane na zestawy szkoleniowe i testowe. Jeszcze lepiej, użyj ładowania początkowego lub krzyżowej weryfikacji K-fold. Trenuj na zestawie treningowym za każdym razem i oblicz błąd w stosunku do zestawu testowego. Błąd testu …

1
Różnice między rozkładem ciężkich i grubych ogonów
Myślałem, że ciężki ogon = gruby ogon, ale niektóre artykuły, które czytałem, dały mi wrażenie, że tak nie jest. Jeden z nich mówi: ciężki ogon oznacza, że ​​rozkład ma nieskończony j-ty moment dla jakiejś liczby całkowitej j. Dodatkowo wszystkie dfs w dziedzinie puli przyciągania Pareto df są gruboogoniaste. Jeśli gęstość …

4
Jak zapewnić właściwości macierzy kowariancji przy dopasowywaniu wielowymiarowego modelu normalnego przy maksymalnym prawdopodobieństwie?
Załóżmy, że mam następujący model yi=f(xi,θ)+εiyi=f(xi,θ)+εiy_i=f(x_i,\theta)+\varepsilon_i where yi∈RKyi∈RKy_i\in \mathbb{R}^K , xixix_i is a vector of explanatory variables, θθ\theta is the parameters of non-linear function fff and εi∼N(0,Σ)εi∼N(0,Σ)\varepsilon_i\sim N(0,\Sigma), where ΣΣ\Sigma naturally is K×KK×KK\times K matrix. The goal is the usual to estimate θθ\theta and ΣΣ\Sigma. The obvious choice is maximum …

2
Dlaczego hipoteza zerowa jest zawsze wartością punktową, a nie zakresem w testowaniu hipotez?
Jest to nieco związane z innym pytaniem, które zadałem. Pytanie, które mam, podczas testowania hipotez, gdy alternatywną hipotezą jest zakres, hipoteza zerowa jest nadal wartością punktową. Na przykład podczas testowania, czy współczynnik korelacji jest większy niż 0,5, hipoteza zerowa to „korelacja = 0,5” zamiast „korelacja <= 0,5”. Dlaczego tak jest? …

2
Sugestie dotyczące poprawy prawdopodobieństwa i statystyk ściągawki
Kontekst: Starając się ustrukturyzować elementy centralne, na które natknąłem się w teorii prawdopodobieństwa i styce, stworzyłem dokument referencyjny koncentrujący się na podstawach matematycznych (dostępny tutaj ). Udostępniając ten dokument, mam nadzieję, że przedstawię studentom statystyki obszerne podsumowanie podstawowych materiałów nauczanych na kursach dla absolwentów na te tematy. Chociaż przeznaczone głównie …
22 teaching 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.