Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Dlaczego błędy, które nie są normalnie rozpowszechniane, zagrażają ważności naszych oświadczeń o znaczeniu?
Jeśli chodzi o modele OLS, istnieje założenie normalności, a mianowicie, że błędy są normalnie dystrybuowane. Przeglądałem Cross Validated i wygląda na to, że Y i X nie muszą być normalne, aby błędy były normalne. Moje pytanie brzmi: dlaczego w przypadku błędów, które nie są normalnie dystrybuowane, ważność naszych oświadczeń o …


1
Jak mam interpretować statystyki GAP?
Użyłem statystyki GAP do oszacowania k klastrów w R. Jednak nie jestem pewien, czy dobrze ją interpretuję. Z powyższego wątku zakładam, że powinienem użyć 3 klastrów. Z drugiego wątku powinienem wybrać 6 klastrów. Czy to poprawna interpretacja statystyki GAP? Byłbym wdzięczny za wszelkie wyjaśnienia.
10 clustering 

1
Dopasuj GARCH (1,1) - model z współzmiennymi w R.
Mam pewne doświadczenia z modelowaniem szeregów czasowych, w postaci prostych modeli ARIMA i tak dalej. Teraz mam pewne dane, które wykazują grupowanie zmienności, i chciałbym zacząć od dopasowania modelu GARCH (1,1) do danych. Mam serię danych i szereg zmiennych, które, jak sądzę, wpływają na to. Zatem w podstawowych regresjach wygląda …
10 r  regression  garch 

1
Współczynnik inflacji wariancji dla uogólnionych modeli addytywnych
W zwykłych obliczeń VIF dla regresji liniowej, każdy niezależnie / objaśniający zmienna jest traktowany jako zmienną zależną w zwykłym regresji najmniejszych kwadratów. to znaczyXjotXjotX_j Xjot= β0+ ∑i = 1 , i ≠ jnβjaXjaXjot=β0+∑ja=1,ja≠jotnβjaXja X_j = \beta_0 + \sum_{i=1, i \neq j}^n \beta_i X_i Gdy wartości są zapisywane dla każdego z …

3
Kiedy zakończyć test Bayesian A / B?
Próbuję robić A / B testowania Bayesa sposób, jak w probabilistyczny Programowanie dla hakerów i Bayesa testów A / B . Oba artykuły zakładają, że decydent decyduje, który z wariantów jest lepszy, wyłącznie na podstawie prawdopodobieństwa pewnego kryterium, np. , dlatego A jest lepsze. Prawdopodobieństwo to nie dostarcza żadnych informacji …

1
Wyjaśnienie w geometrii informacji
To pytanie dotyczy artykułu Różnicowa geometria zakrzywionych rodzin wykładniczych-krzywizny i utraty informacji autorstwa Amari. Tekst wygląda następująco. Niech będzie wymiarowym kolektorem rozkładów prawdopodobieństwa z układem współrzędnych , gdzie zakłada się ...n θ = ( θ 1 , … , θ n ) p θ ( x ) > 0Sn={pθ}Sn={pθ}S^n=\{p_{\theta}\}nnnθ=(θ1,…,θn)θ=(θ1,…,θn)\theta=(\theta_1,\dots,\theta_n)pθ(x)>0pθ(x)>0p_{\theta}(x)>0 Możemy …

2
Czy iteracje MCMC po wypaleniu można wykorzystać do oszacowania gęstości?
Czy po wypaleniu możemy bezpośrednio użyć iteracji MCMC do oszacowania gęstości, na przykład poprzez wykreślenie histogramu lub oszacowanie gęstości jądra? Obawiam się, że iteracje MCMC niekoniecznie są niezależne, chociaż są co najwyżej identycznie rozmieszczone. Co się stanie, jeśli zastosujemy przerzedzanie do iteracji MCMC? Obawiam się, że iteracje MCMC są co …

1
Wizualizacja wielu rozkładów pochylonych w lewo
Mam serię rozkładów skośnych / grubych ogonów, które chciałbym pokazać. Istnieje 42 dystrybucje na trzech czynników (oznaczony jako A, Ba Cponiżej). Różnica maleje również w zależności od czynnika B. Problemem jest to, że rozkłady trudno jest rozróżnić w skali wyniku (stosunek lub zmiana krotności): Wydaje się, że rejestrowanie danych nadmiernie …

2
Taki sam czy inny? Sposób bayesowski
Powiedz, że mam następujący model: Poisson(λ)∼{λ1λ2if t<τif t≥τPoisson(λ)∼{λ1if t<τλ2if t≥τ\text{Poisson}(\lambda) \sim \begin{cases} \lambda_1 & \text{if } t \lt \tau \\ \lambda_2 & \text{if } t \geq \tau \end{cases} I wywnioskowałem, że tylne dla λ1λ1\lambda_1 i pokazano poniżej z moich danych. Czy istnieje bayesowski sposób stwierdzenia (lub określenia ilościowego), czy i …


1
Notacja do modelowania wielopoziomowego
Potrzeby jeden wzór, aby określić za szkolenie wielopoziomowego modelu (korzystając lmerz lme4 Rbiblioteki) zawsze mnie trafia. Czytałem niezliczone podręczniki i samouczki, ale nigdy nie zrozumiałem tego poprawnie. Oto przykład z tego samouczka , który chciałbym zobaczyć sformułowany w równaniu. Staramy się modelować częstotliwość głosu jako funkcję płci (kobiety mają wyższy …


2
Przewaga LASSO nad wyborem do przodu / eliminacją do tyłu pod względem błędu prognozowania walidacji krzyżowej modelu
Otrzymałem trzy zredukowane modele z oryginalnego pełnego modelu przy użyciu wybór do przodu eliminacja wsteczna Technika penalizacji L1 (LASSO) Dla modeli uzyskanych za pomocą selekcji do przodu / eliminacji wstecznej uzyskałem oszacowane krzyżowo oszacowanie błędu prognozowania przy użyciu CVlmpakietu DAAGdostępnego w R. Do modelu wybranego przez LASSO użyłem cv.glm. Błąd …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.