Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Warunki interakcji i wielomiany wyższego rzędu
Gdybym był zainteresowany dopasowaniem interakcji dwukierunkowych między liniową zmienną objaśniającą a inną zmienną objaśniającą która ma kwadratowy związek ze zmienną zależną , czy musiałbym uwzględnić zarówno interakcję ze składową kwadratową, jak i interakcję z liniową komponent w modelu? Np .: Z kolei w oparciu o mój poprzedni wątek: Warunki krzywizny …


3
Model szeregów czasowych
Muszę zautomatyzować prognozowanie szeregów czasowych i nie znam z góry cech tych szeregów (sezonowość, trend, hałas itp.). Moim celem nie jest uzyskanie najlepszego możliwego modelu dla każdej serii, ale uniknięcie całkiem złych modeli. Innymi słowy, otrzymywanie drobnych błędów za każdym razem nie stanowi problemu, ale od czasu do czasu jest …

3
Prawdopodobieństwo vs rozkład warunkowy dla analizy bayesowskiej
Możemy zapisać twierdzenie Bayesa jako p ( θ | x ) = f( X| θ)p(θ)∫θfa( X| θ)p(θ)dθp(θ|x)=fa(X|θ)p(θ)∫θfa(X|θ)p(θ)reθp(\theta|x) = \frac{f(X|\theta)p(\theta)}{\int_{\theta} f(X|\theta)p(\theta)d\theta} gdzie jest tylnym, jest rozkładem warunkowym, a jest wcześniejszym.f ( X | θ ) p ( θ )p ( θ | x )p(θ|x)p(\theta|x)fa( X| θ)fa(X|θ)f(X|\theta)p ( θ )p(θ)p(\theta) lub p …

3
Model łączony z warunkami interakcji a osobnymi regresjami dla porównania grup
Po zebraniu cennych informacji zwrotnych z poprzednich pytań i dyskusji, wpadłem na następujące pytanie: Załóżmy, że celem jest wykrycie różnic w efektach między dwiema grupami, na przykład mężczyznami i kobietami. Można to zrobić na dwa sposoby: uruchamiając dwie osobne regresje dla dwóch grup i wykorzystując test Walda, aby odrzucić (lub …


5
Jak uzyskać region elipsy z dwuwymiarowych normalnych danych rozproszonych?
Mam dane, które wyglądają następująco: Próbowałem zastosować rozkład normalny (szacowanie gęstości jądra działa lepiej, ale nie potrzebuję tak dużej precyzji) i działa całkiem dobrze. Wykres gęstości tworzy elipsę. Potrzebuję uzyskać tę funkcję elipsy, aby zdecydować, czy punkt leży w regionie elipsy, czy nie. Jak to zrobić? Kod R lub Mathematica …
13 r  regression  pdf  bivariate 

5
Czy standaryzowanie zmiennych niezależnych zmniejsza kolinearność?
Natknąłem się na bardzo dobry tekst na Bayes / MCMC. IT sugeruje, że standaryzacja zmiennych niezależnych sprawi, że algorytm MCMC (Metropolis) będzie bardziej wydajny, ale może także zmniejszyć (wiele) kolinearność. Czy to może być prawda? Czy powinienem to robić standardowo (przepraszam). Kruschke 2011, Doing Bayesian Data Analysis. (AP) edycja: na …

4
Intuicja / interpretacja rozkładu wartości własnych macierzy korelacji?
Jaka jest Twoja intuicja / interpretacja rozkładu wartości własnych macierzy korelacji? Słyszę, że zwykle 3 największe wartości własne są najważniejsze, a te bliskie zeru to hałas. Widziałem także kilka prac badawczych, w których badano, jak naturalnie występujące rozkłady wartości własnych różnią się od tych obliczonych z macierzy korelacji losowej (ponownie, …

1
Świeckie zrozumienie różnicy między regulacją drzwi tylnych i drzwiami wejściowymi
Jestem odnoszące się do regulacji back-drzwiowej i regulacji przód-drzwiowego tutaj : Dostosowanie tylnych drzwi : archetypowym problemem epidemiologicznym w statystyce jest dostosowanie się do efektu mierzonego pomieszania. Kryterium tylnych drzwi Pearl uogólnia ten pomysł. Dostosowanie drzwi wejściowych : jeśli niektóre zmienne nie są obserwowane, być może będziemy musieli skorzystać z …
13 causality  dag 

3
Strategie rozszerzania danych dla prognozowania szeregów czasowych
Rozważam dwie strategie „powiększania danych” w prognozowaniu szeregów czasowych. Najpierw trochę tła. Predyktor do prognozowania następnego kroku szeregu jest funkcją, która zazwyczaj zależy od dwóch rzeczy, przeszłych stanów szeregu czasowego, ale także przeszłych stanów predyktora:P.PP{ Aja}{Ai}\lbrace A_i\rbrace P.( { Ai ≤ t - 1} , PS.t - 1)P({Ai≤t−1},PSt−1)P(\lbrace A_{i\leq t-1}\rbrace,P_{S_{t-1}}) …


1
„Absolutnie ciągła zmienna losowa” vs. „Ciągła zmienna losowa”?
W książce „Twierdzenia graniczne teorii prawdopodobieństwa” Walentina V. Pietrowa dostrzegłem rozróżnienie między definicjami rozkładu będącymi „ciągłymi” a „absolutnie ciągłymi”, które są następujące: "... Rozkład zmiennej losowej X jest ciągły, jeśli P ( X ∈ B ) = 0 dla dowolnego skończonego lub policzalnego zbioru B punktów linii rzeczywistej. Mówi się, …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.