Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
W jaki sposób oszacowanie maksymalnego prawdopodobieństwa ma przybliżony rozkład normalny?
Czytałem o MLE jako metodzie generowania dopasowanego rozkładu. Natknąłem się na stwierdzenie , że szacunki maksymalnego prawdopodobieństwa „mają przybliżone rozkłady normalne”. Czy to oznacza, że ​​jeśli zastosuję MLE wielokrotnie w stosunku do moich danych i rodziny dystrybucji, do której próbuję się dopasować, modele, które otrzymam, będą normalnie dystrybuowane? Jak dokładnie …

3
Intuicja na temat wspólnej entropii
Mam problem z budowaniem intuicji na temat wspólnej entropii. H.( X, Y)H(X,Y)H(X,Y) = niepewność w łącznym rozkładzie p ( x , y)p(x,y)p(x,y); H.( X)H(X)H(X) = niepewność w px( x )px(x)p_x(x); H.( Y)H(Y)H(Y) = niepewność w py( y)py(y)p_y(y). Jeśli H (X) jest wysoki, rozkład jest bardziej niepewny, a jeśli znasz wynik …

1
Dopasowanie zmiennego w czasie współczynnika DLM
Chcę dopasować DLM ze zmiennymi w czasie współczynnikami, tj. Rozszerzeniem zwykłej regresji liniowej, yt=θ1+θ2)x2)yt=θ1+θ2)x2)y_t = \theta_1 + \theta_2x_2. Mam predyktor (x2)x2)x_2) i zmienną odpowiedzi (ytyty_t), coroczne połowy ryb morskich i śródlądowych odpowiednio w latach 1950–2011. Chcę, aby postępował model regresji DLM, yt=θt , 1+θt , 2xtyt=θt,1+θt,2)xty_t = \theta_{t,1} + \theta_{t,2}x_t …


1
Czy powinienem zgłaszać wiarygodne przedziały zamiast przedziałów ufności?
Po natknięciu się na tę koncepcję w podręczniku statystycznym, próbowałem ją owinąć głową i ostatecznie doszedłem do wniosku, który wydaje się pasować do wszystkich wyjaśnień, które do tej pory widziałem: wiarygodny przedział jest tym, co statystycy uważają za pewną interwał wynosi. Dygresja dla osób takich jak ja sprzed godziny, które …


1
Dziwny sposób obliczania chi-kwadrat w Excelu vs R.
Patrzę na arkusz programu Excel, który twierdzi, że oblicza χ2)χ2\chi^2, ale nie rozpoznaję tego sposobu i zastanawiałem się, czy coś mi umknęło. Oto dane, które analizuje: +------------------+----------+----------+ | Total Population | Observed | Expected | +------------------+----------+----------+ | 2000 | 42 | 32.5 | | 2000 | 42 | 32.5 | …
9 r  chi-squared  excel 

1
Stosujesz regresję kalenicową dla nieokreślonego układu równań?
Gdy , problem najmniejszych kwadratów, który nakłada sferyczne ograniczenie na wartość można zapisać jako dla zbyt określonego systemu. \ | \ cdot \ | _2 to euklidesowa norma wektora.y=Xβ+ey=Xβ+ey = X\beta + eδδ\deltaββ\betamin ∥y−Xβ∥22s.t. ∥β∥22≤δ2min⁡ ‖y−Xβ‖22s.t.⁡ ‖β‖22≤δ2\begin{equation} \begin{array} &\operatorname{min}\ \| y - X\beta \|^2_2 \\ \operatorname{s.t.}\ \ \|\beta\|^2_2 \le \delta^2 …


1
Czy można użyć ponownego próbkowania bootstrap do obliczenia przedziału ufności dla wariancji zestawu danych?
Wiem, że jeśli powtórzysz próbkę z zestawu danych wiele razy i za każdym razem obliczysz średnią, średnie te będą zgodne z rozkładem normalnym (według CLT). W ten sposób można obliczyć przedział ufności na podstawie średniej zbioru danych, nie przyjmując żadnych założeń dotyczących rozkładu prawdopodobieństwa zbioru danych. Zastanawiałem się, czy możesz …


1
Oczekiwanie na sumę liczb K bez wymiany
Biorąc pod uwagę liczb, gdzie wartość każdej liczby jest inna, oznaczona jako , a prawdopodobieństwo wyboru każdej liczby wynosi odpowiednio .nnnv1,v2,...,vnv1,v2,...,vnv_1, v_2, ..., v_np1,p2,...,pnp1,p2,...,pnp_1, p_2, ..., p_n Teraz, jeśli liczby na podstawie podanych prawdopodobieństw, gdzie , jakie jest oczekiwanie sumy tych liczb ? Zauważ, że zaznaczenie nie jest zastępowane, więc …

2
Znaczenie reprezentowania simpleksu jako powierzchni trójkąta w rozkładzie Dirichleta?
Czytam z książki, która przedstawia dystrybucję Dirchilet, a następnie przedstawiłam dane na jej temat. Ale tak naprawdę nie byłem w stanie zrozumieć tych liczb. Dołączyłem figurę tutaj na dole. To, czego nie rozumiem, to znaczenie trójkątów. Zwykle, gdy chce się wykreślić funkcję 2 zmiennych, bierze się wartość var1 i va2, …

1
Konfiguracja danych dla różnic w różnicach
Która konfiguracja jest poprawna dla używanego modelu regresji różnicowej Yist=α+γs∗T+λdt+δ∗(T∗dt)+ϵistYist=α+γs∗T+λdt+δ∗(T∗dt)+ϵistY_{ist} = \alpha +\gamma_s*T + \lambda d_t + \delta*(T*d_t)+ \epsilon_{ist} gdzie T jest manekinem, który jest równy 1, jeśli obserwacja pochodzi z grupy badanej, a d jest manekinem, który jest równy 1 w okresie po wystąpieniu leczenia 1) Losowe próbki z …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.