Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


5
Badanie autokorelacji: Ljung-Box kontra Breusch-Godfrey
Przyzwyczaiłem się do częstego używania testu Ljunga-Boxa do testowania autokorelacji w surowych danych lub resztkach modelu. Prawie zapomniałem, że istnieje inny test autokorelacji, mianowicie test Breusch-Godfrey. Pytanie: jakie są główne różnice i podobieństwa w testach Ljunga-Boxa i Breuscha-Godfreya i kiedy należy je preferować? (Referencje są mile widziane. Jakoś nie udało …

1
Regresja kwantowa: Jakie błędy standardowe?
summary.rqFunkcja z winiet quantreg oferuje wiele opcji dla standardowych szacunków błędach współczynników regresji kwantylowych. Jakie są specjalne scenariusze, w których każdy z nich staje się optymalny / pożądany? „ranga”, która wytwarza przedziały ufności dla oszacowanych parametrów poprzez odwrócenie testu rang, jak opisano w Koenker (1994). Domyślna opcja zakłada, że ​​błędy …


3
Jak interpretować macierz OOB i zamieszanie dla losowego lasu?
Mam od kogoś skrypt R do uruchomienia losowego modelu lasu. Zmodyfikowałem i uruchomiłem go z niektórymi danymi pracowników. Staramy się przewidzieć dobrowolne separacje. Oto kilka dodatkowych informacji: jest to model klasyfikacji, w którym 0 = pracownik został, 1 = pracownik został zakończony, obecnie obserwujemy tylko tuzin zmiennych predykcyjnych, dane są …

3
Jak pobrać pochodną wielowymiarowej gęstości normalnej?
Powiedzmy, że mam wielowymiarową normalną gęstość . Chcę uzyskać drugą (częściową) pochodną wrt . Nie wiem, jak pobrać pochodną macierzy.N(μ,Σ)N(μ,Σ)N(\mu, \Sigma)μμ\mu Wiki mówi, że weź pochodną element po elemencie do matrycy. Pracuję z aproksymacją Laplace'a Tryb to .Θ = μlogPN(θ)=logPN−12(θ−θ^)TΣ−1(θ−θ^).log⁡PN(θ)=log⁡PN−12(θ−θ^)TΣ−1(θ−θ^).\log{P}_{N}(\theta)=\log {P}_{N}-\frac{1}{2}{(\theta-\hat{\theta})}^{T}{\Sigma}^{-1}(\theta-\hat{\theta}) \>.θ^=μθ^=μ\hat\theta=\mu Dostałem jak do tego doszło?Σ−1=−∂2∂θ2logp(θ^|y),Σ−1=−∂2∂θ2log⁡p(θ^|y),{\Sigma}^{-1}=-\frac{{{\partial }^{2}}}{\partial {{\theta }^{2}}}\log …


2
Co to jest symetria złożona w języku angielskim?
I ostatnio sobie sprawę , że model mieszany tylko z przedmiotu jako przypadkowy czynnik i inne czynniki, jak czynniki stałe po ustawieniu korelacyjnej struktury mieszanego modelu do związku symetrii równoważna ANOVA. Dlatego chciałbym wiedzieć, co oznacza symetria złożona w kontekście mieszanej (tj. Podzielonej fabuły) analizy wariancji, najlepiej wyjaśnionej prostym językiem …

5
Jakie jest dobre zastosowanie funkcji „komentowania” w języku R?
Właśnie odkryłem commentfunkcję w R. Przykład: x <- matrix(1:12, 3,4) comment(x) <- c("This is my very important data from experiment #0234", "Jun 5, 1998") x comment(x) Po raz pierwszy przyszedłem przez tę funkcję i zastanawiałem się, jakie są jej typowe / użyteczne zastosowania. Ponieważ wyszukiwanie „komentarza R” w google i …
35 r 

4
Uzasadnienie jednostronnego testowania hipotez
Rozumiem dwustronne testowanie hipotez. Masz (vs. H 1 = ¬ H 0 : θ ≠ θ 0 ). Wartość p jest prawdopodobieństwem, że θ generuje dane co najmniej tak ekstremalne, jak zaobserwowano.H0:θ=θ0H0:θ=θ0H_0 : \theta = \theta_0H1=¬H0:θ≠θ0H1=¬H0:θ≠θ0H_1 = \neg H_0 : \theta \ne \theta_0pppθθ\theta Nie rozumiem jednostronnego testowania hipotez. Tutaj (vs …

7
Wybór zmiennych do uwzględnienia w modelu wielokrotnej regresji liniowej
Obecnie pracuję nad zbudowaniem modelu przy użyciu wielokrotnej regresji liniowej. Po manipulowaniu moim modelem nie jestem pewien, jak najlepiej określić, które zmienne zachować, a które usunąć. Mój model zaczął się od 10 predyktorów dla DV. Przy zastosowaniu wszystkich 10 predyktorów cztery zostały uznane za znaczące. Jeśli usunę tylko niektóre z …



5
Dlaczego zwiększenie wielkości próby obniża wariancję (próbkowanie)?
Duży obraz: Próbuję zrozumieć, jak zwiększenie wielkości próbki zwiększa moc eksperymentu. Slajdy mojego wykładowcy wyjaśniają to za pomocą obrazu 2 rozkładów normalnych, jednego dla hipotezy zerowej i drugiego dla hipotezy alternatywnej i progu decyzyjnego c między nimi. Twierdzą, że zwiększenie wielkości próby obniży wariancję, a tym samym spowoduje wyższą kurtozę, …

1
Wykrywanie wartości odstających w szeregach czasowych (LS / AO / TC) przy użyciu pakietu tsoutliers w R. Jak reprezentować wartości odstające w formacie równania?
Komentarz: Po pierwsze chciałbym powiedzieć wielkie dziękuję do autora nowego tsoutliers pakietu, który implementuje Chen i Liu wykrywania szeregi czasowe poboczna, które zostało opublikowane w Journal of American Statistical Association w 1993 roku w oprogramowanie open source .RRR Pakiet wykrywa 5 różnych typów wartości odstających iteracyjnie w danych szeregów czasowych: …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.