Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Nadmierna dyspersja i alternatywy modelowania w modelach efektu losowego Poissona z przesunięciami
Podczas modelowania zliczania danych z badań eksperymentalnych przy użyciu eksperymentu wewnątrz przedmiotu napotkałem szereg praktycznych pytań. Krótko opisuję eksperyment, dane i to, co do tej pory zrobiłem, a następnie moje pytania. Cztery różne filmy pokazano sekwencyjnie grupie respondentów. Po każdym filmie przeprowadzany był wywiad, w którym policzyliśmy liczbę wystąpień niektórych …

1
Domyślny optymalizator Lme4 wymaga dużej liczby iteracji dla danych wielowymiarowych
TL; DR: lme4optymalizacja wydaje się domyślnie liniowa pod względem liczby parametrów modelu i jest znacznie wolniejsza niż równoważny glmmodel ze zmiennymi fikcyjnymi dla grup. Czy mogę coś przyspieszyć? Próbuję dopasować dość duży hierarchiczny model logit (~ 50 000 wierszy, 100 kolumn, 50 grup). Dopasowywanie normalnego modelu logu do danych (ze …

2
Jak znaleźć gdy jest funkcją gęstości prawdopodobieństwa?
Jak mogę to rozwiązać? Potrzebuję równań pośrednich. Być może odpowiedź brzmi .−tf(x)−tf(x)-tf(x) ddt[∫∞txf(x)dx]ddt[∫t∞xf(x)dx] \frac{d}{dt} \left [\int_t^\infty xf(x)\,dx \right ] f(x)f(x)f(x) to funkcja gęstości prawdopodobieństwa. To znaczy, i \ lim \ limit_ {x \ to \ infty} F (x) = 1limx→∞f(x)=0limx→∞f(x)=0\lim\limits_{x \to \infty} f(x) = 0limx→∞F(x)=1limx→∞F(x)=1\lim\limits_{x \to \infty} F(x) = 1 …

1
Jaka jest różnica między „testowaniem hipotez” a „wyborem modelu”?
W literaturze oba terminy są często używane synonimicznie lub przeplatają się. Teraz próbuję znaleźć wyraźne rozróżnienie między tymi dwoma terminami. Z mojego punktu widzenia hipoteza jest zwykle wyrażana za pomocą modelu. Więc nawet jeśli przetestujemy hipotezę zerową vs. alternatywną, z mojej perspektywy dokonujemy wyboru modelu. Czy ktoś może mi intuicyjnie …

3
Prawdopodobieństwo warunkowe zmiennej ciągłej
Załóżmy, że zmienna losowa ma ciągły rozkład jednolity o parametrach 0 i 10 (tj. )UUUU∼U(0,10)U∼U(0,10)U \sim \rm{U}(0,10) Teraz oznaczmy A zdarzenie, które = 5, a B zdarzenie, które jest równe albo albo 6. Według mojego zrozumienia, oba zdarzenia mają zerowe prawdopodobieństwo wystąpienia.UUUUUU555 Teraz, jeśli rozważymy obliczenie , nie możemy użyć …


3
Jak wybrać poziom ufności?
Często używam 90% poziomu ufności, akceptując, że ma to większy stopień niepewności niż 95% lub 99%. Ale czy są jakieś wskazówki, jak wybrać odpowiedni poziom zaufania? Czy też wytyczne dotyczące poziomów ufności stosowanych w różnych dziedzinach? Czy przy interpretacji i prezentacji poziomów ufności są jakieś wskazówki, które zamieniają liczbę na …

2
Odejście od założenia normalności w ANOVA: czy kurtoza lub skośność są ważniejsze?
Zastosowane liniowe modele statystyczne Kutnera i in. stwierdza, co do odstępstw od założenia normalności modeli ANOVA: Kurtoza rozkładu błędów (mniej lub bardziej pikowany niż rozkład normalny) jest ważniejsza niż skośność rozkładu pod względem wpływu na wnioskowanie . Jestem nieco zdziwiony tym stwierdzeniem i nie udało mi się znaleźć żadnych powiązanych …

3
Potencjalne zamieszanie w projekcie eksperymentu
Omówienie pytania Ostrzeżenie: To pytanie wymaga wielu ustawień. Proszę o wyrozumiałość. Mój kolega i ja pracujemy nad projektem eksperymentu. Projekt musi obejść wiele ograniczeń, które wymienię poniżej. Opracowałem projekt, który spełnia ograniczenia i daje nam obiektywne oceny naszych efektów zainteresowania. Jednak mój kolega uważa, że ​​w projekcie występuje zamieszanie. Argumentowaliśmy …

2
Jakie są parametry tylnej części Wishart-Wishart?
Podczas wnioskowania o macierzy dokładności ΛΛ\boldsymbol{\Lambda} rozkładu normalnego używanego do generowania NNN wektorów D-wymiarowych x1,..,xNx1,..,xN\mathbf{x_1},..,\mathbf{x_N} xi∼N(μ,Λ−1)xi∼N(μ,Λ−1)\begin{align} \mathbf{x_i} &\sim \mathcal{N}(\boldsymbol{\mu, \Lambda^{-1}}) \\ \end{align} zwykle umieszczamy Wishart przed ΛΛ\boldsymbol{\Lambda} ponieważ rozkład Wishart jest koniugatem przed wykluczenie wielowymiarowego rozkładu normalnego ze znaną średnią i nieznaną wariancją: Λ∼W(υ,Λ0)Λ∼W(υ,Λ0)\begin{align} \mathbf{\Lambda} &\sim \mathcal{W}(\upsilon, \boldsymbol{\Lambda_0}) \\ \end{align} …

1
Jak czytać wyniki testu Dunna?
Jak odczytać wyniki testu Dunna ? Co konkretnie mówią mi wartości z poniższej tabeli? Posiadam dane nieparametryczne w 4 grupach i najpierw wykonałem test Kruskala-Wallisa, aby potwierdzić, że rozkłady grup były odmienne od siebie i zestaw danych zbiorczych. Następnie użyłem testu Dunna, aby zobaczyć, które grupy różnią się od siebie, …


3
Estymator największego prawdopodobieństwa wspólnego rozkładu, biorąc pod uwagę tylko marginalne liczby
Niech będzie łącznym rozkładem dwóch zmiennych kategorialnych , z . Powiedzmy, że próbek pobrano z tego rozkładu, ale podano nam tylko liczby krańcowe, mianowicie dla :px,ypx,yp_{x,y}X,YX,YX,Yx,y∈{1,…,K}x,y∈{1,…,K}x,y\in\{1,\ldots,K\}nnnj=1,…,Kj=1,…,Kj=1,\ldots,K Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j),Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j), S_j = \sum_{i=1}^{n}{\delta(X_i=l)}, T_j = \sum_{i=1}^{n}{\delta(Y_i=j)}, Jaki jest estymator największej wiarygodności dla , biorąc uwagę ? Czy to jest znane? Wykonalne obliczeniowo? Czy …

1
Regresja logistyczna z splajnami regresji w R.
Opracowuję model regresji logistycznej oparty na danych retrospektywnych z krajowej bazy danych dotyczących urazów głowy w Wielkiej Brytanii. Kluczowym rezultatem jest 30-dniowa śmiertelność (oznaczona jako miara „przetrwania”). Inne miary z opublikowanymi dowodami znaczącego wpływu na wyniki poprzednich badań obejmują: Year - Year of procedure = 1994-2013 Age - Age of …

3
Jakie są popularne opcje wizualizacji danych 4-wymiarowych?
Powiedzmy, że mam następujące czterowymiarowe dane, w których pierwsze trzy można uznać za współrzędne, a ostatnie za wartości. c1, c2, c3, value 1, 2, 6, 0.456 34, 34, 12 0.27 12, 1, 66 0.95 Jak lepiej zobrazować wpływ pierwszych trzech współrzędnych na ostatnią wartość? Mam świadomość trzech metod. Jednym z …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.