Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
R-kwadrat w regresji kwantowej
Korzystam z regresji kwantowej, aby znaleźć predyktory 90. percentyla moich danych. Robię to w R za pomocą quantregpakietu. Jak mogę określić dla regresji kwantylowej, która wskaże, ile zmienności wyjaśnia zmienne predykcyjne?r2r2r^2 To, co naprawdę chcę wiedzieć: „Jakąkolwiek metodę, której mogę użyć, aby dowiedzieć się, ile wyjaśniono zmienności?”. Poziom istotności według …

8
Jak możesz wyobrazić sobie związek między 3 zmiennymi kategorycznymi?
Mam zestaw danych z trzema zmiennymi kategorialnymi i chcę wizualizować związek między wszystkimi trzema na jednym wykresie. Jakieś pomysły? Obecnie używam następujących trzech wykresów: Każdy wykres dotyczy poziomu depresji wyjściowej (łagodny, umiarkowany, ciężki). Następnie na każdym wykresie patrzę na związek między leczeniem (0,1) a poprawą depresji (brak, umiarkowany, znaczny). Te …





3
Przeanalizuj wykresy ACF i PACF
Chcę sprawdzić, czy jestem na dobrej drodze, analizując moje wykresy ACF i PACF: Tło: (Reff: Philip Hans Franses, 1998) Ponieważ zarówno ACF, jak i PACF wykazują znaczące wartości, zakładam, że model ARMA spełni moje potrzeby ACF można wykorzystać do oszacowania części MA, tj. Wartości q, PACF można wykorzystać do oszacowania …

1
Wybór modelu z regresją logistyczną Firtha
W małym zestawie danych ( ), z którym pracuję, kilka zmiennych daje mi idealne przewidywanie / separację . Dlatego do rozwiązania tego problemu używam regresji logistycznej Firtha .n ∼ 100n∼100n\sim100 Jeżeli wybiorę najlepszy model według AIC lub BIC , czy powinienem uwzględnić prawdopodobieństwo kary Firth przy obliczaniu tych kryteriów informacyjnych?


2
Jaki jest związek między wynikiem GINI a współczynnikiem logarytmu prawdopodobieństwa
Studiuję drzewa klasyfikacji i regresji, a jedną z miar podziału lokalizacji jest wynik GINI. Teraz jestem przyzwyczajony do określania najlepszego podziału lokalizacji, gdy logarytm stosunku prawdopodobieństwa tych samych danych między dwiema dystrybucjami wynosi zero, co oznacza, że ​​prawdopodobieństwo członkostwa jest równie prawdopodobne. Moja intuicja mówi, że musi istnieć jakieś połączenie, …

2
Jak zastosować dwumianowy GLMM (glmer) do wartości procentowych zamiast tak-nie ma znaczenia?
Mam eksperyment z powtarzanymi pomiarami, w którym zmienna zależna jest procentem, i mam wiele czynników jako zmienne niezależne. Chciałbym użyć glmerpakietu R, lme4aby potraktować go jako problem z regresją logistyczną (poprzez określenie family=binomial), ponieważ wydaje się, że bezpośrednio dostosowuje się on do tej konfiguracji. Moje dane wyglądają tak: > head(data.xvsy) …




2
Łączenie informacji z wielu badań w celu oszacowania średniej i wariancji normalnie rozłożonych danych - podejścia bayesowskie a metaanalityczne
Przejrzałem zestaw artykułów, z których każdy podaje obserwowaną średnią i SD pomiaru w odpowiedniej próbce o znanej wielkości, n . Chcę jak najlepiej zgadnąć, jaki jest prawdopodobny rozkład tej samej miary w nowym opracowaniu, które projektuję, i ile niepewności jest w tym przypuszczeniu. Z przyjemnością przyjmuję X ∼ N ( …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.