Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Rozkład prawdopodobieństwa grupowania - metody i mierniki?
Mam pewne punkty danych, każdy zawierający 5 wektorów aglomerowanych wyników dyskretnych, wyniki każdego wektora generowane przez inny rozkład (konkretny rodzaj, którego nie jestem pewien, najlepiej zgaduję, że Weibull, z parametrem kształtu zmieniającym się gdzieś w pobliżu wykładniczej mocy prawo (od 1 do 0, z grubsza).) Chcę użyć algorytmu klastrowania, takiego …

2
MCMC zbiega się w jedną wartość?
Próbuję dopasować model hierarchiczny za pomocą jags i pakietu rjags. Moja zmienna wyniku to y, która jest sekwencją prób bernoulli. Mam 38 ludzi, którzy występują w dwóch kategoriach: P i M. Na podstawie mojej analizy każdy mówca ma prawdopodobieństwo sukcesu w kategorii P i prawdopodobieństwo sukcesu w kategorii M . …

1
Wyniki PCA i składników oparte na kombinacji zmiennych ciągłych i binarnych
Chcę zastosować PCA do zestawu danych, który składa się ze zmiennych typu mieszanego (ciągłego i binarnego). Aby zilustrować tę procedurę, wklejam minimalny odtwarzalny przykład w R poniżej. # Generate synthetic dataset set.seed(12345) n <- 100 x1 <- rnorm(n) x2 <- runif(n, -2, 2) x3 <- x1 + x2 + rnorm(n) …
13 r  pca 

1
Interpretacja wyników regresji logistycznej w R.
Pracuję na wielokrotnej regresji logistycznej w R użyciem glm. Zmienne predykcyjne są ciągłe i kategoryczne. Wyciąg z podsumowania modelu pokazuje, co następuje: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 2.451e+00 2.439e+00 1.005 0.3150 Age 5.747e-02 3.466e-02 1.658 0.0973 . BMI -7.750e-02 7.090e-02 -1.093 0.2743 ... --- Signif. codes: 0 …


2
Wzór na autokorelację w R vs. Excel
Próbuję dowiedzieć się, w jaki sposób R oblicza autokorelację lag-k (najwyraźniej jest to ta sama formuła stosowana przez Minitab i SAS), dzięki czemu mogę ją porównać do korzystania z funkcji CORREL programu Excel zastosowanej do serii i jej wersji z opóźnieniem k. R i Excel (przy użyciu CORREL) dają nieco …
13 r  sas  autocorrelation  excel 

7
Co oznacza złoty standard?
Czytając kilka artykułów, natknąłem się na termin „złoty zestaw” lub „złoty standard”. Czego nie rozumiem, co sprawia, że ​​zestaw danych jest złotym standardem? Akceptacja rówieśnicza, liczenie cytatów ma znaczenie, a jeśli jest to swoboda badacza i związek z problemem, który atakuje?

1
Interpretacja pasków zakresu w wykresie R.'s.stl?
Mam problem z ustaleniem, co plot.stldokładnie oznaczają słupki zasięgu . Znalazłem post Gavina na to pytanie i przeczytałem również dokumentację, rozumiem, że mówią one o względnej wielkości rozłożonych komponentów, ale nadal nie jestem całkowicie pewien, jak działają. Na przykład: dane: malutki słupek, brak skali sezonowej: pełny słupek, ze skalą w …
13 r  time-series 



2
Interrater niezawodność dla zdarzeń w szeregu czasowym z niepewnością co do czasu zdarzenia
Mam wielu niezależnych programistów, którzy próbują zidentyfikować zdarzenia w szeregu czasowym - w tym przypadku oglądam wideo rozmowy twarzą w twarz i szukam określonych zachowań niewerbalnych (np. Skinienie głową) oraz kodują czas i kategorię każdego z nich zdarzenie. Dane te można rozsądnie potraktować jako szereg dyskretny w czasie o wysokiej …

3
Testowanie nieliniowości w regresji logistycznej (lub innych formach regresji)
Jednym z założeń regresji logistycznej jest liniowość logitu. Po uruchomieniu modelu testuję nieliniowość za pomocą testu Box-Tidwell. Jeden z moich ciągłych predyktorów (X) dał wynik dodatni pod kątem nieliniowości. Co mam teraz zrobić? Ponieważ jest to naruszenie założeń, muszę pozbyć się predyktora (X) lub dołączyć transformację nieliniową (X * X). …


1
Dwupróbkowy test T z ważonymi danymi
Chcę wykonać test T z dwiema próbkami, aby sprawdzić różnicę między dwiema niezależnymi próbkami, z których każda próbka spełnia założenia testu T (można założyć, że każdy rozkład jest niezależny i identycznie rozłożony jak normalny z jednakową wariancją) . Jedyną komplikacją wynikającą z podstawowego testu T z dwoma próbkami jest to, …
13 t-test 

4
Jaki jest rozkład OR (iloraz szans)?
Mam kilka artykułów prezentujących „OR” z przedziałem ufności 95% (przedziały ufności). Chcę oszacować na podstawie artykułów wartość P dla obserwowanego OR. W tym celu potrzebuję założenia dotyczącego rozkładu sali operacyjnej. Jaką dystrybucję mogę bezpiecznie założyć / wykorzystać?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.