Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Prawdopodobieństwo, że ciągła zmienna losowa przyjmuje stały punkt
Jestem w klasie statystyk wprowadzających, w której funkcja gęstości prawdopodobieństwa ciągłych zmiennych losowych została zdefiniowana jako . Rozumiem, że całka z ale nie mogę tego naprawić za pomocą intuicji ciągłej zmiennej losowej. Powiedz X to zmienna losowa równa liczbie minut od czasu t, kiedy pociąg przyjeżdża. Jak obliczyć prawdopodobieństwo dotarcia …

1
Gęstość hiperpriora dla hierarchicznego modelu Gamma-Poissona
W hierarchicznym modelu danych którym wydaje się typowe w praktyce, aby wybierać wartości ( takie, że średnia i wariancja rozkładu gamma w przybliżeniu odpowiadają średniej i wariancji danych (np. Clayton i Kaldor, 1987 „Empirical Bayes Estimates of Standaryzated Age Relative Risks for Disease Mapping”, Biometrics ). Najwyraźniej jest to jednak …

2
Czy randomizacja jest wiarygodna w przypadku małych próbek?
Jerome Cornfield napisał: Jednym z najwspanialszych owoców rewolucji fisheryjskiej była idea randomizacji, a statystycy, którzy zgadzają się co do kilku innych rzeczy, przynajmniej się na to zgodzili. Ale pomimo tego porozumienia i pomimo powszechnego stosowania losowych procedur przydziału w badaniach klinicznych i innych formach eksperymentów, jego logiczny status, tj. Dokładna …

1
Szacowanie nachylenia prostej części krzywej esowatej
Dostałem to zadanie i byłem zakłopotany. Kolega poprosił mnie o oszacowanie i poniższej tabeli:xu p p e rxuppmirx_{upper}xl o w e rxlowmirx_{lower} Krzywa jest w rzeczywistości rozkładem skumulowanym, a x jest rodzajem pomiaru. Jest zainteresowany, aby wiedzieć, jakie są odpowiednie wartości na x, gdy funkcja skumulowana zaczęła być prosta i …

1
Interwał prognozy = wiarygodny interwał?
Zastanawiam się, czy przedział przewidywania i przedział wiarygodności oceniają to samo. Na przykład przy regresji liniowej, gdy szacujesz przedział predykcji dopasowanych wartości, limity przedziału, w którym spodziewana jest spadek wartości. W przeciwieństwie do przedziału ufności, nie skupiasz się na parametrze rozkładu, takim jak wartość średnia, ale na wartości, którą objaśniona …

1
Zrozumienie danych wyjściowych bootstrap wykonywanych w R (tsboot, MannKendall)
Mam pytanie dotyczące interpretacji wywołania tsboot w R. Sprawdziłem dokumentację zarówno Kendalla, jak i pakietu rozruchowego, ale nie jestem mądrzejszy niż wcześniej. Kiedy uruchamiam bootstrap, używając np. Przykładu z pakietu Kendall, gdzie statystyką testową jest tau Kendalla: library(Kendall) # Annual precipitation entire Great Lakes # The Mann-Kendall trend test confirms …
11 r  bootstrap 

2
Jak działa regresja krokowa?
Użyłem następującego kodu R, aby dopasować model probit: p1 <- glm(natijeh ~ ., family=binomial(probit), data=data1) stepwise(p1, direction='backward/forward', criterion='BIC') Chcę wiedzieć, co dokładnie robi stepwisei co robi backward/forwardi jak wybierać zmienne?

2
Jak uzyskać połączone wartości p na testach przeprowadzonych w wielu przypisanych zestawach danych?
Używając Amelii w R, uzyskałem wiele przypisanych zestawów danych. Następnie wykonałem test z powtarzanymi pomiarami w SPSS. Teraz chcę połączyć wyniki testu. Wiem, że mogę używać reguł Rubina (zaimplementowanych w dowolnym pakiecie wielokrotnej imputacji w R) do łączenia średnich i standardowych błędów, ale jak mam łączyć wartości p? Czy to …


1
Uśrednianie precyzji i przywoływanie podczas korzystania z weryfikacji krzyżowej
Przeprowadziłem klasyfikację przy użyciu wielu klasyfikatorów dla danych oznaczonych 2 klasami i użyłem 5-krotnej walidacji krzyżowej. Dla każdej zakładki obliczyłem tp, tn, fp i fn. Następnie obliczyłem dokładność, precyzję, wycofanie i wynik F dla każdego testu. Moje pytanie brzmi: kiedy chcę uśrednić wyniki, wziąłem średnią dokładności, ale czy mogę również …

4
Jak wybrać liczbę drzew w uogólnionym modelu regresji wzmocnionej?
Czy istnieje strategia wyboru liczby drzew w GBM? W szczególności, ntreesargument R„s gbmfunkcji. Nie rozumiem, dlaczego nie powinieneś ustawić ntreesnajwyższej rozsądnej wartości. Zauważyłem, że większa liczba drzew wyraźnie zmniejsza zmienność wyników z wielu GBM. Nie sądzę, aby duża liczba drzew prowadziła do nadmiernego dopasowania. jakieś pomysły?

2
W jakich ustawieniach przedziały ufności nie poprawiłyby się wraz ze wzrostem wielkości próbki?
W poście na blogu znalazłem to twierdzenie „Uważam, że WG Cochrane po raz pierwszy zwrócił uwagę (mniej więcej w latach siedemdziesiątych), że przy przedziałach ufności w warunkach obserwacyjnych, małe rozmiary próbek zapewniają lepsze pokrycie wystarczającą ilością dużych próbek zapewniających pokrycie prawie zerowe!” Teraz zakładam, że szerokość CI powinna zbliżać się …

2
Klasyfikacja szeregów czasowych - bardzo słabe wyniki
Pracuję nad problemem klasyfikacji szeregów czasowych, w którym dane wejściowe to dane użycia głosu w szeregu czasowym (w sekundach) przez pierwsze 21 dni konta telefonu komórkowego. Odpowiednią zmienną docelową jest to, czy to konto zostało anulowane w przedziale 35-45 dni. Jest to więc problem z klasyfikacją binarną. Otrzymuję bardzo słabe …

1
R neuralnet - compute daje stałą odpowiedź
Próbuję użyć neuralnetpakietu R ( tutaj dokumentacji ) do przewidywania. Oto, co próbuję zrobić: library(neuralnet) x <- cbind(runif(50, min=1, max=500), runif(50, min=1, max=500)) y <- x[, 1] * x[, 2] train <- data.frame(x, y) n <- names(train) f <- as.formula(paste('y ~', paste(n[!n %in% 'y'], collapse = ' + '))) net …

1
Przykład oceny maksymalnej a posteriori
Czytałem o oszacowaniu maksymalnego prawdopodobieństwa i oszacowaniu maksymalnego a posteriori i jak dotąd spotkałem się z konkretnymi przykładami tylko z oszacowaniem maksymalnego prawdopodobieństwa. Znalazłem kilka abstrakcyjnych przykładów maksymalnego oszacowania a posteriori, ale nic konkretnego jeszcze z liczbami: S. Może być bardzo przytłaczający, działa tylko z abstrakcyjnymi zmiennymi i funkcjami, a …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.