Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Dlaczego błąd „szacunkowa korekta” a „NA” jest generowany z pakietu rozruchowego R podczas obliczania przedziałów ufności przy użyciu metody bca?
Mam wektor liczb, które przesłałem tutaj (... / code / MyData.Rdata) przy użyciu dput. Chciałbym dostać bca ci, więc napisałem ten kod: my.mean <- function(dat, idx){ return (mean(dat[idx], na.rm = TRUE)) } boot.out<-boot(data=my.data, statistic = my.mean, R=1000) Ale gdy uruchomię następujące, otrzymuję to: > boot.ci(boot.out) Error in bca.ci(boot.out, conf, index[1L], …
14 r  bootstrap 

3
Wydajna obliczeniowo estymacja trybu wielowymiarowego
Wersja skrócona: Jaka jest najbardziej wydajna obliczeniowo metoda szacowania trybu wielowymiarowego zestawu danych, próbkowanego z ciągłego rozkładu? Wersja długa: Mam zestaw danych, który muszę oszacować dla trybu. Tryb nie pokrywa się ze średnią lub medianą. Przykład pokazano poniżej, jest to przykład 2D, ale rozwiązanie ND byłoby lepsze: Obecnie moją metodą …

2
Szacowanie prawdopodobieństwa przeżycia w R
Na podstawie próby czasów przeżycia chciałbym oszacować prawdopodobieństwo przeżycia czasu dla pewnego określonego za pomocą estymatora Kaplana-Meiera. Czy można to zrobić w ? Pamiętaj, że nie musi być czasem zdarzenia.nnnttttttRttt
14 r  kaplan-meier 

1
Czy jednostronne przedziały ufności mają 95% zasięgu
Zastanawiałem się, czy przy założeniu jednostronnej (jednostronnej) hipotezy o poziomie alfa: .05czy możemy mówić o 95% przedziałach ufności? Na przykład, czy możemy skonstruować osobno „jednostronne” i „dwustronne” przedziały ufności dla jednostronnego testu Z lub t? jaka byłaby „interpretacja” każdego z tych przedziałów ufności, biorąc pod uwagę jednostronny test? Jestem trochę …

2
Klasyfikacja z głośnymi etykietami?
Próbuję wytrenować sieć neuronową do klasyfikacji, ale etykiety, które mam, są raczej hałaśliwe (około 30% etykiet jest błędnych). Strata między entropią rzeczywiście działa, ale zastanawiałem się, czy są jakieś alternatywy bardziej skuteczne w tym przypadku? czy utrata przez entropię jest optymalna? Nie jestem pewien, ale myślę o pewnym „przycięciu” utraty …





4
Intuicyjne zrozumienie różnicy między konsekwentnym a asymptotycznie bezstronnym
Staram się uzyskać intuicyjne zrozumienie i wyczuć różnicę i praktyczną różnicę między terminem spójnym a asymptotycznie bezstronnym. Znam ich matematyczne / statystyczne definicje, ale szukam czegoś intuicyjnego. Dla mnie, patrząc na ich indywidualne definicje, prawie wydają się być tym samym. Zdaję sobie sprawę, że różnica musi być subtelna, ale po …

4
Sieć neuronowa do regresji wielokrotnego wyjścia
Mam zestaw danych zawierający 34 kolumny wejściowe i 8 kolumn wyjściowych. Jednym ze sposobów rozwiązania tego problemu jest pobranie 34 danych wejściowych i zbudowanie indywidualnego modelu regresji dla każdej kolumny wyjściowej. Zastanawiam się, czy ten problem można rozwiązać za pomocą tylko jednego modelu, szczególnie za pomocą sieci neuronowej. Użyłem perceptronu …

2
Jaki jest rozkład przykładowych środków rozkładu Cauchyego?
Zazwyczaj, gdy pobiera się losowe średnie próbki rozkładu (przy wielkości próbki większej niż 30), uzyskuje się rozkład normalny ześrodkowywany wokół wartości średniej. Słyszałem jednak, że rozkład Cauchy'ego nie ma żadnej wartości średniej. Jaki rozkład uzyskuje się wtedy, gdy uzyskuje się przykładowe środki rozkładu Cauchy'ego? Zasadniczo dla rozkładu Cauchy jest niezdefiniowany, …
14 cauchy 

1
Interpretacja wyników .L i .Q z ujemnego dwumianowego GLM z danymi kategorialnymi
Właśnie uruchomiłem ujemny dwumianowy GLM i to jest wynik: Call: glm.nb(formula = small ~ method + site + depth, data = size.dat, init.theta = 1.080668549, link = log) Deviance Residuals: Min 1Q Median 3Q Max -2.2452 -0.9973 -0.3028 0.3864 1.8727 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.6954 0.1152 …


1
Czy regresja logistyczna maksymalizująca prawdopodobieństwo niekoniecznie maksymalizuje AUC w porównaniu z modelami liniowymi?
Biorąc pod uwagę zestaw danych z wynikami binarnymi i pewną macierzą predykcyjną , standardowy model regresji logistycznej szacuje współczynniki które maksymalizują prawdopodobieństwo dwumianowe. Gdy ma pełną pozycję, jest unikalny; gdy nie ma doskonałej separacji, jest skończona.y∈{0,1}ny∈{0,1}ny\in\{0,1\}^nX∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p}βMLEβMLE\beta_{MLE}XXXβMLEβMLE\beta_{MLE} Czy ten model maksymalnego prawdopodobieństwa maksymalizuje AUC ROC (aka statystyka), czy też istnieje …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.