Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jak uzyskać wartości p współczynników z regresji bootstrap?
Z Quick-R Roberta Kabacoffa mam # Bootstrap 95% CI for regression coefficients library(boot) # function to obtain regression weights bs <- function(formula, data, indices) { d <- data[indices,] # allows boot to select sample fit <- lm(formula, data=d) return(coef(fit)) } # bootstrapping with 1000 replications results <- boot(data=mtcars, statistic=bs, R=1000, …

1
Porównanie dwóch próbek proporcji, oszacowanie wielkości próby: R vs Stata
Porównanie dwóch próbek proporcji, oszacowanie wielkości próby: R vs Stata Otrzymałem różne wyniki dla wielkości próbek, jak następuje: W R. power.prop.test(p1 = 0.70, p2 = 0.85, power = 0.90, sig.level = 0.05) Wynik: (czyli 161) dla każdej grupy.n=160.7777n=160.7777n = 160.7777 W Stacie sampsi 0.70 0.85, power(0.90) alpha(0.05) Wynik: dla każdej …

4
Dlaczego KNN nie jest „oparty na modelach”?
ESL rozdział 2.4 wydaje się klasyfikować regresję liniową jako „opartą na modelu”, ponieważ zakłada , podczas gdy nie podano podobnego przybliżenia dla najbliższych sąsiadów. Ale czy obie metody nie przyjmują założeń dotyczących ?f(x)≈x⋅βf(x)≈x⋅βf(x) \approx x\cdot\betaf(x)f(x)f(x) Później w 2.4 mówi nawet: Najmniejsze kwadraty zakładają, że jest dobrze przybliżone przez globalnie liniową …

1
Czy losowe lasy mogą zrobić znacznie lepiej niż błąd testowy 2,8% na MNIST?
Nie znalazłem żadnej literatury na temat zastosowania Losowych Lasów do MNIST, CIFAR, STL-10 itp., Więc pomyślałem, że sam spróbuję ich z MNIST niezmienniczymi permutacjami. W R próbowałem: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) Trwało to 2 godziny i wystąpił błąd testu 2,8%. Próbowałem też scikit-learn , z RandomForestClassifier(n_estimators=2000, max_features="auto", max_depth=None) Po …


2
Test niezależności a test jednorodności
Uczę podstawowego kursu statystycznego i dziś obejmę test niezależności chi-kwadrat dla dwóch kategorii oraz test jednorodności. Te dwa scenariusze są koncepcyjnie różne, ale mogą wykorzystywać tę samą statystykę testową i rozkład. W teście jednorodności zakłada się, że krańcowe wartości dla jednej z kategorii są częścią samego projektu - reprezentują liczbę …


2
Klasyfikator tylko dla jednej klasy
W prostej klasyfikacji mamy dwie klasy: klasa-0 i klasa-1. W niektórych danych mam tylko wartości dla klasy-1, więc żadnej dla klasy-0. Teraz myślę o stworzeniu modelu do modelowania danych dla klasy 1. Tak więc, kiedy pojawiają się nowe dane, model ten jest stosowany do nowych danych i znajduje prawdopodobieństwo określające …




1
Jakiego testu statystycznego należy użyć do testowania wzbogacenia list genów?
Przeprowadziłem eksperyment, aby przetestować wrażliwość komórkową na określony czynnik uszkadzający DNA. Znaleźliśmy 270 genów, które były szczególnie wrażliwe na lek, a całkowita liczba analizowanych genów wyniosła 3668. 38 z 270 wrażliwych genów jest klasyfikowanych jako „geny naprawy DNA”. Jeśli liczba „genów naprawy DNA” zawartych w genomie wynosi 112, a całkowita …

1
Zaloguj prawdopodobieństwo dla GLM
W poniższym kodzie wykonuję regresję logistyczną zgrupowanych danych za pomocą glm i „ręcznie” za pomocą mle2. Dlaczego funkcja logLik w R daje mi logarytm logLik (fit.glm) = - 2,336, który jest inny niż logLik (fit.ml) = - 5,514, który otrzymuję ręcznie? library(bbmle) #successes in first column, failures in second Y …

1
Jaka jest różnica między prawdopodobieństwem a logiką rozmytą?
Od lat pracuję z logiką rozmytą (FL) i wiem, że istnieją różnice między FL a prawdopodobieństwem, szczególnie dotyczące sposobu radzenia sobie z niepewnością. Chciałbym jednak zapytać, jakie różnice istnieją między FL a prawdopodobieństwem? Innymi słowy, jeśli mam do czynienia z prawdopodobieństwami (łączenie informacji, agregowanie wiedzy), czy mogę zrobić to samo …
10 bayes  fuzzy 


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.