Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



7
Dlaczego źle jest uczyć uczniów, że wartości p to prawdopodobieństwo, że odkrycia wynikają z przypadku?
Czy ktoś może przedstawić mi zwięzłe wyjaśnienie, dlaczego nie warto uczyć studentów, że prob jest wartością p (ich odkrycia wynikają z [losowej] szansy). Rozumiem, że wartość p jest prob (uzyskanie bardziej ekstremalnych danych | hipoteza zerowa jest prawdziwa). Moim prawdziwym zainteresowaniem jest szkoda , że mogę powiedzieć im, że jest …


4
Jak interpretować średnią z fabuły Silhouette?
Próbuję użyć wykresu sylwetki, aby określić liczbę klastrów w moim zestawie danych. Biorąc pod uwagę zestaw danych Train , użyłem następującego kodu Matlab Train_data = full(Train); Result = []; for num_of_cluster = 1:20 centroid = kmeans(Train_data,num_of_cluster,'distance','sqeuclid'); s = silhouette(Train_data,centroid,'sqeuclid'); Result = [ Result; num_of_cluster mean(s)]; end plot( Result(:,1),Result(:,2),'r*-.');` Powstały wykres …

3
Dlaczego t-SNE nie jest stosowany jako technika redukcji wymiarów do grupowania lub klasyfikacji?
W ostatnim zadaniu powiedziano nam, abyśmy używali PCA na cyfrach MNIST, aby zmniejszyć wymiary z 64 (8 x 8 obrazów) do 2. Następnie musieliśmy grupować cyfry za pomocą Gaussian Mixture Model. PCA wykorzystujące tylko 2 główne komponenty nie daje wyraźnych klastrów, w wyniku czego model nie jest w stanie wytworzyć …

3
Jak interpretować średni spadek dokładności i średni spadek GINI w losowych modelach leśnych
Mam trudności ze zrozumieniem, jak interpretować dane wyjściowe o zmiennej ważności z pakietu Losowy las. Średni spadek dokładności jest zwykle opisywany jako „spadek dokładności modelu po permutacji wartości w każdej funkcji”. Czy to stwierdzenie o obiekcie jako całości, czy o określonych wartościach w obiekcie? W obu przypadkach, czy średni spadek …




3
Dlaczego istnieje różnica pomiędzy ręcznym obliczeniem regresji logistycznej 95% przedziału ufności a użyciem funkcji confint () w R?
Drodzy wszyscy - zauważyłem coś dziwnego, czego nie potrafię wyjaśnić, prawda? Podsumowując: ręczne podejście do obliczania przedziału ufności w modelu regresji logistycznej oraz funkcja R confint()dają różne wyniki. Przechodziłem przez regresję logistyczną stosowaną przez Hosmer & Lemeshow (2. edycja). W trzecim rozdziale znajduje się przykład obliczenia ilorazu szans i 95% …
34 r  regression  logistic  confidence-interval  profile-likelihood  correlation  mcmc  error  mixture  measurement  data-augmentation  r  logistic  goodness-of-fit  r  time-series  exponential  descriptive-statistics  average  expected-value  data-visualization  anova  teaching  hypothesis-testing  multivariate-analysis  r  r  mixed-model  clustering  categorical-data  unsupervised-learning  r  logistic  anova  binomial  estimation  variance  expected-value  r  r  anova  mixed-model  multiple-comparisons  repeated-measures  project-management  r  poisson-distribution  control-chart  project-management  regression  residuals  r  distributions  data-visualization  r  unbiased-estimator  kurtosis  expected-value  regression  spss  meta-analysis  r  censoring  regression  classification  data-mining  mixture 

5
Znajdź oczekiwaną wartość za pomocą CDF
Zacznę od stwierdzenia, że ​​jest to zadanie domowe od samego początku. Spędziłem kilka godzin, szukając sposobu na znalezienie oczekiwanych wartości i zdecydowałem, że nic nie rozumiem. Niech XXX ma CDF F(x)=1−x−α,x≥1F(x)=1−x−α,x≥1F(x) = 1 - x^{-\alpha}, x\ge1 . Znajdź E(X)E(X)E(X) dla tych wartości dla którychαα\alphaE(X)E(X)E(X) istnieje . Nie mam pojęcia, jak …


3
Co oznacza „słaby uczeń”?
Czy ktoś może mi powiedzieć, co oznacza wyrażenie „słaby uczeń”? Czy to ma być słaba hipoteza? Jestem zmieszany relacją między słabym uczniem a słabym klasyfikatorem. Czy oba są takie same, czy jest jakaś różnica? W algorytmie adaboost, T=10. Co to znaczy? Dlaczego wybieramy T=10?

2
Czy to najnowocześniejsza metodologia regresji?
Od dłuższego czasu obserwuję zawody Kaggle i zdaję sobie sprawę, że wiele zwycięskich strategii wymaga użycia co najmniej jednego z „wielkich trójek”: workowania, wzmacniania i układania. W przypadku regresji zamiast koncentrowania się na budowaniu jednego najlepszego możliwego modelu regresji, budowanie wielu modeli regresji, takich jak (Uogólniona) regresja liniowa, losowe modele …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.