Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Skalowanie cech i średnia normalizacja
Biorę udział w kursie uczenia maszynowego Andrew Nga i po kilku próbach nie byłem w stanie uzyskać poprawnej odpowiedzi na to pytanie. Prosimy o pomoc w rozwiązaniu tego problemu, chociaż przeszedłem poziom. Załóżmy, że uczniów wzięło udział w zajęciach, a klasa miała egzamin śródokresowy i egzamin końcowy. Zebrałeś zbiór danych …

4
Dlaczego mówimy „szczątkowy błąd standardowy”?
Błąd standardowy to szacowane odchylenie standardowe estymatora dla parametru .σ^(θ^)σ^(θ^)\hat \sigma(\hat\theta)θ^θ^\hat\thetaθθ\theta Dlaczego szacowane odchylenie standardowe reszt określa się jako „resztkowy błąd standardowy” (np. Na wyjściu funkcji R summary.lm), a nie „resztowe odchylenie standardowe”? Jakie parametry szacunkowe wyposażamy tutaj w standardowy błąd? Czy uważamy każdą resztę za estymator dla „jego” terminu …

2
Dlaczego różnica kwadratowa jest tak często stosowana?
Bardzo często, gdy badam nowe metody i pojęcia statystyczne, napotykam kwadratową różnicę (lub średni błąd kwadratu lub mnogość innych epitetów). Na przykład, r Pearsona jest ustalane na podstawie średniej kwadratowej różnicy od linii regresji, którą leżą punkty. W przypadku ANOVA patrzysz na sumę kwadratów i tak dalej. Rozumiem teraz, że …

4
Jak interpretować krzywą ROC?
Zastosowałem regresję logistyczną do moich danych na SAS i oto krzywa ROC i tabela klasyfikacji. Czuję się dobrze z liczbami w tabeli klasyfikacji, ale nie jestem pewien, co pokazuje krzywa ROC i obszar pod nią. Wszelkie wyjaśnienia byłyby bardzo mile widziane.


1
Dlaczego regresja Ridge'a działa dobrze w obecności wielokoliniowości?
Uczę się o regresji grzbietu i wiem, że regresja kalenicy działa lepiej w obecności wielokoliniowości. Zastanawiam się, dlaczego to prawda? Odpowiedź intuicyjna lub matematyczna byłaby satysfakcjonująca (oba typy odpowiedzi byłyby jeszcze bardziej satysfakcjonujące). Wiem też, że zawsze można uzyskać, ale jak dobrze regresja kalenicy działa w obecności dokładnej kolinearności (jedna …

4
Czy należy stosować średnią, gdy dane są wypaczone?
Często wprowadzane teksty statystyki statystycznej odróżniają średnią od mediany (często w kontekście statystyki opisowej i motywując do podsumowania tendencji centralnej za pomocą średniej, mediany i trybu), wyjaśniając, że średnia jest wrażliwa na wartości odstające w danych próbki i / lub do wypaczonych rozkładów populacji, co służy uzasadnieniu twierdzenia, że ​​mediana …


3
Pojęcie przechwytywania w regresji logistycznej
Załóżmy, że mamy następujący model regresji logistycznej: logit(p)=β0+β1x1+β2x2logit(p)=β0+β1x1+β2)x2)\text{logit}(p) = \beta_0+\beta_{1}x_{1} + \beta_{2}x_{2} Czy jest szansą na zdarzenie, gdy x 1 = 0, a x 2 = 0 ? Innymi słowy, czy jest szansa na zdarzenie, gdy x 1 i x 2 są na najniższych poziomach (nawet jeśli nie jest to …


5
Znajdowanie punktów przegięcia w R na podstawie wygładzonych danych
Mam pewne dane, których gładko używam loess. Chciałbym znaleźć punkty przegięcia wygładzonej linii. czy to możliwe? Jestem pewien, że ktoś wymyślił wymyślną metodę rozwiązania tego ... to znaczy ... w końcu to R! Nie przeszkadza mi zmiana funkcji wygładzania, której używam. Po prostu użyłem, loessponieważ tego właśnie używałem w przeszłości. …
14 r  smoothing  loess 

3
Jak mogę zinterpretować to, co otrzymuję z PCA?
W ramach pracy na uniwersytecie muszę przeprowadzić wstępne przetwarzanie danych na dość dużym, wielowymiarowym (> 10) surowym zbiorze danych. Nie jestem statystykiem w żadnym znaczeniu tego słowa, więc jestem trochę zdezorientowany, co się dzieje. Z góry przepraszam za to, co jest prawdopodobnie śmiesznie prostym pytaniem - moja głowa wiruje po …
14 pca 

4
Analiza ROC i multiROC: jak obliczyć optymalny punkt odcięcia?
Próbuję zrozumieć, jak obliczyć optymalny punkt odcięcia dla krzywej ROC (wartość, przy której czułość i swoistość są zmaksymalizowane). Korzystam z zestawu danych aSAHz pakietu pROC. outcomeZmienna może być wyjaśnione przez dwóch niezależnych zmiennych: s100ba ndka. Korzystając ze składni Epipakietu, stworzyłem dwa modele: library(pROC) library(Epi) ROC(form=outcome~s100b, data=aSAH) ROC(form=outcome~ndka, data=aSAH) Dane wyjściowe …

3
Czy muszę usunąć zmienne, które są skorelowane / współliniowe przed uruchomieniem kmeans?
Prowadzę kmeans, aby zidentyfikować klastry klientów. Mam około 100 zmiennych do identyfikacji klastrów. Każda z tych zmiennych reprezentuje% wydatków klienta na kategorię. Tak więc, jeśli mam 100 kategorii, mam te 100 zmiennych, więc suma tych zmiennych wynosi 100% dla każdego klienta. Teraz te zmienne są ściśle ze sobą skorelowane. Czy …

2
Symulacja wielu regresji liniowych
Jestem nowy w języku R. Chciałbym wiedzieć, jak symulować z modelu wielokrotnej regresji liniowej, który spełnia wszystkie cztery założenia regresji. ok dziękuję. Powiedzmy, że chcę symulować dane na podstawie tego zestawu danych: y<-c(18.73,14.52,17.43,14.54,13.44,24.39,13.34,22.71,12.68,19.32,30.16,27.09,25.40,26.05,33.49,35.62,26.07,36.78,34.95,43.67) x1<-c(610,950,720,840,980,530,680,540,890,730,670,770,880,1000,760,590,910,650,810,500) x2<-c(1,1,3,2,1,1,3,3,2,2,1,3,3,2,2,2,3,3,1,2) fit<-lm(y~x1+x2) summary(fit) wtedy otrzymuję wynik: Call: lm(formula = y ~ x1 + x2) Residuals: Min …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.