Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Rozkład wariancji odchylenia: termin oczekiwanego kwadratu błędu prognozy mniej błędu nieredukowalnego
Hastie i in. „Elementy uczenia statystycznego” (2009) rozważają proces generowania danych z i .Y= f( X) + εY=f(X)+ε Y = f(X) + \varepsilon E (ε)=0E(ε)=0\mathbb{E}(\varepsilon)=0Var ( ε ) =σ2)εVar(ε)=σε2\text{Var}(\varepsilon)=\sigma^2_{\varepsilon} Prezentują następujący rozkład wariancji odchyłki oczekiwanego błędu kwadratu prognozy w punkcie (s. 223, wzór 7.9): W moim praca własna Nie określam …

4
Jak interpretować krzywą przeżycia modelu zagrożenia Coxa?
Jak interpretujesz krzywą przeżycia z proporcjonalnego modelu hazardu Coxa? W tym przykładzie zabawki załóżmy, że mamy proporcjonalny model hazardu Coxa dla agezmiennej w kidneydanych i generujemy krzywą przeżycia. library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() Na przykład o czasie 200200200, które stwierdzenie jest prawdziwe? czy oba są w …

3
PCA jest zbyt wolny, gdy oba n, p są duże: alternatywy?
Konfiguracja problemu Mam punkty danych (obrazy) o wysokim wymiarze (4096), które próbuję zwizualizować w 2D. W tym celu używam t-sne w sposób podobny do poniższego przykładowego kodu autorstwa Karpathy . Dokumentacja scikit-learn zaleca użycie PCA, aby najpierw obniżyć wymiar danych: Zdecydowanie zaleca się stosowanie innej metody redukcji wymiarów (np. PCA …


1
W jaki sposób procent nie sumujący się do stu może być możliwy?
Czytałem ten artykuł o aquaponice i niektóre statystyki nie miały żadnego sensu w odniesieniu do wymienionych procentów. Jaka metoda pozwoliłaby na istnienie tych procentów? Najczęściej hodowanymi zwierzętami wodnymi w procentach były tilapia (69%), ryby ozdobne (43%), sumy (25%), inne zwierzęta wodne (18%), okonie (16%), bluegill (15%), pstrąg ( 10%) i …

1
Błędy normalnie rozłożone i centralne twierdzenie graniczne
We wstępnej ekonometrii Wooldridge'a jest cytat: Argument uzasadniający normalną dystrybucję błędów zwykle działa mniej więcej tak: ponieważ uuu jest sumą różnych wpływających na nie zaobserwowanych czynników yyy, możemy odwołać się do centralnego twierdzenia o granicy, aby dojść do wniosku uuu ma przybliżony rozkład normalny. Ten cytat dotyczy jednego z założeń …




4
Trening sieci neuronowej pod kątem regresji zawsze przewiduje średnią
Trenuję prostą sieć neuronową splotową do regresji, której zadaniem jest przewidzenie (x, y) położenia ramki na obrazie, np .: Dane wyjściowe sieci mają dwa węzły, jeden dla x i jeden dla y. Reszta sieci jest standardową splotową siecią neuronową. Strata jest standardowym średnim kwadratowym błędem między przewidywaną pozycją pudełka a …


2
Jaki jest najlepszy sposób oszacowania średniego efektu leczenia w badaniu podłużnym?
W badaniu podłużnym wyniki YitYjatY_{it} jednostek ijai są wielokrotnie mierzone w punktach czasowych ttt z łącznie mmm ustalone okazje pomiarowe (ustalone = pomiary jednostek są wykonywane w tym samym czasie). Jednostki są losowo przypisywane do leczenia, G=1sol=1G=1lub do grupy kontrolnej, G=0sol=0G=0. Chcę oszacować i przetestować średni efekt leczenia, tjATE=E(Y|G=1)−E(Y|G=0),ZAT.mi=mi(Y|sol=1)-mi(Y|sol=0),ATE=E(Y | …

1
Niższy niż oczekiwano zasięg ważnego próbkowania z symulacją
Starałem się odpowiedzieć na pytanie Ocenić integralny z Znaczenie metody pobierania próbek na badania . Zasadniczo użytkownik musi obliczyć ∫π0fa( x ) dx =∫π01sałata( x)2)+x2)rex∫0πf(x)dx=∫0π1cos⁡(x)2+x2dx\int_{0}^{\pi}f(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}dx wykorzystanie rozkładu wykładniczego jako rozkładu ważności q( x ) = λ exp- λ xq(x)=λ exp−λxq(x)=\lambda\ \exp^{-\lambda x} i znajdź wartość λλ\lambdaco daje lepsze przybliżenie całki …

1
Dlaczego w artykułach rzadko podaje się, jakiego rodzaju sumy kwadratów stosuje się w wynikach Anova?
Po moim krótkim doświadczeniu w statystyce wydaje się, że rodzaj sum kwadratów (typ I, II, III, IV ...) zastosowany do uzyskania wyników ANOVA może znacząco zmienić wyniki testów (szczególnie modeli z interakcjami i ich brakiem) dane). Jednak nie widziałem jeszcze artykułu, który to zgłosi. Dlaczego to jest takie? Byłbym naprawdę …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.