Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych




5
Przedział ufności i prawdopodobieństwo - gdzie jest błąd w tym stwierdzeniu?
Jeśli ktoś złoży oświadczenie takie jak poniżej: „Ogólnie rzecz biorąc, osoby niepalące narażone na dym środowiskowy miały względne ryzyko choroby niedokrwiennej serca wynoszące 1,25 (95 procent przedział ufności, 1,17 do 1,32) w porównaniu z osobami niepalącymi nie narażonymi na dym”. Jakie jest względne ryzyko dla całej populacji? Ile rzeczy jest …



1
Wielowymiarowy rozkład normalny współczynnika regresji?
Czytając podręcznik regresji napotkałem następujący akapit: Oszacowanie najmniejszych kwadratów wektora współczynników regresji liniowej ( ) toββ\beta β^= ( XtX)- 1Xtyβ^=(XtX)-1Xty \hat{\beta} = (X^{t}X)^{-1}{X^t}y która, widziana jako funkcja danych (z uwzględnieniem predyktorów X jako stałych), jest liniową kombinacją danych. Korzystając z centralnego twierdzenia granicznego, można wykazać, że rozkład β będzie w …


1
Jak dopasować nieliniowy model efektów mieszanych dla danych z powtarzanymi pomiarami za pomocą nlmer ()?
Próbuję analizować dane z powtarzanych pomiarów i staram się, aby to zadziałało R. Moje dane są zasadniczo następujące, mam dwie grupy leczenia. Każdy przedmiot w każdej grupie jest codziennie testowany i otrzymuje wynik (procent poprawny na teście). Dane są w długim formacie: Time Percent Subject Group 1 0 GK11 Ethanol …

3
Związek między dwoma szeregami czasowymi: ARIMA
Biorąc pod uwagę następujące dwa szeregi czasowe ( x , y ; patrz poniżej), jaka jest najlepsza metoda modelowania związku między długoterminowymi trendami w tych danych? Oba szeregi czasowe mają znaczące testy Durbina-Watsona, gdy są modelowane jako funkcja czasu i żadne z nich nie jest stacjonarne (jak rozumiem ten termin, …


4
Bootstrap, Monte Carlo
W ramach pracy domowej postawiono mi następujące pytanie: Zaprojektuj i zaimplementuj badanie symulacyjne w celu zbadania wydajności bootstrapu w celu uzyskania 95% przedziałów ufności na podstawie średniej próbki danych. Twoja implementacja może być w języku R lub SAS. Aspekty wydajności, na które możesz chcieć spojrzeć, to pokrycie przedziału ufności (tj. …

3
Jak ponownie próbkować w R bez powtarzania permutacji?
Czy w R, jeśli ustawię set.seed (), a następnie użyję przykładowej funkcji do losowej listy, czy mogę zagwarantować, że nie wygeneruję tej samej permutacji? to znaczy... set.seed(25) limit <- 3 myindex <- seq(0,limit) for (x in seq(1,factorial(limit))) { permutations <- sample(myindex) print(permutations) } To produkuje [1] 1 2 0 3 …

2
Czy losowe lasy wykazują tendencyjne prognozy?
Myślę, że jest to proste pytanie, chociaż uzasadnienie dlaczego lub dlaczego nie może być. Powodem, dla którego pytam, jest to, że niedawno napisałem własną implementację RF i chociaż działa on dobrze, nie działa tak dobrze, jak się spodziewałem (na podstawie zestawu danych konkursowych Kaggle Photo Quality Prediction , zwycięskich wyników …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.