Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jak obliczyć różnicę dwóch stoków?
Czy istnieje metoda zrozumienia, czy dwie linie są (mniej więcej) równoległe? Mam dwie linie wygenerowane z regresji liniowych i chciałbym zrozumieć, czy są one równoległe. Innymi słowy, chciałbym uzyskać inne nachylenie tych dwóch linii. Czy istnieje funkcja R do obliczenia tego? EDYCJA: ... i jak mogę uzyskać nachylenie (w stopniach) …

1
Testowanie efektów jednoczesnych i opóźnionych w podłużnych mieszanych modelach ze zmiennymi towarzyszącymi w czasie
Niedawno powiedziano mi, że nie jest możliwe włączenie zmiennych towarzyszących w czasie do zmiennych mieszanych wzdłużnych bez wprowadzenia opóźnienia czasowego dla tych zmiennych towarzyszących. Czy możesz to potwierdzić / zaprzeczyć? Czy masz jakieś odniesienia do tej sytuacji? Proponuję wyjaśnić prostą sytuację. Załóżmy, że powtórzyłem pomiary (powiedzmy ponad 30 razy) zmiennych …



3
Jak omówić wykres rozrzutu z wieloma nowymi liniami?
Zmierzyliśmy dwie zmienne, a wykres rozrzutu wydaje się sugerować wiele modeli „liniowych”. Czy istnieje sposób, aby spróbować destylować te modele? Identyfikacja innych zmiennych niezależnych okazała się trudna. Obie zmienne są mocno pochylone w lewo (w kierunku małych liczb), jest to oczekiwany rozkład w naszej domenie. Intensywność kropki reprezentuje ilość punktów …

1
Jaka jest różnica między AIC () a extractAIC () w R?
Dokumentacja R dla obu nie rzuca dużo światła. Jedyne, co mogę uzyskać z tego linku, to to, że użycie jednego z nich powinno być w porządku. Nie rozumiem, dlaczego nie są równe. Fakt: funkcję regresji krokowej w R, step()zastosowania extractAIC(). Co ciekawe, uruchomienie lm()modelu i modelu glm()„zerowego” (tylko przechwytywanie) w …

2
Dopasowanie wielokrotnej regresji liniowej w R: reszty autokorelowane
Próbuję oszacować wielokrotną regresję liniową w R za pomocą następującego równania: regr <- lm(rate ~ constant + askings + questions + 0) pytania i pytania są kwartalnymi szeregami czasowymi danych, zbudowanymi z askings <- ts(...). Problem polega na tym, że otrzymałem resztki autokorelowane. Wiem, że można dopasować regresję za pomocą …

2
Czy wielkość populacji jest parametrem, czy wielkość próby statystyką?
Definicje parametru i statystyki w zasadzie się zgadzają: parametry i statystyki są, odpowiednio, danymi liczbowymi lub numerycznymi podsumowaniami populacji i próbki dla danego badania. Nie sądzę, że jest to powszechne zastosowanie, ale ... Czy wielkość populacji można uznać za parametr? Czy wielkość próby można uznać za statystykę?N.NNnnn W końcu wielkość …

2
Definicja „percentyla”
Teraz czytam notatkę o biostatystyce napisaną przez PMT Education i zauważam następujące zdania w części 2.7: Dziecko urodzone w 50. percentylu dla masy jest cięższe niż 50% dzieci. Dziecko urodzone w 25. percentylu dla masy jest cięższe niż 75% dzieci. Dziecko urodzone w 75. percentylu dla masy jest cięższe niż …

2
Dlaczego modele „błąd w X” nie są szerzej stosowane?
Kiedy obliczyć błąd standardowy współczynnik regresji, nie stanowią przypadkowości w macierzy eksperymentu . Na przykład w OLS obliczamy jakoXXXvar ( β^)var(β^)\text{var}(\hat{\beta})var ( ( XT.X)- 1XT.Y) = σ2)( XT.X)- 1var((XTX)−1XTY)=σ2(XTX)−1\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} Jeśli uznano za przypadkowy, prawo całkowitej wariancji będzie, w pewnym sensie, zażądać dodatkowego wkładu wariancji , jak również. to …

1
Przybliżenie drugiego rzędu funkcji utraty (książka do głębokiego uczenia się, 7.33)
W książce Goodfellow (2016) na temat głębokiego uczenia się mówił o równoważności wczesnego zaprzestania regularyzacji L2 ( https://www.deeplearningbook.org/contents/regularization.html strona 247). Kwadratowe przybliżenie funkcji kosztu jjj daje: J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) HHHf(w+ϵ)=f(w)+f′(w)⋅ϵ+12f′′(w)⋅ϵ2f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f″(w)⋅ϵ2f(w+\epsilon)=f(w)+f'(w)\cdot\epsilon+\frac{1}{2}f''(w)\cdot\epsilon^2

2
Parametry maksymalnego prawdopodobieństwa odbiegają od rozkładów bocznych
Mam funkcję prawdopodobieństwa dla prawdopodobieństwa moich danych biorąc pod uwagę niektóre parametry modelu , które chciałbym oszacować. Zakładając płaskie priorytety parametrów, prawdopodobieństwo jest proporcjonalne do prawdopodobieństwa a posteriori. Używam metody MCMC, aby zbadać to prawdopodobieństwo.L(d|θ)L(d|θ)\mathcal{L}(d | \theta)dddθ∈RNθ∈RN\theta \in \mathbf{R}^N Patrząc na wynikowy zbieżny łańcuch, stwierdzam, że parametry maksymalnego prawdopodobieństwa nie …



2
Jak Bayesianie weryfikują swoje metody przy użyciu metod symulacji Monte Carlo?
Tło : Mam doktorat z psychologii społecznej, gdzie statystyki teoretyczne i matematyka były ledwo ujęte w moich ilościowych zajęciach. Przez szkołę licencjacką i gradową uczyłem się (podobnie jak wielu z was również w naukach społecznych) poprzez „klasyczne” ramy częstokroć. Teraz Uwielbiam też R i za pomocą metod symulacyjnych w celu …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.