Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy możemy porównać korelacje między grupami, porównując nachylenia regresji?
W tym pytaniu pytają, jak porównać Pearson r dla dwóch niezależnych grup (takich jak mężczyźni i kobiety). Odpowiedzi i komentarze sugerowały dwa sposoby: Użyj znanej formuły Fishera, używając „z-tranformacji” r; Użyj porównania nachyleń (współczynników regresji). To ostatnie można łatwo wykonać za pomocą nasyconego modelu liniowego: , gdzie i są zmiennymi …




4
Dobra książka o teoretycznym podejściu do statystyki
Kiedy 10 lat temu uczestniczyłem w kursach statystyki teoretycznej jako student, korzystaliśmy ze współczesnych statystyk matematycznych Dudewicza i Mishry. Odnoszę się teraz do książki i przypominam sobie, że niektóre przykłady kodu są w asemblerze dla IBM 370. Choć dziwne, nie mogę powstrzymać się od stwierdzenia, że ​​jest to trochę przestarzałe. …
10 references 

2
Określa, czy zastosować przesunięcie w regresji Poissona podczas przewidywania całkowitej liczby bramek strzelonych przez hokeistów
Mam pytanie dotyczące tego, czy należy użyć przesunięcia. Załóż bardzo prosty model, w którym chcesz opisać (ogólną) liczbę bramek w hokeju. Masz więc bramki, liczbę rozegranych gier i zmienny manekin „napastnik”, który jest równy 1, jeśli gracz jest napastnikiem, a 0 w przeciwnym razie. Który z poniższych modeli jest poprawnie …

2
Obserwowano przekrzywienie w lewo względem rozkładu symetrycznego
Trudno mi to opisać, ale postaram się, aby mój problem był zrozumiały. Najpierw musisz wiedzieć, że do tej pory przeprowadziłem bardzo prostą regresję liniową. Zanim oszacowałem współczynnik, obserwowałem rozkład mojego . Jest ciężko lewy przekrzywiony. Po oszacowaniu modelu byłem całkiem pewny, że zaobserwowałem odchyloną w lewo resztkę na wykresie QQ, …

1
Przedział ufności dla różnicy średnich w regresji
Załóżmy, że mam model regresji kwadratowej z błędami spełniającymi zwykłe założenia (niezależne, normalne, niezależne od wartości ). Niech będą szacunkami najmniejszych kwadratów.Y=β0+β1X+β2X2+ϵY=β0+β1X+β2X2+ϵ Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \epsilon ϵϵ\epsilonXXXb0,b1,b2b0,b1,b2b_0, b_1, b_2 Mam dwie nowe wartości i i jestem zainteresowany uzyskaniem przedziału ufności dla .XXXx1x1x_1x2x2x_2v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x21)v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x12)v = …


1
Co oznacza wydajność Gaussa?
W przypadku solidnych estymatorów, co oznacza wydajność Gaussa ? Na przykład ma 82% wydajności Gaussa i 50% punktu przebicia.QnQnQ_{_n} Odniesieniem jest: Rousseeuw PJ i Croux, C. (1993). „Alternatywy dla mediany bezwzględnego odchylenia”. J. American Statistics Assoc., 88, 1273-1283

1
Jak obliczyć standardowy błąd ilorazów szans?
Mam dwa zestawy danych z badań asocjacyjnych całego genomu. Jedyne dostępne informacje to iloraz szans i wartość p dla pierwszego zestawu danych. Dla drugiego zestawu danych mam iloraz szans, wartość p i częstotliwości alleli (AFD = choroba, AFC = kontrola) (np. 0,321). Próbuję wykonać metaanalizę tych danych, ale nie mam …

2
Jak podsumować i porównać relacje nieliniowe?
Mam dane dotyczące procentu materii organicznej w osadach jeziornych od 0 cm (tj. Interfejs osadów do wody) do 9 cm dla około 25 jezior. W każdym jeziorze pobrano 2 rdzenie z każdej lokalizacji, więc mam 2 powtórzenia miar zawartości materii organicznej na każdej głębokości osadu dla każdego jeziora. Interesuje mnie …

3
Problemy z pułapką zmiennej manekina
Korzystam z dużej regresji OLS, w której wszystkie zmienne niezależne (około 400) są zmiennymi obojętnymi. Jeśli wszystkie są uwzględnione, istnieje doskonała wielokoliniowość (pułapka zmiennej manekina), więc muszę pominąć jedną ze zmiennych przed uruchomieniem regresji. Moje pierwsze pytanie brzmi: która zmienna powinna zostać pominięta? Czytałem, że lepiej jest pominąć zmienną, która …

4
Jak uzyskać wartości używane w plot.gam w mgcv?
Chciałbym dowiedzieć się o wartościach (x, y)używanych podczas kreślenia plot(b, seWithMean=TRUE)w pakiecie mgcv . Czy ktoś wie, jak mogę wyodrębnić lub obliczyć te wartości? Oto przykład: library(mgcv) set.seed(0) dat <- gamSim(1, n=400, dist="normal", scale=2) b <- gam(y~s(x0), data=dat) plot(b, seWithMean=TRUE)


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.