W tym pytaniu pytają, jak porównać Pearson r dla dwóch niezależnych grup (takich jak mężczyźni i kobiety). Odpowiedzi i komentarze sugerowały dwa sposoby: Użyj znanej formuły Fishera, używając „z-tranformacji” r; Użyj porównania nachyleń (współczynników regresji). To ostatnie można łatwo wykonać za pomocą nasyconego modelu liniowego: , gdzie i są zmiennymi …
Czy ktoś może szczegółowo wyjaśnić: Co oznacza odrzucenie wnioskowania? Jak można go wykorzystać do zwiększenia dokładności mojego modelu? Mam pomysł odrzucenia wnioskowania w aplikacji karty kredytowej, ale walczę z myślą o użyciu go do zwiększenia dokładności mojego modelu.
Podczas przeprowadzania 5-krotnej walidacji krzyżowej (na przykład) typowe jest obliczanie osobnej krzywej ROC dla każdej z 5 krotności i często pomnożenie średniej krzywej ROC ze std. dev. pokazane jako grubość krzywej. Jednak w przypadku walidacji krzyżowej LOO, w której w każdym folderze jest tylko jeden testowy punkt danych, obliczenie „krzywej” …
Kiedy 10 lat temu uczestniczyłem w kursach statystyki teoretycznej jako student, korzystaliśmy ze współczesnych statystyk matematycznych Dudewicza i Mishry. Odnoszę się teraz do książki i przypominam sobie, że niektóre przykłady kodu są w asemblerze dla IBM 370. Choć dziwne, nie mogę powstrzymać się od stwierdzenia, że jest to trochę przestarzałe. …
Mam pytanie dotyczące tego, czy należy użyć przesunięcia. Załóż bardzo prosty model, w którym chcesz opisać (ogólną) liczbę bramek w hokeju. Masz więc bramki, liczbę rozegranych gier i zmienny manekin „napastnik”, który jest równy 1, jeśli gracz jest napastnikiem, a 0 w przeciwnym razie. Który z poniższych modeli jest poprawnie …
Trudno mi to opisać, ale postaram się, aby mój problem był zrozumiały. Najpierw musisz wiedzieć, że do tej pory przeprowadziłem bardzo prostą regresję liniową. Zanim oszacowałem współczynnik, obserwowałem rozkład mojego . Jest ciężko lewy przekrzywiony. Po oszacowaniu modelu byłem całkiem pewny, że zaobserwowałem odchyloną w lewo resztkę na wykresie QQ, …
Załóżmy, że mam model regresji kwadratowej z błędami spełniającymi zwykłe założenia (niezależne, normalne, niezależne od wartości ). Niech będą szacunkami najmniejszych kwadratów.Y=β0+β1X+β2X2+ϵY=β0+β1X+β2X2+ϵ Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \epsilon ϵϵ\epsilonXXXb0,b1,b2b0,b1,b2b_0, b_1, b_2 Mam dwie nowe wartości i i jestem zainteresowany uzyskaniem przedziału ufności dla .XXXx1x1x_1x2x2x_2v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x21)v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x12)v = …
tło Mam dane z badań terenowych, w których istnieją cztery poziomy leczenia i sześć powtórzeń w każdym z dwóch bloków. (4x6x2 = 48 obserwacji) Bloki są oddalone od siebie o około 1 milę, aw obrębie bloków znajduje się siatka o powierzchni 42, 2m x 4m i chodnik o szerokości 1m; …
W przypadku solidnych estymatorów, co oznacza wydajność Gaussa ? Na przykład ma 82% wydajności Gaussa i 50% punktu przebicia.QnQnQ_{_n} Odniesieniem jest: Rousseeuw PJ i Croux, C. (1993). „Alternatywy dla mediany bezwzględnego odchylenia”. J. American Statistics Assoc., 88, 1273-1283
Mam dwa zestawy danych z badań asocjacyjnych całego genomu. Jedyne dostępne informacje to iloraz szans i wartość p dla pierwszego zestawu danych. Dla drugiego zestawu danych mam iloraz szans, wartość p i częstotliwości alleli (AFD = choroba, AFC = kontrola) (np. 0,321). Próbuję wykonać metaanalizę tych danych, ale nie mam …
Mam dane dotyczące procentu materii organicznej w osadach jeziornych od 0 cm (tj. Interfejs osadów do wody) do 9 cm dla około 25 jezior. W każdym jeziorze pobrano 2 rdzenie z każdej lokalizacji, więc mam 2 powtórzenia miar zawartości materii organicznej na każdej głębokości osadu dla każdego jeziora. Interesuje mnie …
Korzystam z dużej regresji OLS, w której wszystkie zmienne niezależne (około 400) są zmiennymi obojętnymi. Jeśli wszystkie są uwzględnione, istnieje doskonała wielokoliniowość (pułapka zmiennej manekina), więc muszę pominąć jedną ze zmiennych przed uruchomieniem regresji. Moje pierwsze pytanie brzmi: która zmienna powinna zostać pominięta? Czytałem, że lepiej jest pominąć zmienną, która …
Chciałbym dowiedzieć się o wartościach (x, y)używanych podczas kreślenia plot(b, seWithMean=TRUE)w pakiecie mgcv . Czy ktoś wie, jak mogę wyodrębnić lub obliczyć te wartości? Oto przykład: library(mgcv) set.seed(0) dat <- gamSim(1, n=400, dist="normal", scale=2) b <- gam(y~s(x0), data=dat) plot(b, seWithMean=TRUE)
Jakie są techniki statystyczne, aby utworzyć zestaw próbek, który jest reprezentatywny dla całej populacji (o znanym poziomie ufności)? Również, Jak sprawdzić poprawność, jeśli próbka pasuje do całego zestawu danych? Czy jest to możliwe bez analizowania całego zestawu danych (co może być miliardami rekordów)?
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.