Podczas klastrowania hierarchicznego można użyć wielu metryk do pomiaru odległości między klastrami. Dwie takie miary sugerują obliczenie centroidów i średnich punktów danych w klastrach. Jaka jest różnica między średnią a środkiem ciężkości? Czy to nie ten sam punkt w gromadzie?
Przeprowadziłem regresję w hrabstwach USA i sprawdzam kolinearność moich „niezależnych” zmiennych. Diagnostyka regresji Belsleya, Kuha i Welscha sugeruje przyjrzenie się wskaźnikowi stanu i proporcjom rozkładu wariancji: library(perturb) ## colldiag(, scale=TRUE) for model with interaction Condition Index Variance Decomposition Proportions (Intercept) inc09_10k unins09 sqmi_log pop10_perSqmi_log phys_per100k nppa_per100k black10_pct hisp10_pct elderly09_pct inc09_10k:unins09 …
Mam następujące dane wyjściowe: Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS2 +sAG2 +sSHDI2 +sbare +season +crop +(1|landscape) AIC BIC logLik deviance 4062 4093 -2022 4044 Random effects: Groups Name Variance Std.Dev. landscape (Intercept) 0.82453 0.90804 Number of obs: 239, groups: landscape, 45 Fixed effects: …
Jaki jest najlepszy sposób obliczenia dekompozycji wartości pojedynczej (SVD) bardzo dużej macierzy dodatniej (65 M x 3,4 M), w której dane są bardzo rzadkie? Mniej niż 0,1% matrycy jest niezerowe. Potrzebuję sposobu, który: zmieści się w pamięci (wiem, że istnieją metody online) zostaną obliczone w rozsądnym czasie: 3,4 dni będą …
Jestem trochę zmieszany. Dlaczego procesy Gaussa nazywane są modelami nieparametrycznymi? Zakładają, że wartości funkcjonalne lub ich podzbiór mają wcześniejszy Gaussa ze średnią 0 i funkcją kowariancji podaną jako funkcja jądra. Te funkcje jądra same w sobie mają pewne parametry (tj. Hiperparametry). Dlaczego więc nazywane są modelami nieparametrycznymi?
Kiedyś słyszałem metodę podwójnego użycia lassa (jak podwójne lasso), w której wykonuje się lasso na oryginalnym zestawie zmiennych, powiedzmy S1, uzyskuje rzadki zbiór o nazwie S2, a następnie ponownie wykonuje lasso na zestawie S2, aby uzyskać zestaw S3 . Czy istnieje na to termin metodologiczny? Jakie są zalety podwójnego robienia …
Próbuję wykonać regresję wielokrotną w R. Jednak moja zmienna zależna ma następujący wykres: Oto macierz wykresu rozrzutu ze wszystkimi moimi zmiennymi ( WARjest zmienną zależną): Wiem, że muszę wykonać transformację tej zmiennej (i ewentualnie zmiennych niezależnych?), Ale nie jestem pewien dokładnej wymaganej transformacji. Czy ktoś może skierować mnie we właściwym …
Test Mantela jest zwykle stosowany do symetrycznych macierzy odległości / różnic. O ile rozumiem, założeniem testu jest to, że miarą używaną do definiowania różnic musi być co najmniej półmetryka (spełniać standardowe wymagania metryki, ale nie nierówność trójkąta). Czy założenie symetrii może być złagodzone (dając pre-metrykę)? Czy w tym przypadku można …
Chociaż czytam ten post, nadal nie mam pojęcia, jak zastosować to do moich danych i mam nadzieję, że ktoś może mi pomóc. Mam następujące dane: y <- c(11.622967, 12.006081, 11.760928, 12.246830, 12.052126, 12.346154, 12.039262, 12.362163, 12.009269, 11.260743, 10.950483, 10.522091, 9.346292, 7.014578, 6.981853, 7.197708, 7.035624, 6.785289, 7.134426, 8.338514, 8.723832, 10.276473, 10.602792, …
Popularne modele tematów, takie jak LDA, zwykle grupują słowa, które zwykle występują razem w tym samym temacie (klastrze). Jaka jest główna różnica między takimi modelami tematycznymi a innymi prostymi metodami grupowania opartymi na współwystępowaniu, takimi jak PMI? (PMI oznacza Pointwise Mutual Information i służy do identyfikacji słów współistniejących z danym …
Pracuję głównie z nie-statystykami w takich dziedzinach, jak medycyna, nauki społeczne i edukacja. Niezależnie od tego, czy konsultuję się z doktorantami, pomagam badaczom w artykułach, czy recenzuję artykuły do czasopism, często mam problem z tym, że ktoś (klient, autor, komisja doktorska, redaktor czasopisma) chce zastosować jakąś stosunkowo znaną technikę, gdy …
Zastanawiam się, jak interpretować współczynniki błędów standardowych regresji przy użyciu funkcji wyświetlania w R. Na przykład w następującym wyniku: lm(formula = y ~ x1 + x2, data = sub.pyth) coef.est coef.se (Intercept) 1.32 0.39 x1 0.51 0.05 x2 0.81 0.02 n = 40, k = 3 residual sd = 0.90, …
Wiem, że regresję liniową można uznać za „linię, która jest pionowo najbliższa wszystkich punktów” : Jest jednak inny sposób, aby to zobaczyć, wizualizując przestrzeń kolumny, jako „rzut na przestrzeń rozciągniętą przez kolumny macierzy współczynników” : Moje pytanie brzmi: co się dzieje w tych dwóch interpretacjach, gdy stosujemy karaną regresję liniową, …
To jest kolejne pytanie do tego, co napisał tutaj Frank Harrell : Z mojego doświadczenia wynika, że wymagany rozmiar próbki, aby rozkład t był dokładny, jest często większy niż rozmiar próbki pod ręką. Test rangowanych znaków Wilcoxona jest niezwykle wydajny, jak powiedziałeś, i jest solidny, więc prawie zawsze wolę go …
Chcę stworzyć model logistyczny z moich danych ankietowych. To niewielka ankieta dotycząca czterech kolonii mieszkalnych, w której przeprowadzono wywiad tylko z 154 respondentami. Moja zmienna zależna to „zadowalające przejście do pracy”. Stwierdziłem, że spośród 154 respondentów 73 stwierdziło, że zadowalająco przeszły do pracy, a reszta nie. Zatem zmienna zależna ma …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.