Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Diagnostyka kolinearności jest problematyczna tylko wtedy, gdy uwzględniony jest termin interakcji
Przeprowadziłem regresję w hrabstwach USA i sprawdzam kolinearność moich „niezależnych” zmiennych. Diagnostyka regresji Belsleya, Kuha i Welscha sugeruje przyjrzenie się wskaźnikowi stanu i proporcjom rozkładu wariancji: library(perturb) ## colldiag(, scale=TRUE) for model with interaction Condition Index Variance Decomposition Proportions (Intercept) inc09_10k unins09 sqmi_log pop10_perSqmi_log phys_per100k nppa_per100k black10_pct hisp10_pct elderly09_pct inc09_10k:unins09 …

3
Jak interpretować „korelacje ustalonych efektów” w mojej produkcji glittera?
Mam następujące dane wyjściowe: Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS2 +sAG2 +sSHDI2 +sbare +season +crop +(1|landscape) AIC BIC logLik deviance 4062 4093 -2022 4044 Random effects: Groups Name Variance Std.Dev. landscape (Intercept) 0.82453 0.90804 Number of obs: 239, groups: landscape, 45 Fixed effects: …

2
Jak obliczyć SVD ogromnej rzadkiej macierzy?
Jaki jest najlepszy sposób obliczenia dekompozycji wartości pojedynczej (SVD) bardzo dużej macierzy dodatniej (65 M x 3,4 M), w której dane są bardzo rzadkie? Mniej niż 0,1% matrycy jest niezerowe. Potrzebuję sposobu, który: zmieści się w pamięci (wiem, że istnieją metody online) zostaną obliczone w rozsądnym czasie: 3,4 dni będą …
26 svd  numerics 

3
Dlaczego modele procesu Gaussa nazywane są nieparametrycznymi?
Jestem trochę zmieszany. Dlaczego procesy Gaussa nazywane są modelami nieparametrycznymi? Zakładają, że wartości funkcjonalne lub ich podzbiór mają wcześniejszy Gaussa ze średnią 0 i funkcją kowariancji podaną jako funkcja jądra. Te funkcje jądra same w sobie mają pewne parametry (tj. Hiperparametry). Dlaczego więc nazywane są modelami nieparametrycznymi?


2
Transformowanie zmiennych dla regresji wielokrotnej w R.
Próbuję wykonać regresję wielokrotną w R. Jednak moja zmienna zależna ma następujący wykres: Oto macierz wykresu rozrzutu ze wszystkimi moimi zmiennymi ( WARjest zmienną zależną): Wiem, że muszę wykonać transformację tej zmiennej (i ewentualnie zmiennych niezależnych?), Ale nie jestem pewien dokładnej wymaganej transformacji. Czy ktoś może skierować mnie we właściwym …

1
Czy test Mantela można rozszerzyć na macierze asymetryczne?
Test Mantela jest zwykle stosowany do symetrycznych macierzy odległości / różnic. O ile rozumiem, założeniem testu jest to, że miarą używaną do definiowania różnic musi być co najmniej półmetryka (spełniać standardowe wymagania metryki, ale nie nierówność trójkąta). Czy założenie symetrii może być złagodzone (dając pre-metrykę)? Czy w tym przypadku można …

6
Dopasuj sinusoidalny termin do danych
Chociaż czytam ten post, nadal nie mam pojęcia, jak zastosować to do moich danych i mam nadzieję, że ktoś może mi pomóc. Mam następujące dane: y <- c(11.622967, 12.006081, 11.760928, 12.246830, 12.052126, 12.346154, 12.039262, 12.362163, 12.009269, 11.260743, 10.950483, 10.522091, 9.346292, 7.014578, 6.981853, 7.197708, 7.035624, 6.785289, 7.134426, 8.338514, 8.723832, 10.276473, 10.602792, …
26 r  regression  fitting 

3
Modele tematyczne i metody współwystępowania słów
Popularne modele tematów, takie jak LDA, zwykle grupują słowa, które zwykle występują razem w tym samym temacie (klastrze). Jaka jest główna różnica między takimi modelami tematycznymi a innymi prostymi metodami grupowania opartymi na współwystępowaniu, takimi jak PMI? (PMI oznacza Pointwise Mutual Information i służy do identyfikacji słów współistniejących z danym …

5
Strategie wprowadzania zaawansowanych statystyk do różnych odbiorców
Pracuję głównie z nie-statystykami w takich dziedzinach, jak medycyna, nauki społeczne i edukacja. Niezależnie od tego, czy konsultuję się z doktorantami, pomagam badaczom w artykułach, czy recenzuję artykuły do ​​czasopism, często mam problem z tym, że ktoś (klient, autor, komisja doktorska, redaktor czasopisma) chce zastosować jakąś stosunkowo znaną technikę, gdy …
26 consulting 


2
Interpretacja geometryczna karanej regresji liniowej
Wiem, że regresję liniową można uznać za „linię, która jest pionowo najbliższa wszystkich punktów” : Jest jednak inny sposób, aby to zobaczyć, wizualizując przestrzeń kolumny, jako „rzut na przestrzeń rozciągniętą przez kolumny macierzy współczynników” : Moje pytanie brzmi: co się dzieje w tych dwóch interpretacjach, gdy stosujemy karaną regresję liniową, …


6
Wielkość próby regresji logistycznej?
Chcę stworzyć model logistyczny z moich danych ankietowych. To niewielka ankieta dotycząca czterech kolonii mieszkalnych, w której przeprowadzono wywiad tylko z 154 respondentami. Moja zmienna zależna to „zadowalające przejście do pracy”. Stwierdziłem, że spośród 154 respondentów 73 stwierdziło, że zadowalająco przeszły do ​​pracy, a reszta nie. Zatem zmienna zależna ma …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.