Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Niezależność reszt w komputerowym eksperymencie / symulacji?
Przeprowadziłem komputerową ocenę różnych metod dopasowania konkretnego typu modelu stosowanego w naukach paleeo. Miałem duży zestaw treningowy, więc losowo (stratyfikowane losowe próbkowanie) odłożyłem zestaw testowy. I przystosowany różnych metod zestawów testowych próbek i za pomocą otrzymanego wzór I przewidzieć odpowiedź dla zestawu testowego do próbki i oblicza się na RMSEP …



3
Jak przeprowadzić oszacowanie, gdy dostępne są tylko statystyki podsumowujące?
Wynika to częściowo z następującego pytania i następującej po nim dyskusji. Załóżmy, że zaobserwowano próbkę iid, Xi∼F(x,θ)Xi∼F(x,θ)X_i\sim F(x,\theta) . Celem jest oszacowanie θθ\theta . Ale oryginalna próbka nie jest dostępna. Co mamy w zamian pewne statystyki próbki T1,...,TkT1,...,TkT_1,...,T_k . Załóżmy, że jest naprawiony. Jak oceniamy ? Jaki byłby w tym …


1
Czy solidne metody są naprawdę lepsze?
Mam dwie grupy badanych, A i B, każda o wielkości około 400 i około 300 predyktorów. Moim celem jest zbudowanie modelu predykcyjnego dla zmiennej odpowiedzi binarnej. Mój klient chce zobaczyć wynik zastosowania modelu zbudowanego z A na B. (W swojej książce „Strategie modelowania regresji” @FrankHarrell wspomina, że ​​lepiej jest połączyć …

6
Sprawdź właściwość bez pamięci łańcucha Markowa
Podejrzewam, że szereg zaobserwowanych sekwencji to łańcuch Markowa ... X=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AAD⋮BCA⋮E⎞⎠⎟⎟⎟⎟X=(ACDDBACBAACADA⋮⋮⋮⋮⋮⋮⋮BCADABE)X=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&D &A\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & E\\ \end{array}\right) Jak mogę jednak sprawdzić, czy rzeczywiście szanują bez Pamięci …

3
Wdrażanie regresji grzbietu: Wybieranie inteligentnej siatki dla
Wdrażam regresję Ridge'a w module Python / C i natrafiłem na ten „mały” problem. Chodzi o to, że chcę próbować efektywne stopnie swobody mniej więcej równomiernie rozmieszczone (jak wykres na stronie 65 w „Elementach uczenia statystycznego” ), tj. Próbka: df(λ)=∑i=1pd2id2i+λ,df(λ)=∑i=1pdi2di2+λ,\mathrm{df}(\lambda)=\sum_{i=1}^{p}\frac{d_i^2}{d_i^2+\lambda},d2idi2d_i^2XTXXTXX^TXdf(λmax)≈0df(λmax)≈0\mathrm{df}(\lambda_{\max})\approx 0df(λmin)=pdf(λmin)=p\mathrm{df}(\lambda_{\min})=pλmax=∑pid2i/cλmax=∑ipdi2/c\lambda_{\max}=\sum_i^p d_i^2/cλmax≫d2iλmax≫di2\lambda_{\max} \gg d_i^2cccc=0.1c=0.1c=0.1λmin=0λmin=0\lambda_{\min}=0 Jak sugeruje tytuł, muszę próbkować λλ\lambda …

4
Jak zobrazować wyniki subiektywnego porządku rang?
Szukam sposobu na wizualizację subiektywnych rankingów, niezależnych od moich testów nieparametrycznych. Poprosiłem 12 uczestników o uszeregowanie 8 różnych pozycji według różnych subiektywnych kryteriów (osobne rankingi dla każdego z nich). Dla każdego indywidualnego zestawu rankingów szukam dobrego sposobu na wizualizację trendów wysokiego poziomu w rankingach. Próbowałem zarówno wykresów słupkowych, jak i …


2
Częstotliwość i priory
Robby McKilliam mówi w komentarzu do tego postu: Należy zauważyć, że z punktu widzenia częstych nie ma powodu, dla którego nie można włączyć wcześniejszej wiedzy do modelu. W tym sensie widok częstych jest prostszy, masz tylko model i niektóre dane. Nie ma potrzeby oddzielania wcześniejszych informacji od modelu Również tutaj …

2
Tabele nieprzewidziane: jakie testy zrobić i kiedy?
Chciałbym zobaczyć rozszerzenie tej dyskusji na temat starej debaty chi-sq vs. debata testowa Fishera, poszerzając nieco zakres. Jest wiele testów sprawdzających interakcje w tabeli awaryjnej, co wystarczy, aby zakręcić głową. Mam nadzieję uzyskać wyjaśnienie, jakiego testu powinienem użyć i kiedy, i oczywiście wyjaśnienie, dlaczego jeden test powinien być lepszy od …

5
Miary podobieństwa między krzywymi?
Chciałbym obliczyć miarę podobieństwa między dwoma uporządkowanymi zestawami punktów --- tymi pod Użytkownikem w porównaniu z tymi pod Nauczycielem : Punkty są krzywymi w przestrzeni 3D, ale myślałem, że problem zostanie uproszczony, jeśli narysuję je w dwóch wymiarach, jak na zdjęciu. Jeśli punkty się pokrywają, podobieństwo powinno wynosić 100%.

2
Uprość sumę kombinacji o tym samym n, wszystkie możliwe wartości k
Czy istnieje sposób na uproszczenie tego równania? (81)+(82)+(83)+(84)+(85)+(86)+(87)+(88)(81)+(82)+(83)+(84)+(85)+(86)+(87)+(88)\dbinom{8}{1} + \dbinom{8}{2} + \dbinom{8}{3} + \dbinom{8}{4} + \dbinom{8}{5} + \dbinom{8}{6} + \dbinom{8}{7} + \dbinom{8}{8} Lub bardziej ogólnie ∑k=1n(nk)∑k=1n(nk)\sum_{k=1}^{n}\dbinom{n}{k}

2
Jak zrobić uogólniony model liniowy z wieloma zmiennymi zależnymi w R?
Mam sześć zmiennych zależnych (dane zliczeń) i kilka zmiennych niezależnych, widzę, że w MMR skrypt wygląda następująco: my.model <- lm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + ... + IVn) Ale ponieważ moje dane się liczą, chcę użyć uogólnionego modelu liniowego i próbowałem tego: my.model <- glm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.