Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

6
Znajdowanie punktu zmiany w danych z częściowej funkcji liniowej
Pozdrowienia, Przeprowadzam badania, które pomogą określić rozmiar obserwowanej przestrzeni i czas, jaki upłynął od Wielkiego Wybuchu. Mam nadzieję, że możesz pomóc! Mam dane zgodne z częściową funkcją liniową, na której chcę wykonać dwie regresje liniowe. Jest punkt, w którym nachylenie i punkt przecięcia zmieniają się i muszę (napisać program) znaleźć …

1
Jak radzić sobie z pytaniem ankietowym z wieloma odpowiedziami?
Mam zestaw danych, w którym pytam ludzi, czy byli w określonych miejscach (np. A, B, C, D), i mogą dokonać więcej niż jednego wyboru, następnie próbka jest pobierana z nosa, aby sprawdzić, czy są zarażeni niektórymi choroba. Muszę dowiedzieć się o względnym ryzyku zarażenia osoby udającej się w określone miejsce. …
10 logistic 

4
Biorąc pod uwagę łańcuch MCD 10D, jak mogę określić jego tryb (y) w R?
Pytanie: Za pomocą 10-wymiarowego łańcucha MCMC powiedzmy, że jestem przygotowany na przekazanie macierzy losowań: 100 000 iteracji (wierszy) na 10 parametrów (kolumn). Jak najlepiej zidentyfikować tryby tylne? Szczególnie interesuje mnie wiele trybów. Tło:Uważam się za doświadczonego obliczeniowo statystykę, ale kiedy kolega zadał mi to pytanie, wstydziłem się, że nie mogłem …

5
Omega do kwadratu dla miary efektu w R?
W książce statystyk, którą czytam, zaleca się omega kwadrat do zmierzenia efektów moich eksperymentów. Udowodniłem już, że stosując projekt podzielonego wykresu (połączenie projektu między podmiotami i projektu między podmiotami), moje czynniki w obrębie podmiotów są statystycznie istotne przy p <0,001 i F = 17. Teraz chcę zobaczyć, jak duża jest …

1
Wyjście modelu logistycznego w R.
Próbuję zinterpretować następujący typ modelu logistycznego: mdl <- glm(c(suc,fail) ~ fac1 + fac2, data=df, family=binomial) Czy wynik predict(mdl)oczekiwanych szans powodzenia dla każdego punktu danych? Czy istnieje prosty sposób na zestawienie szans dla każdego poziomu czynnika w modelu, a nie dla wszystkich punktów danych?






2
Generowanie zmiennych losowych spełniających ograniczenia
Muszę wygenerować listę zmiennych losowych podlegających ograniczeniom, które można wyrazić w postaci gdzie jest macierzą , jeśli ma wpisów. We wszystkich przypadkach, z którymi mam do czynienia, , na przykład będzie wynosić około 14 000, a będzie wynosić 50. Nie jestem pewien, jakiej metody użyję do losowego próbkowania, normalnej lub …


3
Redundancja obsługi modeli efektów losowych
Próbuję poradzić sobie z analizą czasu do zdarzenia z wykorzystaniem powtarzających się wyników binarnych. Załóżmy, że czas do zdarzenia mierzony jest w dniach, ale na razie dyskretujemy czas do tygodni. Chcę aproksymować estymator Kaplana-Meiera (ale uwzględniać zmienne towarzyszące) przy użyciu powtarzanych wyników binarnych. Wydaje się, że jest to droga okrężna, …

2
Czy średnie odchylenie bezwzględne jest mniejsze niż odchylenie standardowe dla
Chcę porównać średnie odchylenie bezwzględne z odchyleniem standardowym w ogólnym przypadku z tą definicją: MAD=1n−1∑1n|xi−μ|,SD=∑n1(xi−μ)2n−1−−−−−−−−−−−√M.ZAre=1n-1∑1n|xja-μ|,S.re=∑1n(xja-μ)2)n-1MAD = \frac{1}{n-1}\sum_1^n|x_i - \mu|, \qquad SD = \sqrt{\frac{\sum_1^n(x_i-\mu)^2}{n-1}} gdzie .μ=1n∑n1xiμ=1n∑1nxja\mu =\frac{1}{n}\sum_1^n x_i Czy to prawda, że dla każdego ?MAD≤SDM.ZAre≤S.reMAD \le SD{xi}n1{xja}1n\{x_i\}^n_1 Jest fałszem dla , ponieważ , dla każdego .n=2n=2)n=2x+y≥x2+y2−−−−−−√x+y≥x2)+y2)x+y \ge \sqrt{x^2+y^2}x,y≥0x,y≥0x, y \ge 0 …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.