Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Edukacja statystyczna dzieci w różnych krajach?
Chcę wiedzieć, jaki poziom statystyk uczą się dzieci w różnych krajach na całym świecie. Czy mógłby Pan zasugerować dane / linki, które rzucają światło na to, co dzieje się w tym zakresie? Zacznę. Izrael: Studenci, którzy uczą się zaawansowanej matematyki, mniej więcej - średnia, sd, histogram, rozkład normalny, bardzo podstawowe …
10 dataset  teaching 

4
Animowanie efektu zmiany szerokości jądra w R
Mam pewne dane w R, zapisane na liście. Myśleć d <- c(1,2,3,4) chociaż to nie są moje dane. Jeśli następnie wprowadzę polecenie plot(density(d, kernel="gaussian", width=1)) następnie otrzymuję oszacowanie prawdopodobieństwa gęstości jądra, gdzie jądro jest normalnie normalne. Jeśli zastąpię 1 innymi liczbami, obraz oczywiście się zmieni. Chciałbym stworzyć wideo lub animację, …


1
Czy test istotności ma sens porównywać randomizowane grupy na początku?
Wiele badań z randomizowanym badaniem kontrolnym (RCT) podaje testy istotności parametrów wyjściowych tuż po / przed randomizacją, aby wykazać, że grupy są rzeczywiście podobne. Często jest to część tabeli „podstawowych charakterystyk”. Jednak testy istotności mierzą prawdopodobieństwo przypadkowego uzyskania zaobserwowanej (lub silniejszej) różnicy, prawda? A jeśli test jest znaczący, dochodzimy do …

4
Jaki test porównać skład społeczności?
Mam nadzieję, że to pytanie dla początkujących jest właściwym pytaniem dla tej witryny: Załóżmy, że chciałbym porównać skład społeczności ekologicznych w dwóch miejscach A, B. Wiem, że wszystkie trzy miejsca mają psy, koty, krowy i ptaki, więc próbuję ich liczebności w każdym miejscu (tak naprawdę nie mam „ spodziewana „liczebność …

1
Współczynnik korelacji wewnątrzklasowej vs. test F (jednokierunkowa ANOVA)?
Jestem trochę zdezorientowany, jeśli chodzi o współczynnik korelacji wewnątrzklasowej i jednokierunkową ANOVA. Jak rozumiem, oba mówią ci, jak podobne są obserwacje w grupie, w porównaniu z obserwacjami w innych grupach. Czy ktoś mógłby wyjaśnić to nieco lepiej, a może wyjaśnić sytuację, w której każda metoda jest bardziej korzystna?

1
Znaczenie współczynników regresji (GAM), gdy prawdopodobieństwo modelu nie jest znacząco wyższe niż zero
Korzystam z regresji opartej na GAM, używając pakietu R gamlss i zakładając zerową zawyżoną dystrybucję danych beta. Mam tylko jedną zmienną objaśniającą w moim modelu, więc to zasadniczo: mymodel = gamlss(response ~ input, family=BEZI). Algorytm podaje mi współczynnik dla wpływu zmiennej objaśniającej na średnią ( ) i powiązaną wartość p …



8
Encyklopedia graficzna
Muszę zbudować aplikację internetową dla wielu użytkowników, która dotyczy pomiarów ruchu, prognoz itp. W tym momencie wiem, że będę korzystać z wykresów słupkowych i kołowych. Niestety te typy wykresów nie są bogate w wyrażanie wszystkich danych, które zbieram i obliczam. Szukam kolekcji graficznych wykresów. Jest ok, jeśli muszę kupić książkę …

1
Czy jest możliwe analityczne całkowanie
Po pierwsze, poprzez integrację analityczną, mam na myśli, czy istnieje reguła integracji, która rozwiązuje to w przeciwieństwie do analiz numerycznych (takich jak reguły trapezoidalne, Gaussa-Legendre'a lub Simpsona)? Mam funkcję gdzie to funkcja gęstości prawdopodobieństwa rozkładu logarytmicznego z parametry i \ sigma . Poniżej skrócę notację do g (x) i użyję …

1
Wskazówki dotyczące identyfikowania kształtu krzywej za pomocą quantreg
Używam quantreg pakiet do modelu regresji używając 99. percentyla moich wartości w zbiorze danych. W oparciu o porady z poprzedniego pytania dotyczącego przepełnienia stosu użyłem następującej struktury kodu. mod <- rq(y ~ log(x), data=df, tau=.99) pDF <- data.frame(x = seq(1,10000, length=1000) ) pDF <- within(pDF, y <- predict(mod, newdata = …

3
Testowanie hipotez na ciągłych danych o zerowym napompowaniu
Byłbym bardzo wdzięczny za twoje porady dotyczące następującego problemu: Mam duży ciągły zestaw danych z dużą ilością zer (~ 95%) i muszę znaleźć najlepszy sposób, aby sprawdzić, czy niektóre jego podzbiory są „interesujące”, tj. Nie wydają się pochodzić z tego samego rozkładu co reszta. Zero inflacji wynika z faktu, że …

3
Jak wyświetlić macierz korelacji z brakującymi wpisami?
Chciałbym uzyskać graficzną reprezentację korelacji w artykułach, które zebrałem do tej pory, aby łatwo zbadać relacje między zmiennymi. Kiedyś rysowałem (niechlujny) wykres, ale teraz mam za dużo danych. Zasadniczo mam stół z: [0]: nazwa zmiennej 1 [1]: nazwa zmiennej 2 [2]: wartość korelacji Matryca „ogólna” jest niekompletna (np. Mam korelację …

2
Równoważenie pakietu karetki za pomocą doSMP
AKTUALIZACJA: daszek używa teraz foreachwewnętrznie, więc to pytanie nie jest już tak naprawdę istotne. Jeśli możesz zarejestrować działający backend równoległy foreach, Caret go użyje. Mam pakiet karetki dla R i jestem ciekawy w użyciu trainfunkcji do krzyżowej weryfikacji moich modeli. Chcę jednak przyspieszyć i wydaje się, że daszek zapewnia obsługę …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.