Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Kiedy filtr Kalmana da lepsze wyniki niż zwykła średnia ruchoma?
Niedawno wdrożyłem filtr Kalmana na prostym przykładzie pomiaru położenia cząstek z losową prędkością i przyspieszeniem. Odkryłem, że filtr Kalmana działa dobrze, ale zadałem sobie pytanie, jaka jest różnica między tym a zwykłą średnią ruchomą? Odkryłem, że jeśli użyję okna z około 10 próbek, których średnia ruchoma przewyższa filtr Kalmana, i …

2
Możliwość zastosowania testu chi-kwadrat, jeżeli wiele komórek ma częstotliwości mniejsze niż 5
Aby znaleźć związek między wsparciem rówieśnika (zmienna niezależna) a satysfakcją z pracy (zmienna zależna), chcę zastosować test chi-kwadrat. Wsparcie rówieśników to kategorie w czterech grupach według stopnia wsparcia: 1 = bardzo mniej, 2 = do pewnego stopnia, 3 = w dużym stopniu i 4 = w bardzo dużym stopniu. Zadowolenie …

6
Różnica między danymi panelu a modelem mieszanym
Chciałbym poznać różnicę między analizą danych panelowych a analizą modelu mieszanego. Według mojej wiedzy, zarówno dane panelowe, jak i modele mieszane wykorzystują efekty stałe i losowe. Jeśli tak, to dlaczego mają różne nazwy? A może są synonimami? Przeczytałem następujący post, który opisuje definicję efektu stałego, losowego i mieszanego, ale nie …


3
Dobre streszczenia (recenzje, książki) na temat różnych zastosowań sieci Markov Monte Carlo (MCMC)?
Czy są jakieś dobre streszczenia (recenzje, książki) na temat różnych zastosowań sieci Markov Monte Carlo (MCMC)? Widziałem Markov Chain Monte Carlo w praktyce , ale te książki wydają się trochę stare. Czy jest więcej książek o aktualizacjach dotyczących różnych zastosowań MCMC w takich obszarach jak uczenie się maszyn, widzenie komputerowe …

1
Założenia uogólnionego modelu liniowego
Stworzyłem uogólniony model liniowy z pojedynczą zmienną odpowiedzi (ciągła / normalnie rozłożona) i 4 zmiennymi objaśniającymi (z których 3 to czynniki, a czwarta to liczba całkowita). Użyłem rozkładu błędów Gaussa z funkcją łącza tożsamości. Obecnie sprawdzam, czy model spełnia założenia uogólnionego modelu liniowego, którymi są: niezależność Y poprawna funkcja łącza …

1
Jaka jest różnica między wilcox.test a coin :: wilcox_test w R?
Te dwie funkcje istnieją w R, ale nie znam ich różnic. Wygląda na to, że zwracają tylko te same wartości p podczas wywoływania wilcox.testz correct=FALSEoraz wilcox_test(w pakiecie monet) z distribution="aymptotic". Dla innych wartości zwracają różne wartości p. Również wilcox.testzawsze zwraca W = 0 dla mojego zestawu danych, niezależnie od ustawień …

3
Miara statystyczna określająca, czy obraz składa się z oddzielnych przestrzennie połączonych regionów
Rozważ te dwa obrazy w skali szarości: Pierwsze zdjęcie pokazuje meandrujący wzór rzeki. Drugi obraz pokazuje losowy szum. Szukam miary statystycznej, której mogę użyć do ustalenia, czy prawdopodobne jest, że obraz pokazuje wzór rzeki. Obraz rzeki ma dwa obszary: rzeka = wysoka wartość i wszędzie indziej = niska wartość. W …

1
Uregulowana bayesowska regresja logistyczna w JAGS
Istnieje kilka prac matematycznych opisujących lasso bayesowskie, ale chcę przetestować poprawny kod JAGS, którego mogę użyć. Czy ktoś może opublikować próbkę kodu BŁĘDY / JAGS, który implementuje regulowaną regresję logistyczną? Każdy schemat (L1, L2, Elasticnet) byłby świetny, ale preferowany jest Lasso. Zastanawiam się także, czy istnieją ciekawe alternatywne strategie wdrażania.

1
Liniowe modelowanie efektów mieszanych z danymi z badań bliźniaczych
Załóżmy, że mam jakąś zmienną odpowiedzi która została zmierzona od j- tego rodzeństwa w i- tej rodzinie. Ponadto niektóre dane behawioralne x i j zebrano w tym samym czasie od każdego pacjenta. Próbuję przeanalizować sytuację za pomocą następującego liniowego modelu mieszanych efektów:yI jyijy_{ij}jotjjjaiixI jxijx_{ij} yI j= α0+ α1xI j+ δ1 …

2
Wyjaśnianie regresji kwantylowej niestatystom
Niedawno przedłożyłem artykuł, w którym zastosowałem regresję kwantową, do czasopisma psychologicznego. Chociaż myślałem, że włożyłem już wystarczająco dużo uwagi w wyraźną prezentację regresji kwantowej, recenzenci poprosili o lepsze wyjaśnienia techniki regresji kwantowej, znając jedynie standardową regresję OLS. Jaki jest zatem najlepszy sposób na wyjaśnienie regresji kwantowej w pracy empirycznej niestatystom?

2
Generuj próbki danych z regresji Poissona
Zastanawiałem się, jak wygenerować dane z równania regresji Poissona w R? Jestem trochę zdezorientowany, jak podejść do problemu. Więc jeśli założę, że mamy dwa predyktory i które są rozproszone . A przecięcie wynosi 0, a oba współczynniki są równe 1. Zatem moje oszacowanie jest po prostu:X 2 N ( 0 …

1
Co oznaczają strzałki w biplocie PCA?
Rozważ następujący dwupłat PCA: library(mvtnorm) set.seed(1) x <- rmvnorm(2000, rep(0, 6), diag(c(5, rep(1,5)))) x <- scale(x, center=T, scale=F) pc <- princomp(x) biplot(pc) Zostało narysowanych kilka czerwonych strzałek, co one oznaczają? Wiedziałem, że pierwsza strzałka oznaczona „Var1” powinna wskazywać najbardziej zróżnicowany kierunek zbioru danych (jeśli uważamy, że to 2000 punktów danych, …
14 r  pca  linear-algebra  biplot 

4
Co to jest losowość?
W prawdopodobieństwie i statystyce często stosuje się pojęcia „losowości” i „losowości”. Często pojęcie zmiennej losowej służy do modelowania zdarzeń, które występują z powodu przypadku. Moje pytanie dotyczy terminu „losowy”. Co jest losowe? Czy przypadkowość naprawdę istnieje? Jestem ciekawy, co ludzie, którzy mają duże doświadczenie w pracy z przypadkowymi zdarzeniami, myślą …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.