Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak wykreślić funkcję schodkową za pomocą ggplot?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Mam taki wykres: Kod R do jego wygenerowania to: DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, 1, 0.1)) DF <- DF[order(DF$DateVariable),] #Sort …

3
Jak mogę oszacować prawdopodobieństwo, że losowy członek z jednej populacji będzie „lepszy” niż losowy członek z innej populacji?
Załóżmy, że mam próbki z dwóch różnych populacji. Jeśli zmierzę, ile czasu zajmuje każdemu członkowi wykonanie zadania, mogę łatwo oszacować średnią i wariancję dla każdej populacji. Jeśli teraz hipotetycznie sparuję jedną osobę z każdej populacji, czy mogę oszacować prawdopodobieństwo, że pierwsza jest szybsza niż druga? Mam na myśli konkretny przykład: …



2
Obszar pod „pdf” w szacowaniu gęstości jądra w R
Próbuję użyć funkcji „ gęstości ” w R do oszacowania gęstości jądra. Mam pewne trudności z interpretacją wyników i porównywaniem różnych zestawów danych, ponieważ wydaje się, że obszar pod krzywą niekoniecznie jest 1. Dla każdej funkcji gęstości prawdopodobieństwa (pdf) musimy mieć obszar ∫ ∞ - ∞ ϕ ( x ) …

2
Co to jest „metoda przekazywania wiadomości”?
Mam niejasne wyczucie, czym jest metoda przekazywania wiadomości: algorytm, który buduje aproksymację do rozkładu poprzez iteracyjne budowanie aproksymacji każdego z czynników rozkładu, zależnie od wszystkich aproksymacji wszystkich innych czynników. Uważam, że oba są przykładami Przekazywanie komunikatów wariacyjnych i propagowanie oczekiwań . Co to jest algorytm przekazywania komunikatów bardziej jawnie / …

1
Jak skonfigurować i zinterpretować kontrasty ANOVA z pakietem samochodowym w R?
Powiedzmy, że mam prosty eksperyment czynnikowy 2x2, na którym chcę wykonać ANOVA. W ten sposób na przykład: d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); W przypadku braku znaczącej interakcji, domyślnie (tj. contr.treatment) Wynikiem Anova()jest …
15 r  anova  contrasts 

4
Jak mogę poprawić swoją analizę wpływu reputacji na głosowanie?
Niedawno przeprowadziłem analizę wpływu reputacji na opinie (patrz blog ), a następnie miałem kilka pytań na temat być może bardziej pouczającej (lub bardziej odpowiedniej) analizy i grafiki. Tak więc kilka pytań (i nie krępuj się odpowiadać każdemu w szczególności i ignoruj ​​pozostałe): W obecnym wcieleniu nie miałem na myśli wyśrodkowania …

1
Jak działa normalizacja kwantowa?
W badaniach ekspresji genów za pomocą mikromacierzy dane dotyczące intensywności muszą zostać znormalizowane, aby można było porównać intensywności między poszczególnymi osobami, między genami. Pojęciowo i algorytmicznie, jak działa „normalizacja kwantowa” i jak wytłumaczyłbyś to statystyce?

1
Jakie są zalety i wady uczenia się o rozkładzie algorytmicznym (symulacje) w porównaniu do matematyki?
Jakie są zalety i wady uczenia się o właściwościach dystrybucji algorytmicznie (za pomocą symulacji komputerowych) a matematycznie? Wydaje się, że symulacje komputerowe mogą być alternatywną metodą uczenia się, szczególnie dla tych nowych studentów, którzy nie czują się silni w rachunku różniczkowym. Wydaje się również, że symulacje kodowania mogą zaoferować wcześniejsze …


8
Jak NIE używać statystyk
To jest pytanie otwarte, ale chcę być jasne. Biorąc pod uwagę wystarczającą populację, możesz być w stanie się czegoś nauczyć (jest to część otwarta), ale cokolwiek dowiesz się o swojej populacji, kiedy ma to kiedykolwiek zastosowanie do członka populacji? Z tego, co rozumiem przez statystyki, nigdy nie ma ona zastosowania …

2
Rozbieżność Kullbacka – Leiblera między dwoma rozkładami gamma
Wybór sparametryzowania rozkładu gamma Γ(b,c)Γ(b,c)\Gamma(b,c) według pdf g(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b} Rozbieżność Kullbacka-Leiblera międzyΓ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)iΓ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p)jest podana przez [1] as KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqbp\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} \end{align} Zgaduję, że Ψ(x):=Γ′(x)/Γ(x)Ψ(x):=Γ′(x)/Γ(x)\Psi(x):= \Gamma'(x)/\Gamma(x) jest funkcją digamma . Jest …


1
Czy GSVD implementuje wszystkie liniowe techniki wielowymiarowe?
Natknąłem się na artykuł Hervé Abdiego na temat uogólnionego SVD. Autor wspomniał: Uogólniony SVD (GSVD) rozkłada macierz prostokątną i bierze pod uwagę ograniczenia nałożone na wiersze i kolumny macierzy. GSVD daje ważoną uogólnioną estymatę najmniejszej kwadratowej danej macierzy przez macierz niższego rzędu, a zatem, przy odpowiednim wyborze ograniczeń, GSVD wdraża …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.