Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Jak przydatna jest Minitab w prawdziwym świecie? [Zamknięte]
Zamknięte . To pytanie jest oparte na opiniach . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby można było na nie odpowiedzieć faktami i cytatami, edytując ten post . Zamknięte 5 lat temu . Obecnie jestem studentem statystyki w ramach bardzo dobrego programu. Używamy Minitab do różnych …
9 sas  minitab 

2
Jak udowodnić, że różnorodne założenie jest prawidłowe?
W uczeniu maszynowym często zakłada się, że zbiór danych leży na gładkim kolektorze o małych wymiarach (założenie rozmaitości), ale czy istnieje jakiś sposób, aby udowodnić, że przy spełnieniu określonych warunków, zbiór danych jest rzeczywiście (w przybliżeniu) generowany z niskiego wymiaru gładkiego kolektora? Na przykład, biorąc pod uwagę sekwencję danych gdzie …


2
Wizualne podsumowanie bałaganu skierowanych segmentów linii
Mam zestaw danych milionów ukierunkowanych segmentów linii. Segmenty linii są sekwencyjne - jest to zmienna klimatyczna (ciepło jawne), z obserwowanymi i symulowanymi wartościami w odstępach półgodzinnych. Staram się szukać wzorców w działaniu symulacji. Patrzę na wykres rozrzutu wartości obs vs vs i łączę je z segmentami linii (strzałki wskazują kierunek …

4
Obliczanie dokładności prognozy
Używamy STL (implementacja R) do prognozowania danych szeregów czasowych. Codziennie przeprowadzamy codzienne prognozy. Chcielibyśmy porównać wartości prognozowane z wartościami rzeczywistymi i zidentyfikować średnie odchylenie. Na przykład uruchomiliśmy prognozę na jutro i otrzymaliśmy punkty prognozy, chcielibyśmy porównać te punkty prognozy z rzeczywistymi danymi, które otrzymamy jutro. Zdaję sobie sprawę, że wartości …

1
Uzyskiwanie wektorów kointegracyjnych metodą Johansena
Próbuję zrozumieć lepszą metodę Johansena, dlatego opracowałem przykład 3.1 podany w książce Likelihood-Based-Inference-Cointegrated-Autoregressive-Econometrics, w której mamy trzy procesy: X1t=∑i=1tϵ1i+ϵ2tX1t=∑i=1tϵ1i+ϵ2tX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} X2t=α∑i=1tϵ1i+ϵ3tX2t=α∑i=1tϵ1i+ϵ3t X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} X3t=ϵ4tX3t=ϵ4t X_{3t} = \epsilon_{4t} więc wektorami kointegracji powinny być [a, -1, 0] i [0, 0 1], ale kiedy …

4
Czy można stosować test Manna-Whitneya do porównań post-hoc po Kruskal-Wallis?
Mam symulację, w której zwierzę umieszcza się we wrogim środowisku i mierzy czas, aby zobaczyć, jak długo może przetrwać, stosując pewne podejście do przetrwania. Istnieją trzy podejścia do przetrwania. Przeprowadziłem 300 symulacji zwierzęcia, stosując każde podejście do przetrwania. Wszystkie symulacje odbywają się w tym samym środowisku, ale istnieje pewna przypadkowość, …

1
Dlaczego musisz dostarczyć model wariogramu, gdy krigujesz?
Jestem zupełnie nowy w statystyce przestrzennej i oglądam wiele samouczków, Ale tak naprawdę nie rozumiem, dlaczego musisz dostarczyć model wariogramu, kiedy krige. Korzystam z pakietu gstat w R, a oto przykład, który dają: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) = ~x+y m <- vgm(.59, "Sph", 874, .04) print(m) …
9 spatial 


2
Grupowanie zaszumionych danych lub wartości odstających
Mam zaszumione dane dwóch takich zmiennych. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, 0.5,0.9) y <- …

1
Jak wygenerować dane o przeżyciu za pomocą współzmiennych zależnych od czasu za pomocą R.
Chcę wygenerować czas przeżycia na podstawie proporcjonalnego modelu zagrożeń Coxa, który zawiera zmienną zależną od czasu. Model jest h ( t |Xja) =h0( t ) exp( γXja+ αmja( t ) )h(t|Xja)=h0(t)exp⁡(γXja+αmja(t))h(t|X_i) =h_0(t) \exp(\gamma X_i + \alpha m_{i}(t)) gdzie jest generowany z Binomial (1,0.5) i .XjaXjaX_imja( t ) =β0+β1Xja+β2)Xjatmja(t)=β0+β1Xja+β2)Xjatm_{i}(t)=\beta_0 + \beta_1 …

1
Zrozumienie dekompozycji pojedynczej wartości w kontekście LSI
Moje pytanie dotyczy generalnie pojedynczej dekompozycji wartości (SVD), a zwłaszcza Latent Semantic Indexing (LSI). Powiedzmy, że mam który zawiera częstotliwości 5 słów dla 7 dokumentów.ZAw O r d× do c u m e n tAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, byrow=TRUE) rownames(A) <- c('doctor','car','nurse','hospital','wheel') …

1
Standaryzacja funkcji podczas korzystania z LDA jako etapu wstępnego przetwarzania
Jeśli do redukcji wymiarowości (lub transformacji po zmniejszeniu wymiarowości za pomocą PCA) stosuje się wieloklasową liniową analizę dyskryminacyjną (lub czasami czytam też analizę wielokrotnej dyskryminacji), rozumiem, że ogólnie „normalizacja Z-score” (lub standaryzacja) funkcje nie będą konieczne, nawet jeśli są mierzone w zupełnie innych skalach, prawda? Skoro LDA zawiera termin podobny …

1
Dlaczego algorytm EM musi być iteracyjny?
Załóżmy, że masz populację NNN jednostki, każda z losową zmienną Xi∼Poisson(λ)Xi∼Poisson(λ)X_i \sim \text{Poisson}(\lambda). Ty obserwujeszn=N−n0n=N−n0n = N-n_0wartości dla dowolnej jednostki, dla której . Chcemy oszacowania .Xi>0Xi>0X_i > 0λλ\lambda Istnieją metody chwil i warunkowe maksymalne prawdopodobieństwo uzyskania odpowiedzi, ale chciałem wypróbować algorytm EM. Otrzymuję algorytm EM: gdzie indeks dolny wskazuje wartość …

2
Historia: rola statystyki w astronomii
Niedawno śmiało twierdziłem przed grupą dość inteligentnych studentów ósmej klasy, że astronomia w znacznym stopniu przyczyniła się do podstaw statystyki i wymyślono wiele koncepcji statystycznych do zastosowania w astronomii. Jednak patrząc na to, byłem dość rozczarowany. Błędy, średnią i średnie odchylenie od średniej można było po raz pierwszy zaobserwować w …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.