Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Jakie resztki i odległość Cooka są używane w GLM?
Czy ktoś wie, jaki jest wzór na odległość Cooka? Oryginalna formuła odległości Cooka wykorzystuje resztki studenckie, ale dlaczego R używa std. Resztki Pearsona podczas obliczania wykresu odległości Cooka dla GLM. Wiem, że resztki studenckie nie są zdefiniowane dla GLM, ale jak wygląda wzór do obliczania odległości Cooka? Załóżmy następujący przykład: …

2
Znajdowanie indeksu kolumny według jego nazwy w R [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 6 lat temu . W ramce danych chciałbym uzyskać indeks kolumny według nazwy. Na przykład: x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) Chcę poznać indeks kolumny dla „paska”. Wymyśliłem …
11 r 

1
Jakie metody graficzne są przydatne do wizualizacji agregacji niepewności?
Mam zestaw systemów, w których gromadzą się w nim niepewności. Nie zawsze są one czysto addytywne - czasem są, a czasem nie. Odniosłem pewne sukcesy w stosowaniu wykresów wachlarzowych, słupkowych z przedziałami ufności i wykresów pudełkowych do komunikowania pojedynczych elementów. Ale w jaki sposób mogę pokazać, w jaki sposób gromadzą …


1
Symulacja serii ARIMA (1,1,0)
Dopasowałem modele ARIMA do oryginalnej serii czasowej, a najlepszym modelem jest ARIMA (1,1,0). Teraz chcę zasymulować serię z tego modelu. Napisałem prosty model AR (1), ale nie mogłem zrozumieć, jak dostosować różnicę w modelu ARI (1,1,0). Następujący kod R dla serii AR (1) to: phi= -0.7048 z=rep(0,100) e=rnorm(n=100,0,0.345) cons=2.1 z[1]=4.1 …
11 r  time-series  arima 

2
Wariancja dwóch ważonych zmiennych losowych
Pozwolić: Odchylenie standardowe zmiennej losowej A=σ1=5A=σ1=5A =\sigma_{1}=5 Odchylenie standardowe zmiennej losowej B=σ2=4B=σ2=4B=\sigma_{2}=4 Zatem wariant A + B jest następujący: Var(w1A+w2B)=w21σ21+w22σ22+2w1w2p1,2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} Gdzie: to korelacja między dwiema zmiennymi losowymi.p1,2p1,2p_{1,2} to waga zmiennej losowej Aw1w1w_{1} to waga zmiennej losowej Bw2w2w_{2} w1+w2=1w1+w2=1w_{1}+w_{2}=1 Poniższy rysunek przedstawia wariancję A i B, gdy waga A …

4
Jak testujesz implementację k-średnich?
Uwaga: zamieściłem to pytanie na Stackoverflow, ale pomyślałem, że może lepiej pasować do tej platformy. Jak testujesz własną implementację k-średnich dla wielowymiarowych zestawów danych? Myślałem o uruchomieniu już istniejącej implementacji (tj. Matlaba) na danych i porównaniu wyników z moim algorytmem. Wymagałoby to jednak, aby oba algorytmy działały w przybliżeniu tak …

4
Jak wykonać test T z dużymi próbkami?
Mam dwie populacje, jedną z N = 38 704 (liczba obserwacji), a drugą z N = 1 313 662. Te zestawy danych mają ~ 25 zmiennych, wszystkie ciągłe. Wziąłem średnią z każdego z każdego zestawu danych i obliczyłem statystyki testowe przy użyciu wzoru t = średnia różnica / błąd standardowy …
11 t-test 

1
Dlaczego warto korzystać z rozszerzenia Cornish-Fisher zamiast próbki kwantowej?
Rozszerzenie Cornish-Fisher zapewnia sposób oszacowania kwantyli rozkładu na podstawie momentów. (W tym sensie widzę to jako uzupełnienie rozszerzenia Edgewortha , które daje oszacowanie skumulowanego rozkładu opartego na momentach.) Chciałbym wiedzieć, w jakich sytuacjach wolałby rozszerzenie Cornish-Fisher do pracy empirycznej nad próbka kwantyla lub odwrotnie. Kilka domysłów: Obliczeniowo, momenty próbne można …

2
Obliczanie wskaźników sezonowości dla złożonej sezonowości
Chcę prognozować artykuły detaliczne (według tygodnia) za pomocą wygładzania wykładniczego. W tej chwili utknąłem w sposobie obliczania, przechowywania i stosowania indeksów sesonalności. Problem polega na tym, że wszystkie przykłady, które znalazłem, dotyczą pewnego rodzaju sezonowości. W moim przypadku mam następujące problemy: 1. Pory roku nie występują w tym samym tygodniu …

2
Próg miękki a penalizacja Lasso
Staram się podsumować to, co do tej pory rozumiałem w karanej analizie wielowymiarowej z wielowymiarowymi zestawami danych, i wciąż uzyskanie właściwej definicji kary miękkiego progowania w porównaniu z penalizacją Lasso (lub ).L1L1L_1 Dokładniej, wykorzystałem rzadką regresję PLS do analizy 2-blokowej struktury danych, w tym danych genomowych ( polimorfizmy pojedynczego nukleotydu …

5
Jakie są sposoby wykazania, że ​​dwie metody analityczne są równoważne?
Mam dwie różne metody analityczne, które mogą zmierzyć stężenie konkretnej cząsteczki w matrycy (na przykład zmierzyć ilość soli w wodzie) Dwie metody są różne i każda ma swój własny błąd. Jakie sposoby pokazania tych dwóch metod są równoważne (lub nie). Myślę, że wykreślenie wyników z wielu próbek zmierzonych obiema metodami …

3
dyskretne?
Powiedz, że jest ciągłą zmienną losową, a X jest zmienną dyskretną. \ Pr (X = x | Y = y) = \ frac {\ Pr (X = x) \ Pr (Y = y | X = x)} {\ Pr (Y = y)} YYYXXXPr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y)Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y) \Pr(X=x|Y=y) = \frac{\Pr(X=x)\Pr(Y=y|X=x)}{\Pr(Y=y)} Jak wiemy, Pr(Y=y)=0Pr(Y=y)=0\Pr(Y=y) = …

1
Jak różne są splajny sześcienne ograniczone i splajny karane?
Dużo czytam o używaniu splajnów w różnych problemach z regresją. Niektóre książki (np. Bogato sparametryzowane modele liniowe Hodgesa ) zalecają splajnowane splajny. Inne (np. Strategie modelowania regresji Harrella ) wybierają ograniczone splajny sześcienne. Jak różne są one w praktyce? Czy często uzyskiwałbyś zasadniczo odmienne wyniki od korzystania z jednego lub …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.