Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jak poprawnie zastosować test post-hoc Nemenyi po teście Friedmana
Porównuję wydajność wielu algorytmów na wielu zestawach danych. Ponieważ te pomiary wydajności nie są normalnie dystrybuowane, wybrałem test Friedmana z Nemenyi post-hoc testem opartym na Demšar (2006) . Następnie znalazłem inny artykuł, w którym oprócz sugerowania innych metod, takich jak test Quade z późniejszym testem post-hoc Shaffera, stosują test Nemenyi …

1
Dwie metody testów istotności bootstrap
Za pomocą bootstrap obliczam wartości p testów istotności, stosując dwie metody: ponowne próbkowanie w ramach hipotezy zerowej i liczenie wyników co najmniej tak ekstremalnych, jak wynik pochodzący z pierwotnych danych ponowne próbkowanie w ramach alternatywnej hipotezy i liczenie wyników co najmniej tak odległych od pierwotnego wyniku, jak wartość odpowiadająca hipotezie …

4
Zasoby online dotyczące filozofii przyczynowego wnioskowania przyczynowego
Czy możesz polecić jakieś książki, artykuły, eseje, samouczki / kursy online itp., Które byłyby interesujące i użyteczne dla epidemiologa / biostatysty do poznania filozofii przyczynowości / wnioskowania przyczynowego? Wiem sporo na temat wnioskowania przyczynowego z frameworku epi i biostatów, ale chciałbym dowiedzieć się czegoś o filozofii, która leży u podstaw …

2
Jak modelować efekty miesiąc do miesiąca w danych dziennych szeregów czasowych?
Mam dwie serie danych dziennych. Jedna z nich to sign-upsdruga terminationssubskrypcja. Chciałbym przewidzieć ten drugi, wykorzystując informacje zawarte w obu zmiennych. Patrząc na wykres tych serii, oczywiste jest, że zakończenia są skorelowane z wielokrotnością rejestracji sprzed miesięcy. Oznacza to, że skok liczby rejestracji w dniu 10 maja doprowadzi do wzrostu …

3
Dowód związku między współczynnikiem ryzyka, gęstością prawdopodobieństwa, funkcją przeżycia
Czytam trochę na temat analiz przetrwania i większość podręczników to stwierdza h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)= \lim_{ \Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t |T \geq t )}{ \Delta t} =\frac{f(t)}{1-F(t)} (1) gdzie h(t)h(t)h(t) jest wskaźnikiem ryzyka, f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=\lim_{\Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t)}{ \Delta t}(2) funkcja gęstości, …
11 survival 

1
Wydajność regresji grzbietu jądra
Regresję grzbietu można wyrazić jako gdzie jest przewidywaną etykietą , do identyfikacji macierzy pożądanego obiektu próbują znaleźć etykietę i macierz PRZEDMIOTY, takie, że:y^=(X′X+aId)−1Xxy^=(X′X+aId)−1Xx\hat{y} = (\mathbf{X'X} + a\mathbf{I}_d)^{-1}\mathbf{X}xy^y^\hat{y}IdId\mathbf{I}_dd×dd×dd \times dxx\mathbf{x}XX\mathbf{X}n×dn×dn \times dnnnxi=(xi,1,...,xi,d)∈Rdxi=(xi,1,...,xi,d)∈Rd\mathbf{x}_i = (x_{i,1}, ..., x_{i,d})\in \mathbb{R}^d X=⎛⎝⎜⎜⎜⎜⎜x1,1x2,1⋮xn,1x1,2x2,2⋮x1,2……⋱…x1,dx2,d⋮xn,d⎞⎠⎟⎟⎟⎟⎟X=(x1,1x1,2…x1,dx2,1x2,2…x2,d⋮⋮⋱⋮xn,1x1,2…xn,d) \mathbf{X} = \begin{pmatrix} x_{1,1} & x_{1,2} & \ldots & x_{1,d}\\ x_{2,1} & x_{2,2} …

3
PCA, ICA i mapy własne Laplaciana
Pytanie Jestem bardzo zainteresowany metodą Laplacian Eigenmaps. Obecnie używam go do redukcji wymiarów w moich zestawach danych medycznych. Jednak natknąłem się na problem przy użyciu tej metody. Na przykład mam pewne dane (sygnały widmowe) i mogę użyć PCA (lub ICA), aby uzyskać trochę komputerów (lub układów scalonych). Problem polega na …
11 pca  ica 

4
Jak znaleźć związki przyczynowe w danych?
Powiedzmy, że mam tabelę z kolumnami „A”, „B” Czy istnieje metoda statystyczna pozwalająca ustalić, czy „A” powoduje „B”? Tak naprawdę nie można używać r Pearsona, ponieważ: testuje tylko korelację między wartościami korelacja nie jest przyczyną Wartość r Pearsona może korelować tylko relacje liniowe Jakie inne opcje mam tutaj?

3
Tworzenie automatycznie skorelowanych wartości losowych w R
Próbujemy stworzyć automatycznie skorelowane wartości losowe, które zostaną wykorzystane jako szeregi czasowe. Nie mamy żadnych danych, do których się odwołujemy, a po prostu chcemy stworzyć wektor od zera. Z jednej strony potrzebujemy oczywiście losowego procesu z rozkładem i jego SD. Z drugiej strony należy opisać autokorelację wpływającą na losowy proces. …

1
Test Fishera w R.
Załóżmy, że mamy następujący zestaw danych: Men Women Dieting 10 30 Non-dieting 5 60 Jeśli uruchomię dokładny test Fishera w R, co to oznacza alternative = greater(lub mniej)? Na przykład: mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") Dostaję p-value = 0.01588i odds ratio = 3.943534. Ponadto, kiedy odwracam wiersze tabeli awaryjnej …

2
Losowy las na zgrupowanych danych
Używam losowego lasu na wielowymiarowych zgrupowanych danych (50 liczbowych zmiennych wejściowych), które mają strukturę hierachiczną. Dane zebrano przy 6 replikacjach w 30 pozycjach 70 różnych obiektów, co dało 12600 punktów danych, które nie są niezależne. Wygląda na to, że losowy las przesadza z danymi, ponieważ błąd OOB jest znacznie mniejszy …



4
Co zrobić z objaśnieniami w szeregach czasowych?
Pracując głównie z danymi przekrojowymi do tej pory i bardzo niedawno przeglądając, skanując potykając się o kilka wstępnych literatur szeregów czasowych, zastanawiam się, jaką rolę odgrywają zmienne objaśniające w analizie szeregów czasowych. Chciałbym wyjaśnić trend zamiast usuwania trendów. Większość tego, co przeczytałem jako wstęp, zakłada, że ​​seria wywodzi się z …

6
Jak zmniejszyć liczbę punktów danych w serii?
Nie studiowałem statystyk przez ponad 10 lat (a potem tylko podstawowy kurs), więc może moje pytanie jest trochę trudne do zrozumienia. W każdym razie chcę zmniejszyć liczbę punktów danych w serii. Oś X jest liczbą milisekund od początku pomiaru, a oś Y jest odczytem tego punktu. Często istnieją tysiące punktów …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.