Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Dlaczego kiedykolwiek używać Durbin-Watson zamiast testować autokorelację?
Test Durbina-Watsona testuje autokorelację reszt przy opóźnieniu 1. Ale tak samo jest z testowaniem autokorelacji przy opóźnieniu 1. Dodatkowo możesz przetestować autokorelację przy opóźnieniu 2,3,4, a istnieją dobre testy Portmanteau dla autokorelacji przy wielu opóźnieniach i uzyskać ładne, łatwo interpretowalne wykresy [np. Funkcja acf () w R]. Durbin-Watson nie jest …

2
Czy ważenie oparte na dokładności (tj. Wariancji odwrotnej) jest integralną częścią metaanalizy?
Czy ważenie precyzyjne ma kluczowe znaczenie dla metaanalizy? Borenstein i in. (2009) piszą, że aby metaanaliza była możliwa, konieczne jest jedynie: Badania podają oszacowanie punktowe, które można wyrazić jako pojedynczą liczbę. Odchylenie można obliczyć dla tego oszacowania punktowego. Nie jest od razu jasne, dlaczego (2) jest absolutnie niezbędny. Rzeczywiście wszystkie …

4
Czy to jest poprawne ? (generowanie skróconej normy-wielowymiarowej-gaussowskiej)
Jeśli X∈Rn, X∼N(0–,σ2I)X∈Rn, X∼N(0_,σ2I)X\in\mathbb{R}^n,~X\sim \mathcal{N}(\underline{0},\sigma^2\mathbf{I}) tj. fX(x)=1(2πσ2)n/2exp(−||x||22σ2)fX(x)=1(2πσ2)n/2exp⁡(−||x||22σ2) f_X(x) = \frac{1}{{(2\pi\sigma^2)}^{n/2}} \exp\left(-\frac{||x||^2}{2\sigma^2}\right) Chcę analogicznej wersji skróconego rozkładu normalnego w przypadku wielu odmian. Dokładniej, chcę wygenerować ograniczony normą (do wartości ≥a≥a\geq a ) wielowymiarowy Gaussowski YYY st fY(y)={c.fX(y), if ||y||≥a0, otherwise .fY(y)={c.fX(y), if ||y||≥a0, otherwise . f_Y(y) = \begin{cases} c.f_X(y), \text{ if …


1
Rozróżnij efekty krótko- i długoterminowe
Przeczytałem w artykule następujące zdanie: Fakt, że istnieje różnica między współczynnikami krótko- i długoterminowymi, wynika z naszej specyfikacji, która obejmuje opóźnione zmienne endogeniczne. Prowadzą regresję pierwszych różnic i obejmują opóźnienie zmiennej zależnej. Teraz twierdzą, że jeśli spojrzysz na oszacowanie (np. Nazwijmy to oszacowanie ) z wyjścia, to jest to krótkoterminowy …

2
Oprócz testu Durbina-Watsona, jakie testy hipotez mogą przynieść niejednoznaczne wyniki?
Statystyka testowa Durbin, Watson może leżeć w obszarze jednoznaczne, w których nie jest możliwe albo odrzucić czy nie odrzucenia hipotezy zerowej (w tym przypadku zero autokorelacji). Jakie inne testy statystyczne mogą dać „niejednoznaczne” wyniki? Czy istnieje ogólne wyjaśnienie (machanie ręką jest w porządku), dlaczego ten zestaw testów nie jest w …

4
Jak uniknąć logarytmu (0) w regresji
Mam następujące proste wektory X i Y: > X [1] 1.000 0.063 0.031 0.012 0.005 0.000 > Y [1] 1.000 1.000 1.000 0.961 0.884 0.000 > > plot(X,Y) Chcę wykonać regresję za pomocą dziennika X. Aby uniknąć uzyskania dziennika (0), próbuję umieścić +1 lub +0.1 lub +0.00001 lub +0.000000000000001: > …


1
Wyznaczanie funkcji wiarygodności dla IV-probit
Mam więc model binarny, w którym y∗1y1∗y_1^* jest ukrytą nieobserwowaną zmienną, a y1∈{0,1}y1∈{0,1}y_1 \in \{0,1\} jest obserwowany. y2y2y_2 określa y1y1y_1 a z2z2z_2 jest zatem moim instrumentem. Krótko mówiąc, model jest. y∗1y2y1===δ1z1+α1y2+u1δ21z1+δ22z2+v2=zδ+v21[y∗>0]y1∗=δ1z1+α1y2+u1y2=δ21z1+δ22z2+v2=zδ+v2y1=1[y∗>0]\begin{eqnarray} y_1^*&=& \delta_1 z_1 + \alpha_1 y_2 + u_1 \\ y_2 &=& \delta_{21} z_1 + \delta_{22}z_2 + v_2 = \textbf{z}\delta …

1
Losowy las vs Adaboost
W części 7 artykułu Random Forests (Breiman, 1999) autor stwierdza następującą hipotezę: „Adaboost to las losowy”. Czy ktoś to udowodnił lub obalił? Co zrobiono, aby udowodnić lub obalić ten post po 1999 roku?


2
Co to jest wstępne szkolenie i jak wstępnie szkolić sieć neuronową?
Rozumiem, że szkolenie wstępne jest stosowane, aby uniknąć niektórych problemów z konwencjonalnym treningiem. Jeśli używam propagacji wstecznej z, powiedzmy autoencoderem, wiem, że napotkam problemy z czasem, ponieważ propagacja wsteczna jest powolna, a także że mogę utknąć w lokalnych optymach i nie nauczyć się niektórych funkcji. To, czego nie rozumiem, to …

1
Jak sprawdzić, czy „poprzedni stan” ma wpływ na „kolejny stan” w R.
Wyobraź sobie sytuację: mamy historyczne zapisy (20 lat) trzech kopalń. Czy obecność srebra zwiększa prawdopodobieństwo znalezienia złota w przyszłym roku? Jak przetestować takie pytanie? Oto przykładowe dane: mine_A <- c("silver","rock","gold","gold","gold","gold","gold", "rock","rock","rock","rock","silver","rock","rock", "rock","rock","rock","silver","rock","rock") mine_B <- c("rock","rock","rock","rock","silver","rock","rock", "silver","gold","gold","gold","gold","gold","rock", "silver","rock","rock","rock","rock","rock") mine_C <- c("rock","rock","silver","rock","rock","rock","rock", "rock","silver","rock","rock","rock","rock","silver", "gold","gold","gold","gold","gold","gold") time <- seq(from = 1, to = 20, …

4
Załóżmy, że
Jak sugerowano w tytule. Załóżmy że są ciągłymi i losowymi zmiennymi z pdf . Rozważmy zdarzenie, w którym , , a zatem oznacza, że ​​sekwencja zmniejsza się po raz pierwszy. Jaka jest zatem wartość ?X1,X2,…,XnX1,X2,…,XnX_1, X_2, \dotsc, X_nfffX1≤X2…≤XN−1>XNX1≤X2…≤XN−1>XNX_1 \leq X_2 \dotsc \leq X_{N-1} > X_NN≥2N≥2N \geq 2NNNE[N]E[N]E[N] Najpierw próbowałem ocenić …

1
Czy PCA jest nadal wykonywane przez składową macierz kowariancji, gdy wymiarowość jest większa niż liczba obserwacji?
Mam macierz , zawierającą moje próbek w przestrzeni wymiarowej . Chcę teraz zakodować własną analizę głównych składników (PCA) w Matlabie. I poniżać do pierwszy.20×10020×10020\times100N = 20 D = 100 X X 0XXXN=20N=20N=20D=100D=100D=100XXXX0X0X_0 Czytam z czyjegoś kodu, że w takich scenariuszach, w których mamy więcej wymiarów niż obserwacji, nie rozkładamy już …
10 pca 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.