Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
UMVUE z
Niech ( X1, X2), … , Xn)(X1,X2,…,Xn)(X_1,X_2,\ldots,X_n) będzie losową próbką z gęstości faθ( x ) = θ xθ - 110 < x < 1,θ > 0fθ(x)=θxθ−110<x<1,θ>0f_{\theta}(x)=\theta x^{\theta-1}\mathbf1_{00 Próbuję znaleźć UMVUE z θ1 + θθ1+θ\frac{\theta}{1+\theta} . Łączna gęstość ( X1, … , Xn)(X1,…,Xn)(X_1,\ldots,X_n) wynosi faθ( x1, ⋯ , xn)= θn( ∏i …

2
Uzasadnienia dla modelu efektów stałych a efektami losowymi w metaanalizie
Przeczytałem kilka publikacji próbujących uzasadnić zastosowanie modelu efektów stałych z oświadczeniami w stylu „wybrano model efektów stałych, ponieważ heterogeniczność była niska”. Obawiam się jednak, że nadal może to być niewłaściwe podejście do analizy danych. Czy istnieją powody lub publikacje, które dyskutują, czy i dlaczego może to być błąd?

6
Proste przykłady z prawdziwego świata do nauczania statystyki bayesowskiej?
Chciałbym znaleźć kilka „prawdziwych przykładów” do nauczania statystyki bayesowskiej. Statystyka bayesowska pozwala formalnie włączyć wcześniejszą wiedzę do analizy. Chciałbym podać uczniom proste przykłady badaczy z prawdziwego świata, którzy uwzględniają wcześniejszą wiedzę w swoich analizach, aby studenci mogli lepiej zrozumieć motywację, dla której można chcieć przede wszystkim wykorzystywać statystyki bayesowskie. Czy …

4
Dlaczego testy hipotez na ponownie próbkowanych zestawach danych zbyt często odrzucają wartość zerową?
tl; dr: Zaczynając od zestawu danych wygenerowanego pod wartością zerową, ponownie próbkowałem przypadki z zamianą i przeprowadzałem test hipotez na każdym zestawie danych ponownie próbkowanym. Te testy hipotez odrzucają zero w ponad 5% przypadków. W poniższej, bardzo prostej symulacji, generuję zestawy danych za pomocą X∼N(0,1)⨿Y∼N(0,1)X∼N(0,1)⨿Y∼N(0,1)X \sim N(0,1) \amalg Y \sim …

7
Czy czułość lub swoistość jest funkcją rozpowszechnienia?
Standardowe nauczanie mówi, że czułość i swoistość są właściwościami testu i są niezależne od rozpowszechnienia. Ale czy to nie tylko założenie? Zasady Harrisona dotyczące medycyny wewnętrznej, 19 edycja, mówią Od dawna twierdzono, że czułość i swoistość są parametrami dokładności testu niezależnymi od rozpowszechnienia, a wiele tekstów wciąż zawiera takie stwierdzenie. …

5
Jak zmierzyć dyspersję w danych dotyczących częstotliwości słów?
Jak mogę określić ilościowo dyspersję w wektorze liczby słów? Szukam statystyki, która będzie wysoka dla dokumentu A, ponieważ zawiera wiele różnych słów, które występują rzadko, i niska dla dokumentu B, ponieważ zawiera jedno słowo (lub kilka słów), które występują często. Mówiąc bardziej ogólnie, jak mierzyć dyspersję lub „rozpiętość” w danych …

2
Dokładne pobieranie próbek z niewłaściwych mieszanin
Załóżmy, że chcę próbkować z ciągłego rozkładu p ( x )p(x)p(x) . Jeśli mam wyrażenie ppp w formularzu p(x)=∑i=1∞aifi(x)p(x)=∑ja=1∞zajafaja(x)p(x) = \sum_{i=1}^\infty a_i f_i(x) ai⩾0,∑iai=1zaja⩾0,∑jazaja=1a_i \geqslant 0, \sum_i a_i= 1fifajaf_ippp Próbkowanie etykiety z prawdopodobieństwemijaiaizajaa_i PróbkowanieX∼fiX∼fajaX \sim f_i Czy można uogólnić tę procedurę, jeśli są czasami negatywne? Podejrzewam, że widziałem to gdzieś …

4
Jak losowo narysować wartość z oszacowania gęstości jądra?
Mam pewne spostrzeżenia i chcę naśladować próbkowanie na podstawie tych spostrzeżeń. Rozważam tutaj model nieparametryczny, w szczególności używam wygładzania jądra, aby oszacować CDF na podstawie ograniczonych obserwacji, a następnie losowo dobieram wartości z uzyskanego CDF. Oto mój kod (chodzi o to, aby losowo uzyskać kumulatywny prawdopodobieństwo za pomocą równomiernego rozkładu …

1
Kiedy nie używać weryfikacji krzyżowej?
Gdy czytam stronę, większość odpowiedzi sugeruje, że w algorytmach uczenia maszynowego należy przeprowadzić weryfikację krzyżową. Jednak czytając książkę „Zrozumienie uczenia maszynowego” zobaczyłem, że istnieje ćwiczenie, które czasami lepiej nie używać weryfikacji krzyżowej. Jestem bardzo zmieszany. Kiedy algorytm uczący dla całych danych jest lepszy niż walidacja krzyżowa? Czy zdarza się to …

1
LASSO zależność pomiędzy
Rozumiem, że regresja LASSO jest taka, że ​​współczynniki regresji są wybrane w celu rozwiązania problemu minimalizacji: minβ. Y- Xβ∥2)2) s . t . ∥ β∥1≤ tminβ‖y-Xβ‖2)2) s.t.‖β‖1≤t\min_\beta \|y - X \beta\|_2^2 \ \\s.t. \|\beta\|_1 \leq t W praktyce odbywa się to za pomocą mnożnika Lagrange'a, co powoduje problem do rozwiązania …

2
Jeśli suma prawdopodobieństw zdarzeń jest równa prawdopodobieństwu ich zjednoczenia, czy oznacza to, że zdarzenia są rozłączne?
Prawdopodobieństwo aksjomatyczne to funkcja która przypisuje liczbę rzeczywistą każdemu zdarzeniu jeżeli spełnia trzy podstawowe założenia (założenia Kołmogorowa):PPPP(A)P(A)P(A)AAA P(A)≥0 for everyAP(A)≥0 for everyAP(A) \geq 0 \ \text{for every} A P(Ω)=1P(Ω)=1P(\Omega) = 1 If A1,A2,⋯are disjoint, thenP(⋃∞i=1Ai)=∑i=1∞P(Ai)If A1,A2,⋯are disjoint, thenP(⋃i=1∞Ai)=∑i=1∞P(Ai)\text{If} \ A_1, A_2, \cdots \text{are disjoint, then}\\ P\left(\bigcup_{i=1}^{\infty}A_i\right) = \sum\limits_{i=1}^{\infty}P(A_i) Moje pytanie …

3
Czy założenie liniowości w regresji liniowej jest jedynie definicją
Przeglądam regresję liniową. Podręcznik Greene'a stanowi: Teraz oczywiście będą inne założenia dotyczące modelu regresji liniowej, takie jak . To założenie w połączeniu z założeniem liniowości (które w rzeczywistości definiuje ), nakłada strukturę na model.E(ϵ|X)=0E(ϵ|X)=0E(\epsilon|X)=0ϵϵ\epsilon Jednak założenie liniowości sama nie stawia żadnej struktury w naszym modelu, ponieważ może być zupełnie dowolna. …

2
Dlaczego estymator jest uważany za zmienną losową?
Rozumiem, czym jest estymator i oszacowanie: Estimator: Reguła obliczania oszacowania Estymacja: Wartość obliczona na podstawie zestawu danych opartych na estymatorze Pomiędzy tymi dwoma terminami, jeśli poproszę o wskazanie zmiennej losowej, powiedziałbym, że oszacowanie jest zmienną losową, ponieważ jej wartość zmienia się losowo na podstawie próbek w zbiorze danych. Odpowiedziałem jednak, …


1
Czy twierdzenie o względnym kontraście z Beyer i in. artykuł: „O zaskakującym zachowaniu wskaźników odległości w przestrzeni wielowymiarowej” wprowadzający w błąd?
Jest to często cytowane, gdy wspomina się o przekleństwie wymiarowości i odchodzi (formuła z prawej strony zwana kontrastem względnym) limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxkd−DminkdDminkd→0limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxdk−DmindkDmindk→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 Wynik twierdzenia pokazuje, że różnica między maksymalnymi i minimalnymi odległościami do danego punktu zapytania nie rośnie tak …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.