Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Ślepe oddzielenie wypukłej mieszanki?
Załóżmy, że mam niezależnych źródeł, i obserwuję wypukłych mieszanin: \ begin {align} Y_1 & = a_ {11} X_1 + a_ {12} X_2 + \ cdots + a_ {1n} X_n \\ ... & \\ Y_m & = a_ {m1} X_1 + a_ {m2} X_2 + \ cdots + a_ {mn} X_n …
18 pca  ica 

2
Dlaczego
Sekwencja estymatorów UnUnU_n dla parametru θθ\theta jest asymptotycznie normalny czy n−−√(Un−θ)→N(0,v)n(Un−θ)→N(0,v)\sqrt{n}(U_n - \theta) \to N(0,v). (źródło) Następnie nazywamyvvvasymptotyczną wariancjąUnUnU_n. Jeśli ta wariancja jest równawiązaniu Cramer-Rao, mówimy, że estymator / sekwencja jest asymptotycznie skuteczna. Pytanie: Dlaczego używamy n−−√n\sqrt{n} zwłaszcza? Wiem, że dla próbki średniej ten wybór normalizuje go. Ale ponieważ powyższe …

5
Wykrywanie zmian w szeregach czasowych (przykład R)
Chciałbym wykryć zmiany w danych szeregów czasowych, które zwykle mają ten sam kształt. Do tej pory pracowałem z changepointpakietem dla R cpt.mean(), cpt.var()oraz cpt.meanvar()funkcji i . cpt.mean()z metodą PELT działa dobrze, gdy dane zwykle pozostają na jednym poziomie. Chciałbym jednak również wykryć zmiany podczas zjazdów. Przykładem zmiany, którą chciałbym wykryć, …

1
Użycie bootstrapu pod H0 do wykonania testu dla różnicy dwóch środków: zastąpienia w grupach lub w próbce zbiorczej
Załóżmy, że mam dane z dwoma niezależnymi grupami: g1.lengths <- c (112.64, 97.10, 84.18, 106.96, 98.42, 101.66) g2.lengths <- c (84.44, 82.10, 83.26, 81.02, 81.86, 86.80, 85.84, 97.08, 79.64, 83.32, 91.04, 85.92, 73.52, 85.58, 97.70, 89.72, 88.92, 103.72, 105.02, 99.48, 89.50, 81.74) group = rep (c ("g1", "g2"), c (length …


3
Czy techniki optymalizacji odwzorowują techniki próbkowania?
Z dowolnego ogólnego algorytmu próbkowania można wywnioskować algorytm optymalizacji. Rzeczywiście, aby zmaksymalizować dowolną funkcję , wystarczy pobrać próbki z . Dla wystarczająco małego próbki te spadną w pobliżu globalnego maksimum (lub lokalnych maksimów w praktyce) funkcji .g ∼ e f / T T ffa: x → f( x )fa:x→fa(x)f: \textbf{x} …

1
Wybór między funkcjami strat dla klasyfikacji binarnej
Pracuję w dziedzinie problemów, w której ludzie często zgłaszają ROC-AUC lub AveP (średnia precyzja). Jednak ostatnio znalazłem artykuły, które zamiast tego optymalizują straty logów , podczas gdy jeszcze inni zgłaszają utratę zawiasów . Rozumiem, w jaki sposób obliczane są te wskaźniki, ale trudno mi zrozumieć kompromisy między nimi i co …

3
Asymptotyczna spójność z niezerową wariancją asymptotyczną - co ona reprezentuje?
Problem pojawił się wcześniej, ale chcę zadać konkretne pytanie, które będzie próbowało uzyskać odpowiedź, która wyjaśni (i sklasyfikuje): W „Asymptotics Poor Man” zachowuje się wyraźne rozróżnienie (a) sekwencja zmiennych losowych, która zbiega się w prawdopodobieństwie do stałej w przeciwieństwie do (b) sekwencja zmiennych losowych, która jest zbieżna w prawdopodobieństwie ze …


2
Interpretacja beta, gdy istnieje wiele zmiennych kategorialnych
Rozumiem pojęcie, że jest średnią, gdy zmienna kategorialna jest równa 0 (lub jest grupą odniesienia), co daje końcową interpretację, że współczynnik regresji jest różnicą średniej z dwóch kategorii. Zakładam, że nawet przy> 2 kategoriach każda wyjaśnia różnicę między średnią tej kategorii a odniesieniem.β^0β^0\hat\beta_0β^β^\hat\beta Ale co jeśli więcej zmiennych zostanie wprowadzonych …

3
Dlaczego statystyki bayesowskie nie są bardziej popularne w statystycznej kontroli procesów?
Rozumiem debatę bayesowską kontra częstokroćową, że statystyki częstokrzyskie: jest (lub twierdzi, że jest) obiektywny lub przynajmniej bezstronny tak więc różni badacze, stosując różne założenia, mogą nadal uzyskać porównywalne ilościowo wyniki podczas gdy statystyki bayesowskie twierdzi, że dokonuje „lepszych” prognoz (tj. niższych oczekiwanych strat), ponieważ może wykorzystać wcześniejszą wiedzę (między innymi) …

3
Negatywno-dwumianowy GLM vs. transformacja logów dla danych zliczania: zwiększony poziom błędu typu I.
Niektórzy z was mogli przeczytać ten miły artykuł: O'Hara RB, Kotze DJ (2010) Nie log-transform danych zliczania. Metody w ekologii i ewolucji 1: 118–122. klick . W mojej dziedzinie badań (ekotoksykologia) mamy do czynienia ze słabo powielonymi eksperymentami, a GLM nie są szeroko stosowane. Zrobiłem więc podobną symulację jak O'Hara …

3
Czy błędem jest określanie wyników jako „bardzo znaczących”?
Dlaczego statystycy zniechęcają nas do określania wyników jako „ bardzo znaczących”, gdy wartość jest znacznie poniżej konwencjonalnego poziomu α wynoszącego 0,05 ?pppαα\alpha0.050,050.05 Czy naprawdę źle jest ufać wynikowi, który ma 99,9% szansy na to, że nie jest błędem typu I ( ) więcej niż wynik, który daje tę szansę tylko …

4
Jaka jest intuicja stojąca za niezależnością
Miałem nadzieję, że ktoś może zaproponować argument wyjaśniający, dlaczego zmienne losowe Y1=X2−X1Y1=X2−X1Y_1=X_2-X_1 i Y2=X1+X2Y2=X1+X2Y_2=X_1+X_2 , o standardowym rozkładzie normalnym, są statystycznie niezależne. Dowód tego faktu łatwo wywodzi się z techniki MGF, ale uważam ją za wyjątkowo sprzeczną z intuicją.XiXiX_i Byłbym wdzięczny za intuicję tutaj, jeśli w ogóle. Z góry dziękuję. …

1
Jak wybielić dane za pomocą analizy głównych składników?
Chcę przekształcić moje dane tak, aby wariancje były równe jeden, a kowariancje były równe zero (tzn. Chcę wybielić dane). Ponadto średnie powinny wynosić zero.XX\mathbf X Wiem, że się tam dostanę, wykonując standaryzację Z i transformację PCA, ale w jakiej kolejności mam to zrobić? Powinienem dodać, że skomponowana transformacja wybielająca powinna …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.