Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Porównanie dwóch modeli, gdy krzywe ROC krzyżują się
Jednym z powszechnych mierników używanych do porównywania dwóch lub więcej modeli klasyfikacji jest wykorzystanie obszaru pod krzywą ROC (AUC) jako sposób na pośrednią ocenę ich wydajności. W takim przypadku model z większym AUC jest zwykle interpretowany jako działający lepiej niż model z mniejszym AUC. Ale według Vihinen, 2012 ( https://www.ncbi.nlm.nih.gov/pmc/articles/PMC3303716/ …

2
Problem z estymacją parametrów
Niech i będą czterema zmiennymi losowymi, takimi jak , gdzie są nieznanymi parametrami. Załóżmy również, że ,Więc który z nich jest prawdziwy?Y1,Y2,Y3Y1,Y2,Y3Y_1,Y_2,Y_3Y4Y4Y_4E(Y1)=θ1−θ3; E(Y2)=θ1+θ2−θ3; E(Y3)=θ1−θ3; E(Y4)=θ1−θ2−θ3E(Y1)=θ1−θ3; E(Y2)=θ1+θ2−θ3; E(Y3)=θ1−θ3; E(Y4)=θ1−θ2−θ3E(Y_1)=\theta_1-\theta_3;\space\space E(Y_2)=\theta_1+\theta_2-\theta_3;\space\space E(Y_3)=\theta_1-\theta_3;\space\space E(Y_4)=\theta_1-\theta_2-\theta_3θ1,θ2,θ3θ1,θ2,θ3\theta_1,\theta_2,\theta_3Var(Yi)=σ2Var(Yi)=σ2Var(Y_i)=\sigma^2i=1,2,3,4.i=1,2,3,4.i=1,2,3,4. A. są możliwe do .θ1,θ2,θ3θ1,θ2,θ3\theta_1,\theta_2,\theta_3 B. jest .θ1+θ3θ1+θ3\theta_1+\theta_3 C. jest a jest najlepszym liniowym obiektywnym oszacowaniem .θ1−θ3θ1−θ3\theta_1-\theta_312(Y1+Y3)12(Y1+Y3)\dfrac{1}{2}(Y_1+Y_3)θ1−θ3θ1−θ3\theta_1-\theta_3 D. jest …

2
Czy mogę użyć CLR (transformacja wyśrodkowanego współczynnika log) do przygotowania danych na PCA?
Używam skryptu. To jest dla podstawowych zapisów. Mam ramkę danych, która pokazuje różne kompozycje elementarne w kolumnach na danej głębokości (w pierwszej kolumnie). Chcę z nim wykonać PCA i jestem zdezorientowany co do metody standaryzacji, którą muszę wybrać. Czy ktoś z was wykorzystał te dane clr()do przygotowania danych prcomp()? Czy …

2
Dlaczego naukowcy z ekonomii używają regresji liniowej do zmiennych binarnych?
Ostatnio musiałem przeczytać kilka artykułów z ekonomii (dziedzina, której nie znam zbyt dobrze). Zauważyłem jedną rzecz, że nawet gdy zmienna odpowiedzi jest binarna, modele regresji liniowej dopasowane za pomocą OLS są wszechobecne. Moje pytanie brzmi zatem: Dlaczego preferuje się regresję liniową, na przykład regresję logistyczną w dziedzinie ekonomii? Czy jest …

1
Równoważność specyfikacji losowego efektu (0 + czynnik | grupa) i (1 | grupa) + (1 | grupa: czynnik) w przypadku symetrii złożonej
Douglas Bates twierdzi, że następujące modele są równoważne „jeśli macierz wariancji-kowariancji dla efektów losowych o wartościach wektorowych ma specjalną formę, zwaną symetrią złożoną” ( slajd 91 w tej prezentacji ): m1 <- lmer(y ~ factor + (0 + factor|group), data) m2 <- lmer(y ~ factor + (1|group) + (1|group:factor), data) …

1
Dlaczego ln [E (x)]> E [ln (x)]?
Zajmujemy się logarytmiczną dystrybucją na kursie finansowym, a mój podręcznik po prostu stwierdza, że ​​to prawda, co wydaje mi się frustrujące, ponieważ moje matematyczne doświadczenie nie jest zbyt silne, ale chcę intuicji. Czy ktoś może mi pokazać, dlaczego tak jest?

3
Co się stało ze znaczeniem statystycznym w regresji, gdy rozmiar danych jest gigantyczny?
Czytałem to pytanie dotyczące regresji na dużą skalę ( link ), gdzie whuber wskazał interesujący punkt w następujący sposób: „Prawie każdy test statystyczny, który przeprowadzisz, będzie tak potężny, że prawie na pewno zidentyfikujesz„ znaczący ”efekt. Musisz skupić się bardziej na znaczeniu statystycznym, takim jak wielkość efektu, a nie na znaczeniu”. …


1
Używanie iloc do ustawiania wartości [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Ta linia zwraca pierwsze 4 wiersze w ramce danych combineddlafeature_a combined.iloc[0:4]["feature_a"] Zgodnie z oczekiwaniami ten następny wiersz zwraca 2., 4. i …
13 python  pandas 

2
Optymalizacja i uczenie maszynowe
Chciałem wiedzieć, ile uczenia maszynowego wymaga optymalizacji. Z tego, co słyszałem, statystyki są ważnym tematem matematycznym dla osób pracujących z uczeniem maszynowym. Podobnie, jak ważne jest, aby ktoś pracujący z uczeniem maszynowym uczył się optymalizacji wypukłej lub niewypukłej?

8
Ankiety: Czy 25% reprezentuje dużą bazę użytkowników?
Mój pracodawca prowadzi obecnie ankietę dla całej firmy na temat stosunku do biura, tj. Sentymentu. W przeszłości otworzyli ankietę dla wszystkich obszarów działalności (Załóżmy 10 bardzo różnych działów) i wszystkich pracowników w nich zatrudnionych (Załóżmy łącznie 1000 pracowników w całej firmie) Liczba pracowników w każdym dziale nie jest równa i …

2
Nie rozumiem wariancji dwumianu
Czuję się naprawdę głupio, nawet zadając tak podstawowe pytanie, ale oto: Jeśli mam losową zmienną która może przyjmować wartości i , przy czym oraz , to jeśli wyciągnę z niej próbek, otrzymam rozkład dwumianowy.0 1 P ( X = 1 ) = p P ( X = 0 ) = …

1
Jeśli
Natrafiłem na dowód na jedną z właściwości modelu ARCH, który mówi, że jeśli , to jest stacjonarny iff gdzie model ARCH to:{ X t } ∑ p i = 1 b i &lt; 1E(X2t)&lt;∞E(Xt2)&lt;∞\mathbb{E}(X_t^2) < \infty{Xt}{Xt}\{X_t\}∑pi=1bi&lt;1∑i=1pbi&lt;1\sum_{i=1}^pb_i < 1 Xt=σtϵtXt=σtϵtX_t = \sigma_t\epsilon_t σ2t=b0+b1X2t−1+...bpX2t−pσt2=b0+b1Xt−12+...bpXt−p2\sigma_t^2 = b_0 + b_1X_{t-1}^2 + ... b_pX_{t-p}^2 Główną …

3
Skąd dystrybucja beta?
Jak jestem pewien, wszyscy już tu wiedzą, plik PDF dystrybucji Beta X∼B(a,b)X∼B(a,b)X \sim B(a,b) jest podany przez f(x)=1B(a,b)xa−1(1−x)b−1f(x)=1B(a,b)xa−1(1−x)b−1f(x) = \frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1} Wszędzie szukałem wyjaśnień na temat pochodzenia tej formuły, ale nie mogę jej znaleźć. Każdy artykuł, który znalazłem w dystrybucji Beta, wydaje się podawać tę formułę, ilustrować kilka jej kształtów, a …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.