Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Ile przykładów treningów jest za mało podczas szkolenia sieci neuronowej?
Jestem początkującym, który próbuje stworzyć swój pierwszy projekt. Miałem na myśli projekt klasyfikacji piosenek, ale ponieważ będę ręcznie etykietować, mogłem tylko rozsądnie zebrać około 1000 piosenek lub 60 godzin muzyki. Klasyfikowałbym się z kilkoma klasami, więc możliwe, że jedna klasa miałaby zaledwie 50-100 piosenek w zestawie treningowym - wydaje się, …

1
Czy współczynnik korelacji próby jest obiektywnym estymatorem współczynnika korelacji populacji?
Czy to prawda, że RX,YRX,YR_{X,Y} jest obiektywnym estymatorem dla ρX,YρX,Y\rho_{X,Y} ? Czyli E[RX,Y]=ρX,Y?E[RX,Y]=ρX,Y?\mathbf{E}\left[R_{X,Y}\right]=\rho_{X,Y}? Jeśli nie, jaki jest obiektywny estymator dla ? (Być może używany jest standardowy estymator bezstronny? Ponadto, czy jest on analogiczny do wariancji bezstronnej próby, gdzie po prostu dokonujemy prostej korekty pomnożenia wariancji próbnej stronniczości przez nρX,YρX,Y\rho_{X,Y} ?)nn−1nn−1\frac{n}{n-1} …

2
Czy potrafisz wyjaśnić paradoks Simpsona równaniami zamiast tabel awaryjnych?
Prawdopodobnie nie rozumiem paradoksu Simpsona . Nieformalnie wiem, że średnia odpowiedzi Y1, zgrupowana na wszystkich możliwych poziomach czynnika A, może być wyższa niż średnia odpowiedzi Y2 na wszystkich poziomach A, nawet jeśli średnia Y1 dla każdego poziomu A (każdej grupy) wynosi zawsze mniej niż odpowiadająca średnia Y2. Czytałem przykłady, ale …

1
Na przykład korelacja ważona?
Mam kilka interesujących danych na temat najpopularniejszych artystów muzycznych przesyłanych strumieniowo, podzielonych według lokalizacji na około 200 dzielnic kongresowych. Chcę sprawdzić, czy można sondować osobę o jej preferencjach muzycznych i ustalić, czy ona „słucha jak demokrata” czy „słucha jak republikanin”. (Oczywiście jest to beztroskie, ale dane zawierają prawdziwą entropię!) Mam …

2
Hamiltonian Monte Carlo
Czy ktoś może wyjaśnić główną ideę metod Hamiltona Monte Carlo iw jakich przypadkach przyniesie lepsze wyniki niż metody Monte Carlo Markowa w łańcuchu?
14 bayesian  mcmc  hmc 

1
Jeffreys przed wieloma parametrami
W niektórych przypadkach wcześniejszy Jeffreys dla pełnego modelu wielowymiarowego jest ogólnie uważany za nieodpowiedni, tak jest na przykład w przypadku: (gdzie , przy nieznanych i ), gdzie preferowany jest następujący przeor (do pełnego Jeffreys ): gdzie to wcześniejszy Jeffreys uzyskany przy zachowaniu stałej \ sigma (i podobnie dla p ( …

2
Testy wydajności dla MCMC
Czy przeprowadzono badania na dużą skalę metod MCMC, które porównują wydajność kilku różnych algorytmów w zestawie gęstości testowych? Mam na myśli coś równoważnego z tekstem Riosa i Sahinidisa (2013), który jest dokładnym porównaniem dużej liczby optymalizatorów czarnej skrzynki bez pochodnych na kilku klasach funkcji testowych. W przypadku MCMC wydajność można …

4
Dlaczego
Uwaga: = suma kwadratów ogółem, = suma kwadratów błędów, a = regresja suma kwadratów. Równanie w tytule jest często zapisywane jako:SSTSSTSSTSSESSESSESSRSSRSSR ∑i=1n(yi−y¯)2=∑i=1n(yi−y^i)2+∑i=1n(y^i−y¯)2∑i=1n(yi−y¯)2=∑i=1n(yi−y^i)2+∑i=1n(y^i−y¯)2\sum_{i=1}^n (y_i-\bar y)^2=\sum_{i=1}^n (y_i-\hat y_i)^2+\sum_{i=1}^n (\hat y_i-\bar y)^2 Dość proste pytanie, ale szukam intuicyjnego wyjaśnienia. Intuicyjnie wydaje mi się, że miałoby większy sens. Załóżmy na przykład, że punkt ma …

1
Ograniczone maksymalne prawdopodobieństwo z mniej niż pełną pozycją kolumny
To pytanie dotyczy oszacowania ograniczonego maksymalnego prawdopodobieństwa (REML) w określonej wersji modelu liniowego, a mianowicie: Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)),Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)), Y = X(\alpha)\beta + \epsilon, \\ \epsilon\sim N_n(0, \Sigma(\alpha)), gdzie X(α)X(α)X(\alpha) jest macierzą ( n×pn×pn \times p ) sparametryzowaną przez α∈Rkα∈Rk\alpha \in \mathbb R^k , podobnie jak Σ(α)Σ(α)\Sigma(\alpha) . ββ\beta jest nieznanym wektorem parametrów …

2
Co to jest minimalizacja zużycia energii w uczeniu maszynowym?
Czytałem o optymalizacji pod kątem źle postawionego problemu w widzeniu komputerowym i natrafiłem na poniższe wyjaśnienie dotyczące optymalizacji na Wikipedii. Nie rozumiem tylko, dlaczego nazywają tę optymalizację „ minimalizacją energii ” w Computer Vision? Problem optymalizacji można przedstawić w następujący sposób: Biorąc pod uwagę: funkcję z jakiegoś zbioru A do …

2
Jak wygładzić dane i wymusić monotoniczność
Mam pewne dane, które chciałbym wygładzić, aby wygładzone punkty monotonicznie zmniejszały się. Moje dane gwałtownie spadają, a następnie zaczynają się wyrównywać. Oto przykład z użyciem R. df <- data.frame(x=1:10, y=c(100,41,22,10,6,7,2,1,3,1)) ggplot(df, aes(x=x, y=y))+geom_line() Jakiej dobrej techniki wygładzania mógłbym użyć? Byłoby również miło, gdybym mógł zmusić pierwszy wygładzony punkt do zbliżenia …

1
Czy musisz przestrzegać zasady prawdopodobieństwa bycia Bayesianem?
Powstaje pytanie: kiedy (jeśli w ogóle) podejście częstokroć jest znacznie lepsze niż bayesowskie? Jak napisałem w moim rozwiązaniu tego pytania, moim zdaniem, jeśli jesteś częstym gościem, nie musisz wierzyć / stosować się do zasady prawdopodobieństwa, ponieważ często metody stosowane przez osoby często odwiedzające ją naruszają. Jednak i to zazwyczaj przy …

2
Regresja do średniej w „Myśleniu, szybko i powoli”
W Thinking, Fast and Slow , Daniel Kahneman stawia następujące pytanie hipotetyczne: (Str. 186) Julie jest obecnie starszą uczelnią państwową. Płynnie czytała, gdy miała cztery lata. Jaka jest jej średnia ocen (GPA)? Jego intencją jest zilustrowanie tego, jak często nie uwzględniamy regresji do średniej podczas prognozowania niektórych statystyk. W dalszej …

3
Dla intuicji, jakie są przykłady rzeczywistych nieskorelowanych, ale zależnych zmiennych losowych?
Wyjaśniając, dlaczego nieskorelowane nie oznacza niezależności, istnieje kilka przykładów, które dotyczą szeregu zmiennych losowych, ale wszystkie wydają się tak abstrakcyjne: 1 2 3 4 . Ta odpowiedź wydaje się mieć sens. Moja interpretacja: Zmienna losowa i jej kwadrat mogą być nieskorelowane (ponieważ pozornie brak korelacji jest czymś w rodzaju niezależności …

3
Odnośniki uzasadniające użycie mieszanek gaussowskich
Modele mieszanin gaussowskich (GMM) są atrakcyjne, ponieważ są łatwe do pracy zarówno w analityce, jak i w praktyce, i są w stanie modelować niektóre egzotyczne rozkłady bez zbytniej złożoności. Istnieje kilka właściwości analitycznych, których należy się spodziewać, które nie są ogólnie jasne. W szczególności: SnSnS_nnnnPPPnnnPPPlimn→∞infP^∈SnD(P||P^)=0?limn→∞infP^∈SnD(P||P^)=0?\lim_{n\rightarrow \infty}\inf_{\hat{P}\in S_n} D(P||\hat{P})=0? Powiedzmy, że …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.