Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jakie są zalety korzystania z bayesowskiej sieci neuronowej
Ostatnio przeczytałem kilka artykułów na temat bayesowskiej sieci neuronowej (BNN) [Neal, 1992] , [Neal, 2012] , która podaje zależność prawdopodobieństwa między wejściem a wyjściem w sieci neuronowej. Trenowanie takiej sieci neuronowej odbywa się za pośrednictwem MCMC, która różni się od tradycyjnego algorytmu propagacji wstecznej. Moje pytanie brzmi: Jaka jest zaleta …

3
dlaczego metoda wzmocnienia jest wrażliwa na wartości odstające
Znalazłem wiele artykułów, w których stwierdzono, że metody ulepszania są wrażliwe na wartości odstające, ale żaden artykuł nie wyjaśnia, dlaczego. Z mojego doświadczenia wynika, że ​​wartości odstające są złe dla dowolnego algorytmu uczenia maszynowego, ale dlaczego metody wspomagające są wyróżniane jako szczególnie wrażliwe? Jak uszeregować następujące algorytmy pod względem wrażliwości …

1
Jak nazywa się metoda szacowania gęstości, w której wszystkie możliwe pary są używane do utworzenia rozkładu normalnej mieszaniny?
Właśnie pomyślałem o zgrabnym (niekoniecznie dobrym) sposobie tworzenia szacunków gęstości jednowymiarowej i moje pytanie brzmi: Czy ta metoda szacowania gęstości ma nazwę? Jeśli nie, to czy jest to szczególny przypadek innej metody w literaturze? Oto metoda: mamy wektor który, jak zakładamy, pochodzi z nieznanego rozkładu, który chcielibyśmy oszacować. Sposobem na …

1
ANOVA: testowanie założenia normalności dla wielu grup z niewielką liczbą próbek na grupę
Załóżmy następującą sytuację: mamy dużą liczbę (np. 20) z małą wielkością grupy (np. n = 3). Zauważyłem, że jeśli wygeneruję wartości z rozkładu jednorodnego, reszty będą wyglądać w przybliżeniu normalnie, mimo że rozkład błędu jest jednolity. Poniższy kod R demonstruje to zachowanie: n.group = 200 n.per.group = 3 x <- …

3
Ilościowe podobieństwo między dwoma zestawami danych
Podsumowanie : Próba znalezienia najlepszej metody podsumowuje podobieństwo między dwoma wyrównanymi zestawami danych za pomocą jednej wartości. Szczegóły : Moje pytanie najlepiej wyjaśnić za pomocą diagramu. Poniższe wykresy pokazują dwa różne zestawy danych, każdy z wartościami oznaczonymi nfi nr. Punkty wzdłuż osi x reprezentują miejsce wykonania pomiarów, a wartości na …

2
Czy przedział ufności faktycznie stanowi miarę niepewności oszacowania parametru?
Czytałem post na blogu autorstwa statystyka Williama Briggsa, a poniższe stwierdzenie zainteresowało mnie co najmniej. co o tym myślisz? Co to jest przedział ufności? Jest to oczywiście równanie, które zapewni przedział czasowy dla danych. Ma on na celu zapewnienie miary niepewności oszacowania parametru. Teraz, ściśle według teorii częstokroć - którą …

2
Jak obliczyć wagi kryterium Fishera?
Studiuję rozpoznawanie wzorców i uczenie maszynowe i natrafiłem na następujące pytanie. Rozważ problem z klasyfikacją dwóch klas z jednakowym prawdopodobieństwem wcześniejszej klasyP(D1)=P(D2)=12P(D1)=P(D2)=12P(D_1)=P(D_2)= \frac{1}{2} oraz rozkład instancji w każdej klasie podany przez p(x|D1)=N([00],[2001]),p(x|D1)=N([00],[2001]), p(x|D_1)= {\cal N} \left( \begin{bmatrix} 0 \\0 \end{bmatrix}, \begin{bmatrix} 2 & 0 \\ 0 & 1 \end{bmatrix} \right), …

2
Kiedy MCMC jest przydatne?
Mam problem ze zrozumieniem, w której sytuacji podejście MCMC jest rzeczywiście przydatne. Przechodzę przez zabawkowy przykład z książki Kruschke „Doing Bayesian Data Analysis: A Tutorial with R and BUGS”. Do tej pory rozumiałem, że potrzebujemy rozkładu docelowego, który jest proporcjonalny do p(D|θ)p(θ)p(D|θ)p(θ)p(D|\theta)p(\theta) , aby otrzymać próbkę P(θ|D)P(θ|D)P(\theta|D) . Wydaje mi …
12 mcmc 

2
Ridge ukarał GLM za pomocą powiększania rzędów?
Czytałem, że regresję grzbietu można osiągnąć, po prostu dodając wiersze danych do oryginalnej macierzy danych, gdzie każdy wiersz jest konstruowany przy użyciu 0 dla zmiennych zależnych i pierwiastka kwadratowego kkk lub zero dla zmiennych niezależnych. Następnie dodaje się jeden dodatkowy wiersz dla każdej niezależnej zmiennej. Zastanawiałem się, czy można uzyskać …

3
Odnośnie zbieżności prawdopodobieństwa
Niech będzie sekwencją losowych zmiennych st prawdopodobieństwa, gdzie jest stałą stałą. Próbuję wyświetlić następujące elementy: i oba z prawdopodobieństwem. Jestem tutaj, aby sprawdzić, czy moja logika była dobra. Oto moja praca{Xn}n≥1{Xn}n≥1\{X_n\}_{n\geq 1}Xn→aXn→aX_n \to aa&gt;0a&gt;0a>0Xn−−−√→a−−√Xn→a\sqrt{X_n} \to \sqrt{a}aXn→1aXn→1\frac{a}{X_n}\to 1 PRÓBA W pierwszej części mamy Zauważ, że Wynika z tego, że |Xn−−−√−a−−√|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn−−−√+a−−√|=ϵ|(Xn−−−√−sqrta)+2a−−√||Xn−a|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn+a|=ϵ|(Xn−sqrta)+2a||\sqrt{X_n}-\sqrt{a}|<\epsilon \impliedby …

1
Czy są jakieś współczesne zastosowania jackknifing?
Pytanie: Bootstrapping jest lepszy od jackknifing; Zastanawiam się jednak, czy istnieją przypadki, w których podnoszenie jest jedyną lub przynajmniej realną opcją charakteryzowania niepewności na podstawie oszacowań parametrów. Ponadto w sytuacjach praktycznych, w jaki sposób stronniczy / niedokładny jest walenie w nogę w stosunku do ładowania początkowego, i czy wyniki noża …


3
Dlaczego metoda Holdout (dzielenie danych na szkolenia i testy) nie jest stosowana w statystyce klasycznej?
W mojej klasie podczas eksploracji danych wprowadzono metodę wstrzymania jako sposób oceny wydajności modelu. Kiedy jednak wziąłem pierwszą klasę modeli liniowych, nie zostało to wprowadzone jako metoda walidacji lub oceny modelu. Moje badania online również nie wykazały żadnego skrzyżowania. Dlaczego metoda Holdout nie jest stosowana w statystyce klasycznej?


1
średnie k || alias Scalable K-Means ++
Bahman Bahmani i in. wprowadzono k-średnich ||, która jest szybszą wersją k-średnich ++. Algorytm ten pochodzi ze strony 4 ich pracy , Bahmani, B., Moseley, B., Vattani, A., Kumar, R., i Vassilvitskii, S. (2012). Skalowalne k-średnie ++. Postępowanie z VLDB Endowment , 5 (7), 622-633. Niestety nie rozumiem tych wymyślnych …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.