Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Dlaczego
Na tej stronie głównej AP Zmienne losowe a zmienne algebraiczne autor Peter Flanagan-Hyde rozróżnia zmienne algebraiczne i losowe. Po części mówi , ale X + X ≠ 2 Xx + x = 2 xx+x=2xx + x = 2xX+ X≠ 2 XX+X≠2XX + X \neq 2X - w rzeczywistości jest to …

3
Robiąc MCMC: użyj jags / stan lub sam go zaimplementuj
Jestem nowy w badaniach Bayesian Statistics. Słyszałem od badaczy, że badacze bayesowscy lepiej wdrażają MCMC samodzielnie, niż używając narzędzi takich jak JAGS / Stan. Czy mogę zapytać, jaka jest korzyść z samodzielnego wdrażania algorytmu MCMC (w „niezbyt szybkich” językach, takich jak R), z wyjątkiem celu uczenia się?
13 bayesian  mcmc 


3
Dlaczego istnieją duże współczynniki dla wielomianu wyższego rzędu
W książce Bishopa o uczeniu maszynowym omawia problem dopasowania krzywej funkcji wielomianu do zestawu punktów danych. Niech M będzie rzędem dopasowanego wielomianu. Tak to stwierdza Widzimy, że wraz ze wzrostem M wielkość współczynników zwykle rośnie. W szczególności dla wielomianu M = 9 współczynniki zostały precyzyjnie dostrojone do danych poprzez opracowanie …

2
Jaka jest korzyść z obciętego rozkładu normalnego przy inicjowaniu ciężarów w sieci neuronowej?
Podczas inicjowania wag połączeń w sieci neuronowej ze sprzężeniem zwrotnym ważne jest, aby inicjować je losowo, aby uniknąć symetrii, których algorytm uczenia się nie byłby w stanie złamać. Zalecenie, które widziałem w różnych miejscach (np. W samouczku MNIST firmy TensorFlow ), to stosowanie skróconego rozkładu normalnego przy użyciu standardowego odchylenia …

5
Jakie obszary statystyki matematycznej są wysoce przydatne?
Zaraz kończę moje wyróżnienia w statystyce i naprawdę chcę zrobić doktorat, ponieważ uważam, że statystyki matematyczne są niezwykle interesujące. Obszary badań, w których najbardziej chcę zrobić doktorat, to procesy stochastyczne i szeregi czasowe. Jednak po doktoracie chcę także kontynuować karierę w sektorze prywatnym. Zastanawiałem się, jakie obszary statystyki matematycznej są …

5
Dlaczego warto studiować regresję liniową?
Biorąc pod uwagę dwie zmienne losowe i \ eta , możemy obliczyć ich „współczynnik korelacji” c i utworzyć linię najlepszego dopasowania między tymi dwiema zmiennymi losowymi. Moje pytanie brzmi: dlaczego?η cξξ\xiηη\etadocc 1) Istnieją zmienne losowe, ξξ\xi i ηη\eta które są zależne w najgorszy możliwy sposób, tj. ξ= f( η)ξ=f(η)\xi = …
13 regression 


1
Czy częste wnioskowanie warunkowe nadal jest stosowane w praktyce?
Niedawno przejrzałem kilka starych artykułów Nancy Reid, Barndorff-Nielsen, Richarda Coxa i, tak, małego Ronalda Fishera, na temat koncepcji „wnioskowania warunkowego” w paradygmacie częstokroć, co wydaje się oznaczać, że wnioski są oparte tylko na „odpowiedni podzbiór” przestrzeni próbki, a nie całej przestrzeni próbki. Jako kluczowy przykład wiadomo, że przedziały ufności oparte …

1
Obliczenia Steve'a Hsu dotyczące geniuszy w Chinach
Na swoim blogu fizyk Steve Hsu napisał: Zakładając normalny rozkład, w USA jest tylko około 10 000 osób, które osiągają wyniki +4SD i podobną liczbę w Europie, więc jest to dość wybrana populacja (w przybliżeniu, kilkaset najlepszych seniorów szkół średnich każdego roku w USA). Jeśli ekstrapolujesz liczby mieszkańców Azji Północnej …

1
Jakie są przydatne techniki powiększania danych dla głęboko splotowych sieci neuronowych?
Tło: Niedawno zrozumiałem na głębszym poziomie znaczenie powiększania danych podczas szkolenia splotowych sieci neuronowych po tym znakomitym przemówieniu Geoffreya Hintona . Wyjaśnia, że ​​splotowe sieci neuronowe obecnej generacji nie są w stanie uogólnić układu odniesienia badanego obiektu, co utrudnia sieci zrozumienie, że lustrzane obrazy obiektu są takie same. Niektóre badania …

1
Dlaczego średnia arytmetyczna jest mniejsza niż średnia rozkładu w rozkładzie logarytmiczno-normalnym?
Tak, mam losowy proces generowania log-normalnie rozprowadzane zmiennych losowych . Oto odpowiednia funkcja gęstości prawdopodobieństwa:XXX Chciałem oszacować rozkład kilku chwil pierwotnego rozkładu, powiedzmy pierwszy moment: średnią arytmetyczną. Aby to zrobić, narysowałem 100 losowych zmiennych 10000 razy, aby móc obliczyć 10000 oszacowania średniej arytmetycznej. Istnieją dwa różne sposoby oszacowania tego (przynajmniej …

2
Robienie bayesowskiego przeora z częstego wyniku
Jak przejść do przekształcania częstego wyniku w przeora bayesowskiego? Rozważmy następujący dość ogólny scenariusz: w przeszłości przeprowadzono eksperyment i zmierzono wynik na pewnym parametrze . Analizy dokonano przy użyciu metodologii częstokrzyskiej. Przedział ufności dla ϕ podano w wynikach.ϕϕ\phiϕϕ\phi Przeprowadzam teraz nowy eksperyment, w którym chcę zmierzyć inne parametry, na przykład …

1
Jaka jest różnica między regresją logistyczną a regresją ułamkową?
O ile mi wiadomo, różnica między modelem logistycznym a modelem odpowiedzi ułamkowej (frm) polega na tym, że zmienna zależna (Y), w której frm wynosi [0,1], ale logistyka to {0, 1}. Ponadto, frm używa estymatora quasi-prawdopodobieństwa do określenia jego parametrów. Zwykle możemy użyć glmdo uzyskania modeli logistycznych przez glm(y ~ x1+x2, …

1
Określanie wcześniej wielkości efektu w metaanalizie
Moje pytanie dotyczy priorów co do wielkości efektów, w moim projekcie miarą jest Cohena . Czytając literaturę, często wydaje się, że niejasne są przeory, na przykład w dobrze znanym ośmiu szkołach przykład hierarchicznej metaanalizy bayesowskiej. W przykładzie z ośmiu szkół widziałem niejasny wcześniej używany do oszacowania mu, taki jak μ …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.