Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Kiedy przedział ufności „ma sens”, ale odpowiadający mu przedział wiarygodności nie?
Często zdarza się, że przedział ufności z 95% pokryciem jest bardzo podobny do wiarygodnego przedziału, który zawiera 95% gęstości tylnej. Dzieje się tak, gdy przeor jest jednolity lub prawie jednolity w tym drugim przypadku. Dlatego przedział ufności może być często stosowany do przybliżenia wiarygodnego przedziału i odwrotnie. Co ważne, możemy …


5
Jak obliczyć, czy moja regresja liniowa ma statystycznie istotną różnicę od znanej linii teoretycznej?
Mam pewne dane, które pasują do z grubsza liniowej linii: Kiedy wykonuję regresję liniową tych wartości, otrzymuję równanie liniowe: y= 0,997 x - 0,0136y=0,997x-0,0136y = 0.997x-0.0136 W idealnym świecie równanie powinno wynosić .y= xy=xy = x Oczywiście moje wartości liniowe są zbliżone do tego ideału, ale nie do końca. Moje …

3
Jeśli są IID, to oblicz , gdzie
Pytanie Jeśli są IID, to oblicz , gdzie .X1,⋯,Xn∼N(μ,1)X1,⋯,Xn∼N(μ,1)X_1,\cdots,X_n \sim \mathcal{N}(\mu, 1)E(X1∣T)E(X1∣T)\mathbb{E}\left( X_1 \mid T \right)T=∑iXiT=∑iXiT = \sum_i X_i Próba : Sprawdź, czy poniższe informacje są prawidłowe. Powiedzmy, że bierzemy sumę tych warunkowych oczekiwań, tak, że: ∑iE(Xi∣T)=E(∑iXi∣T)=T.∑iE(Xi∣T)=E(∑iXi∣T)=T.\begin{align} \sum_i \mathbb{E}\left( X_i \mid T \right) = \mathbb{E}\left( \sum_i X_i \mid T \right) …

2
Czy rozkład Cauchy'ego jest w jakiś sposób rozkładem „nieprzewidywalnym”?
Czy rozkład Cauchy'ego jest w jakiś sposób „rozkładem nieprzewidywalnym”? Próbowałem zrobić cs <- function(n) { return(rcauchy(n,0,1)) } w R dla wielu n wartości i zauważyli, że czasami generują dość nieprzewidywalne wartości. Porównaj to np as <- function(n) { return(rnorm(n,0,1)) } co zawsze wydaje się dawać „zwartą” chmurę punktów. Na tym …

2
Czy mogę wykorzystać momenty rozkładu do próbkowania rozkładu?
Zauważam, że w metodach statystycznych / uczenia maszynowego rozkład jest często aproksymowany przez Gaussa, a następnie Gaussian jest wykorzystywany do próbkowania. Zaczynają od obliczenia pierwszych dwóch momentów rozkładu i wykorzystują je do oszacowania i . Następnie mogą pobrać próbki z tego gaussowskiego.μμ\muσ2σ2\sigma^2 Wydaje mi się, że im więcej chwil obliczam, …

2
Dlaczego The Simpsons (serial telewizyjny) najwyraźniej odnosi sukcesy w „przewidywaniu” przyszłości? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Jest szeroko komentowany w żółtej i niezbyt żółtej prasie, że The Simpsons (serial telewizyjny) wielokrotnie przepowiadał przyszłość. Wyczerpujące artykuły online na …

1
Głębia drzewa decyzyjnego
Ponieważ algorytm drzewa decyzyjnego dzieli się na atrybut na każdym etapie, maksymalna głębokość drzewa decyzyjnego jest równa liczbie atrybutów danych. Czy to jest poprawne?

1
Jakie algorytmy workowania są godnymi następcami Random Forest?
Jeśli chodzi o algorytmy wzmacniające, powiedziałbym, że ewoluowały całkiem dobrze. Na początku 1995 r. Wprowadzono AdaBoost, a po pewnym czasie była to Gradient Boosting Machine (GBM). Niedawno około 2015 r. Wprowadzono XGBoost, który jest dokładny, radzi sobie z nadmiernym dopasowaniem i stał się zwycięzcą wielu konkursów Kaggle. W 2017 roku …

6
Ważniejsza statystyka: „90 procent wszystkich kobiet przeżyło” czy „90 procent wszystkich kobiet, które przeżyły, to kobiety”?
Rozważ następujące stwierdzenia dotyczące Titanica: Założenie 1: tylko mężczyźni i kobiety byli na statku Założenie 2: Było wielu mężczyzn i kobiet Oświadczenie 1: 90 procent wszystkich kobiet przeżyło Oświadczenie 2: 90 procent wszystkich, którzy przeżyli, to kobiety Pierwszy wskazuje, że ratowanie kobiet miało prawdopodobnie wysoki priorytet (niezależnie od tego, czy …

3
Doradztwo w zakresie współpracy z naukowcami stosowanymi
Jestem absolwentem statystyki i jako taki jestem zaangażowany w kilka współpracy z naukowcami stosowanymi (ekonomistami, leśnikami…). Współpraca ta jest fajna (przez większość czasu) i dużo się uczę, ale są też pewne komplikacje, na przykład: Czasami moje zdanie na temat tego, czym jest dobry model statystyczny, różni się od tła moich …
14 references 

4
Modele predykcyjne: statystyki nie są w stanie pokonać uczenia maszynowego? [Zamknięte]
Zamknięte . To pytanie musi być bardziej skoncentrowane . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby skupiało się tylko na jednym problemie, edytując ten post . Zamknięte 2 lata temu . Obecnie śledzę program główny koncentrujący się na statystyce / ekonometrii. U mojego mistrza wszyscy studenci …


1
Hamiltonian Monte Carlo dla manekinów
Czy możesz wyjaśnić manekinom krok po kroku, jak działa Hamiltonian Monte Carlo? PS: Przeczytałem już odpowiedzi tutaj, Hamiltonian Monte Carlo , a tutaj Hamiltonian Monte Carlo vs. Sekwencyjny Monte Carlo , a tutaj Hamiltonian Monte Carlo: jak zrozumieć propozycję Metropolis-Hasting? i nie zajmują się tym krok po kroku.
14 bayesian  hmc 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.