Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

11
Czy potrafisz wywnioskować związek przyczynowy z korelacji w tym przykładzie gry dyktatorskiej?
Właśnie miałem egzamin, w którym przedstawiono nam dwie zmienne. W grze dyktatorskiej, w której dyktator otrzymuje 100 USD i może sam zdecydować, ile wysłać lub zatrzymać dla siebie, istniała dodatnia korelacja między wiekiem a ilością pieniędzy, które uczestnicy postanowili zatrzymać. Uważam, że nie można wywnioskować z tego przyczynowości, ponieważ nie …

3
Jaka jest różnica między „eksperymentem statystycznym” a „modelem statystycznym”?
Śledzę AW van der Vaarta, statystyki asymptotyczne (1998). Mówi o eksperymentach statystycznych, twierdząc, że różnią się one od modelu statystycznego, ale nie definiuje żadnego z nich. Moje pytanie: Czym jest (1) eksperyment statystyczny, (2) model statystyczny i (3) jaki jest kluczowy składnik, który zawsze odróżnia eksperyment statystyczny od jakiegokolwiek modelu …

7
Czy „rozkład normalny” musi mieć średnią = medianę = tryb?
Dyskutowałem z moim profesorem statystycznym na temat „normalnych rozkładów”. Uważam, że aby naprawdę uzyskać rozkład normalny, trzeba mieć średnią = mediana = tryb, wszystkie dane muszą być zawarte pod krzywą dzwonową i idealnie symetryczne wokół średniej. Dlatego technicznie praktycznie nie ma żadnych normalnych rozkładów w prawdziwych badaniach i powinniśmy nazwać …

3
Dlaczego nie skorzystać z „równań normalnych”, aby znaleźć proste współczynniki najmniejszych kwadratów?
Widziałem tę listę tutaj i nie mogłem uwierzyć, że istnieje tak wiele sposobów rozwiązania najmniejszych kwadratów. „Normalne równania” na Wikipedii wydawał się być dość prosty sposób do α^β^=y¯−β^x¯,=∑ni=1(xi−x¯)(yi−y¯)∑ni=1(xi−x¯)2α^=y¯−β^x¯,β^=∑i=1n(xi−x¯)(yi−y¯)∑i=1n(xi−x¯)2 {\displaystyle {\begin{aligned}{\hat {\alpha }}&={\bar {y}}-{\hat {\beta }}\,{\bar {x}},\\{\hat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}\end{aligned}}} Dlaczego więc ich nie użyć? Zakładam, …


1
Czy istnieje bayesowska interpretacja regresji liniowej z równoczesną regularyzacją L1 i L2 (inaczej elastyczna siatka)?
Powszechnie wiadomo, że regresja liniowa z karą jest równoważna znalezieniu oszacowania MAP przy danym przed Gaussa współczynników. Podobnie użycie kary jest równoważne z użyciem rozkładu Laplace'a jako wcześniejszego.l2l2l^2l1l1l^1 Często zdarza się, że używa się ważonej kombinacji regularyzacji i . Czy możemy powiedzieć, że jest to równoważne wcześniejszemu rozkładowi współczynników (intuicyjnie …

1
Kiedy maksymalne prawdopodobieństwo i metoda momentów dają te same estymatory?
Zadano mi to pytanie pewnego dnia i nigdy wcześniej go nie rozważałem. Moja intuicja wynika z zalet każdego estymatora. Maksymalne prawdopodobieństwo występuje najlepiej, gdy jesteśmy pewni procesu generowania danych, ponieważ w przeciwieństwie do metody momentów wykorzystuje wiedzę o całej dystrybucji. Ponieważ estymatory MoM wykorzystują tylko informacje zawarte w momentach, wydaje …


2
Dlaczego dokładnie regresja beta nie radzi sobie z zerami i zerami w zmiennej odpowiedzi?
Regresja beta (tj. GLM z rozkładem beta i zwykle funkcją logit link) jest często zalecana do radzenia sobie ze zmienną zależną od odpowiedzi przyjmującą wartości od 0 do 1, takie jak ułamki, stosunki lub prawdopodobieństwa: Regresja dla wyniku (stosunek lub ułamek) od 0 do 1 . Zawsze jednak twierdzi się, …

2
Rozkład pobierania próbek z dwóch niezależnych populacji Bernoulli
Załóżmy, że mamy próbki dwóch niezależnych zmiennych losowych Bernoulliego, Ber(θ1)Ber(θ1)\mathrm{Ber}(\theta_1) i Ber(θ2)Ber(θ2)\mathrm{Ber}(\theta_2) . Jak udowodnimy, że (X¯1−X¯2)−(θ1−θ2)θ1(1−θ1)n1+θ2(1−θ2)n2−−−−−−−−−−−−−−√→dN(0,1)(X¯1−X¯2)−(θ1−θ2)θ1(1−θ1)n1+θ2(1−θ2)n2→dN(0,1)\frac{(\bar X_1-\bar X_2)-(\theta_1-\theta_2)}{\sqrt{\frac{\theta_1(1-\theta_1)}{n_1}+\frac{\theta_2(1-\theta_2)}{n_2}}}\xrightarrow{d} \mathcal N(0,1)? Załóżmy, że n1≠n2n1≠n2n_1\neq n_2 .

4
Jaka jest podstawa definicji wartości odstającej w polu i wąsach?
Standardowa definicja wartości odstającej dla wykresu Box i Whisker to punkty spoza zakresu , gdzie I Q R = Q 3 - Q 1 i Q 1 to pierwszy kwartyl i Q 3 to trzeci kwartyl danych.{Q1−1.5IQR,Q3+1.5IQR}{Q1−1.5IQR,Q3+1.5IQR}\left\{Q1-1.5IQR,Q3+1.5IQR\right\}IQR=Q3−Q1IQR=Q3−Q1IQR= Q3-Q1Q1Q1Q1Q3Q3Q3 Jaka jest podstawa tej definicji? Przy dużej liczbie punktów nawet idealnie normalny …



1
Dlaczego wartości p są często wyższe w modelu proporcjonalnego hazardu Coxa niż w regresji logistycznej?
Dowiedziałem się o modelu proporcjonalnego hazardu Coxa. Mam dużo doświadczenia okucia modele regresji logistycznej, a więc budować modele intuicji Byłem porównujące dopasowuje się stosując coxphod R „przetrwania” ze modele regresji logistycznej dopasowuje się stosując glmprzy family="binomial". Jeśli uruchomię kod: library(survival) s = Surv(time=lung$time, event=lung$status - 1) summary(coxph(s ~ age, data=lung)) …

6
Czy istnieje przykład, w którym MLE daje stronnicze oszacowanie średniej?
Czy możesz podać przykład estymatora MLE średniej stronniczości? Nie szukam przykładu, który ogólnie łamie estymatory MLE, naruszając warunki regularności. Wszystkie przykłady, które widzę w Internecie, odnoszą się do wariancji i nie mogę znaleźć niczego związanego ze średnią. EDYTOWAĆ @MichaelHardy podał przykład, w którym otrzymujemy tendencyjne oszacowanie średniej rozkładu jednolitego przy …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.