Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Oszacowanie parametru rozkładu jednolitego: niewłaściwy wcześniej?
Mamy N próbek, , z jednolitego rozkładu [0, \ theta], gdzie \ theta jest nieznany. Oszacuj \ theta na podstawie danych.XiXiX_i[0,θ][0,θ][0,\theta]θθ\thetaθθ\theta Tak więc zasada Bayesa ... f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(\theta | {X_i}) = \frac{f({X_i}|\theta)f(\theta)}{f({X_i})} a prawdopodobieństwo wynosi: f(Xi|θ)=∏Ni=11θf(Xi|θ)=∏i=1N1θf({X_i}|\theta) = \prod_{i=1}^N \frac{1}{\theta} (edytuj: kiedy 0≤Xi≤θ0≤Xi≤θ0 \le X_i \le \theta dla wszystkich iii , a …


1
Test permutacji porównujący pojedynczą próbkę ze średnią
Kiedy ludzie wdrażają testy permutacji, aby porównać pojedynczą próbkę ze średnią (np. Jak w przypadku testu t permutacji), jak postępuje się ze średnią? Widziałem implementacje, które pobierają średnią i próbkę do testu permutacji, ale nie jest jasne, co tak naprawdę robią pod maską. Czy jest jakiś sensowny sposób przeprowadzenia testu …




3
Ćwiczenie 2.2 elementów uczenia statystycznego
Podręcznik najpierw generuje dane 2-klasowe poprzez: co daje: a następnie pyta: Próbuję rozwiązać ten problem, najpierw modelując to za pomocą tego modelu graficznego: gdzie ccc jest etykieta, h(1≤h≤10)h(1≤h≤10)h\,(1\le h \le 10) jest indeksem wybranej średniej mchmhcm_h^c, i xxxjest punktem danych. To da Pr(x∣mch)=Pr(mch∣h,c=blue)=Pr(mch∣h,c=orange)=Pr(h)=Pr(c)=N(mch,I/5)N((1,0)T,I)N((0,1)T,I)11012Pr(x∣mhc)=N(mhc,I/5)Pr(mhc∣h,c=blue)=N((1,0)T,I)Pr(mhc∣h,c=orange)=N((0,1)T,I)Pr(h)=110Pr(c)=12 \begin{align*} \Pr(x\mid m_h^c) =& \mathcal{N}(m_h^c,\mathbf{I}/5)\\ \Pr(m_h^c\mid h,c=\mathrm{blue}) …

1
Jakie są zalety korzystania z testów permutacyjnych?
Podczas testowania niektórych hipotez zerowych w porównaniu z alternatywnymi hipotezami za pomocą statystyki testowej , gdzie , zastosuj test permutacji z zestawem permutacji na a my mamy nową statystykę U(X)U(X)U(X)X={xi,...,xn}X={xi,...,xn}X = \{ x_i, ..., x_n\}GGGXXXT(X):=#{π∈G:U(πX)≥U(X)}|G|.T(X):=#{π∈G:U(πX)≥U(X)}|G|. T(X) := \frac{\# \{\pi \in G: U(\pi X) \geq U(X)\}}{|G|}. Jakie są zalety korzystania z …

2
Czy ta pojedyncza wartość pasuje do tego rozkładu?
wydaje się to bardzo naiwnym pytaniem, ale trudno mi znaleźć odpowiedź. Mam jeden zestaw 30 wartości. Niezależnie uzyskałem 31. wartość. Hipoteza zerowa jest taka, że ​​31. wartość jest częścią tego samego rozkładu. Alternatywą jest to, że jest inaczej. Chcę pewnego rodzaju wartości p lub miary prawdopodobieństwa. Kilka myśli, które miałem: …

1
Odchylenie estymatorów maksymalnego prawdopodobieństwa dla regresji logistycznej
Chciałbym zrozumieć kilka faktów dotyczących estymatorów maksymalnego prawdopodobieństwa (MLE) dla regresji logistycznych. Czy to prawda, że ​​ogólnie MLE regresji logistycznej jest stronniczy? Powiedziałbym tak". Wiem na przykład, że wymiar próbki jest związany z asymptotycznym nastawieniem MLE. Czy znasz jakieś podstawowe przykłady tego zjawiska? Jeśli MLE jest stronniczy, czy prawdą jest, …

1
Karane metody dla danych jakościowych: łączenie poziomów w czynnik
Modele ukarane mogą być wykorzystane do oszacowania modeli, w których liczba parametrów jest równa lub nawet większa niż wielkość próbki. Taka sytuacja może wystąpić w logarytmiczno-liniowych modelach dużych rzadkich tabel danych kategorialnych lub zliczających. W tych ustawieniach często jest również pożądane lub pomocne zwijanie tabel poprzez łączenie poziomów czynnika, przy …


3
Pomiar niektórych pacjentów więcej niż jeden raz
Prowadzę badanie kliniczne, w którym określam antropometryczną miarę pacjentów. Wiem, jak sobie poradzić z sytuacją, w której mam jednego pomiaru na pacjenta: tworzę model, w którym mam losową próbkęX1,…,XnX1,…,XnX_1,\dots,X_n z pewnej gęstości fθfθf_\theta, i robię zwykłe rzeczy: piszę prawdopodobieństwo próbki, oszacuj parametry, określaj zestawy ufności i testuj hipotezę, a nawet …
10 inference 


4
Model historii zdarzeń dyskretnych (przeżycie) w R.
Próbuję dopasować model czasu dyskretnego do R, ale nie jestem pewien, jak to zrobić. Czytałem, że możesz zorganizować zmienną zależną w różnych wierszach, po jednym dla każdej obserwacji czasu, i użyć glmfunkcji z łączem logit lub cloglog. W tym sensie, mam trzy kolumny: ID, Event(1 lub 0, w każdym okresie …
10 r  survival  pca  sas  matlab  neural-networks  r  logistic  spatial  spatial-interaction-model  r  time-series  econometrics  var  statistical-significance  t-test  cross-validation  sample-size  r  regression  optimization  least-squares  constrained-regression  nonparametric  ordinal-data  wilcoxon-signed-rank  references  neural-networks  jags  bugs  hierarchical-bayesian  gaussian-mixture  r  regression  svm  predictive-models  libsvm  scikit-learn  probability  self-study  stata  sample-size  spss  wilcoxon-mann-whitney  survey  ordinal-data  likert  group-differences  r  regression  anova  mathematical-statistics  normal-distribution  random-generation  truncation  repeated-measures  variance  variability  distributions  random-generation  uniform  regression  r  generalized-linear-model  goodness-of-fit  data-visualization  r  time-series  arima  autoregressive  confidence-interval  r  time-series  arima  autocorrelation  seasonality  hypothesis-testing  bayesian  frequentist  uninformative-prior  correlation  matlab  cross-correlation 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.