Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jaki jest związek między metodami, takimi jak dopasowywanie i statystyczna kontrola zmiennych?
Często w artykułach badawczych, które czytasz, badacze kontrolowali pewne zmienne. Można to zrobić metodami takimi jak dopasowywanie, blokowanie itp. Ale zawsze uważałem, że kontrolowanie zmiennych było czymś statystycznym, mierząc kilka zmiennych, które mogą mieć wpływ, i przeprowadzając analizę statystyczną tych zmiennych, co można przeprowadzić zarówno w prawdziwych, jak i quasi-eksperymentach. …

1
Biorąc pod uwagę zestaw punktów w przestrzeni dwuwymiarowej, w jaki sposób jedna decyzja projektowa może działać dla SVM?
Czy ktoś może mi wyjaśnić, jak należy zaprojektować funkcję decyzyjną SVM? Lub wskaż mi zasób, który omawia konkretny przykład. EDYTOWAĆ W poniższym przykładzie widzę, że równanie X2=1.5X2=1.5X_2 = 1.5 oddziela klasy z maksymalnym marginesem. Ale jak dopasować wagi i napisać równania dla hiperpłaszczyzn w następującej formie. H1:w0+w1x1+w2x2≥1H2:w0+w1x1+w2x2≤−1forYi=+1forYi=−1.H1:w0+w1x1+w2x2≥1forYi=+1H2:w0+w1x1+w2x2≤−1forYi=−1.\begin{array}{ll} H_1 : w_0+w_1x_1+w_2x_2 …
10 svm 


1
Sugestia testu statystycznego
Muszę znaleźć odpowiedni test statystyczny (test ilorazu wiarygodności, test t itp.) W następujących przypadkach: Niech być IID przykładowy wektor losowej ( X ; Y ) i zakładamy, że ( Y X ) ~ N [ ( μ 1 μ 2 ) , ( 1 0,5 0,5 1 ) ] . …

2
Dlaczego dystrybucje są ważne?
To może równie dobrze spaść, jak najgłupsze pytania, jakie kiedykolwiek zadano na tym forum, ale po otrzymaniu rozsądnych i znaczących odpowiedzi na poprzednie pytanie, pomyślałem, że ponownie rozciągnę moje szczęście. Przez pewien czas byłem bardzo zdezorientowany co do znaczenia rozkładów statystycznych, zwłaszcza gdy odnoszą się one do zwrotów aktywów, a …

2
Czy można mieć zmienną, która działa zarówno jako modyfikator efektu, jak i dezorientujący?
Czy można mieć zmienną, która działa zarówno jako modyfikator efektu (pomiaru), jak i czynnik zakłócający dla danej pary powiązań ryzyko-wynik? Nadal jestem trochę niepewny co do tego rozróżnienia. Spojrzałem na notację graficzną, aby pomóc mi zrozumieć różnicę, ale różnice w notacji są oszałamiające. Przydatne byłoby graficzne / wizualne objaśnienie tych …


1
Rozkład typu Gaussa z momentami wyższego rzędu
Dla rozkładu Gaussa o nieznanej średniej i wariancji wystarczające statystyki w standardowej postaci rodziny wykładniczej to . Mam rozkład, który ma , gdzie N jest trochę jak parametr projektowy. Czy istnieje odpowiedni znany rozkład dla tego rodzaju wystarczającego wektora statystyki? Potrzebuję próbek z tej dystrybucji, więc dla mnie bardzo ważne …

1
Dlaczego Anova () i drop1 () podają różne odpowiedzi dla GLMM?
Mam GLMM w postaci: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Kiedy używam drop1(model, test="Chi"), otrzymuję inne wyniki niż w przypadku korzystania Anova(model, type="III")z pakietu samochodowego lub summary(model). Te dwa ostatnie dają te same odpowiedzi. Korzystając z wielu sfabrykowanych danych, odkryłem, że te …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 


1
Czynniki Bayesa z niewłaściwymi priory
Mam pytanie dotyczące porównania modeli z wykorzystaniem czynników Bayesa. W wielu przypadkach statystycy są zainteresowani zastosowaniem podejścia bayesowskiego z niewłaściwymi priory (na przykład niektóre priory Jeffreysa i referencyjne priory). Moje pytanie brzmi: w tych przypadkach, gdy tylny rozkład parametrów modelu jest dobrze zdefiniowany, czy prawidłowe jest porównywanie modeli przy użyciu …

3
Skąd wziął się termin „nauczyć się modelu”
Często słyszałem, że tutaj górnicy danych używają tego terminu. Jako statystyk, który pracował nad problemami z klasyfikacją, znam pojęcie „trenuj klasyfikatora” i zakładam, że „ucz się modelu” oznacza to samo. Nie mam nic przeciwko określeniu „szkolić klasyfikatora”. To wydaje się przedstawiać ideę dopasowania modelu, ponieważ dane szkoleniowe są wykorzystywane do …

2
Jak generować liczby zgodnie z rozkładem Soliton?
Rozkład Solitona jest dyskretnym rozkładem prawdopodobieństwa w zbiorze z funkcją masy prawdopodobieństwa{ 1 , … , N}{1,…,N.}\{1,\dots, N\} p ( 1 ) = 1N.,p ( k ) = 1k ( k - 1 )dla k ∈ { 2 , … , N}p(1)=1N.,p(k)=1k(k-1)dla k∈{2),…,N.} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} Chciałbym go użyć …


2
Mylić co do przedziału ufności
Jestem zdezorientowany pojęciem przedziału ufności. Przyjmijmy, że istnieje zmienna Gaussa o znana, a interesuje mnie dolna granica średniej z poziomem ufności .X∼N(μ,σ)X∼N(μ,σ)X \sim N(\mu, \sigma)μ L 95 %σσ\sigmaμLμL\mu_L95%95%95\% Zrobię eksperyment razy i obserwuję , , , , .X 1 X 2 X 3555X1X1X_1X2X2X_2X3X3X_3X 5X4X4X_4X5X5X_5 Opcja 1: Traktuję każdą próbkę osobno …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.