Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



7
Jakie są gałęzie statystyki?
W matematyce istnieją takie gałęzie, jak algebra, analiza, topologia itp. W uczeniu maszynowym uczenie się pod nadzorem, bez nadzoru i wzmacniające. W każdej z tych gałęzi są drobniejsze gałęzie, które dodatkowo dzielą metody. Mam problem ze zrównaniem się ze statystykami. Jakie byłyby główne gałęzie statystyki (i gałęzie podrzędne)? Idealna partycja …

3
Rozszerzenie paradoksu urodzinowego na więcej niż 2 osoby
W tradycyjnym paradoksie urodzinowym pytanie brzmi: „jakie są szanse, że dwie lub więcej osób w grupie osób będzie miało urodziny”. Utknąłem na problem, który jest przedłużeniem tego.nnn Zamiast znać prawdopodobieństwo, że dwie osoby dzielą urodziny, muszę rozszerzyć pytanie, aby wiedzieć, jakie jest prawdopodobieństwo, że lub więcej osób podzieli urodziny. Przy …

3
Jeśli X i Y są nieskorelowane, to czy X ^ 2 i Y są również nieskorelowane?
Jeśli dwie zmienne losowe i Y są nieskorelowane, to czy możemy również wiedzieć, że X 2 i Y nie są skorelowane? Moja hipoteza jest twierdząca.XXXYYYX2X2X^2YYY nieskorelowane oznacza E [ X Y ] = E [ X ] E [ Y ] lubX,YX,YX, YE[XY]=E[X]E[Y]E[XY]=E[X]E[Y]E[XY]=E[X]E[Y] E[XY]=∫xyfX(x)fY(y)dxdy=∫xfX(x)dx∫yfY(y)dy=E[X]E[Y]E[XY]=∫xyfX(x)fY(y)dxdy=∫xfX(x)dx∫yfY(y)dy=E[X]E[Y] E[XY]=\int xy f_X(x)f_Y(y)dxdy=\int xf_X(x)dx\int yf_Y(y)dy=E[X]E[Y] Czy …

4
Kiedy powinienem bilansować klasy w zbiorze danych treningowych?
Miałem kurs online, w którym dowiedziałem się, że niezrównoważone klasy w danych treningowych mogą prowadzić do problemów, ponieważ algorytmy klasyfikacji są zgodne z regułą większości, ponieważ dają dobre wyniki, jeśli niezrównoważenie jest zbyt duże. W zadaniu należało zrównoważyć dane poprzez niepełne próbkowanie klasy większościowej. Jednak na tym blogu ktoś twierdzi, …


4
Czy czasopismo Science poparło analizę Garden of Forking Pathes Analyzes?
Idea adaptacyjnej analizy danych polega na tym, że zmieniasz swój plan analizowania danych, gdy dowiadujesz się więcej na ten temat. W przypadku eksploracyjnej analizy danych (EDA) jest to ogólnie dobry pomysł (często szukasz nieprzewidzianych wzorców w danych), ale w przypadku badania potwierdzającego jest to powszechnie akceptowane jako bardzo błędna metoda …

5
Rozróżnienie między dwiema grupami w statystyce i uczeniu maszynowym: test hipotez a klasyfikacja vs. grupowanie
Załóżmy, że mam dwie grupy danych, oznaczone A i B (każda zawiera np. 200 próbek i 1 cechę), i chcę wiedzieć, czy są one różne. Mógłbym: a) wykonać test statystyczny (np. test t), aby sprawdzić, czy są statystycznie różne. b) korzystać z nadzorowanego uczenia maszynowego (np. klasyfikatora wektorów wsparcia lub …

7
Jaki jest sens analizy szeregów czasowych?
Jaki jest sens analizy szeregów czasowych? Istnieje wiele innych metod statystycznych, takich jak regresja i uczenie maszynowe, które mają oczywiste przypadki użycia: regresja może dostarczyć informacji na temat relacji między dwiema zmiennymi, podczas gdy uczenie maszynowe doskonale nadaje się do przewidywania. Tymczasem nie wiem, do czego służy analiza szeregów czasowych. …

5
Jak radzić sobie z hierarchicznymi / zagnieżdżonymi danymi w uczeniu maszynowym
Wyjaśnię mój problem na przykładzie. Załóżmy, że chcesz przewidzieć dochód danej osoby na podstawie niektórych atrybutów: {Wiek, płeć, kraj, region, miasto}. Masz taki zestaw danych szkoleniowych train <- data.frame(CountryID=c(1,1,1,1, 2,2,2,2, 3,3,3,3), RegionID=c(1,1,1,2, 3,3,4,4, 5,5,5,5), CityID=c(1,1,2,3, 4,5,6,6, 7,7,7,8), Age=c(23,48,62,63, 25,41,45,19, 37,41,31,50), Gender=factor(c("M","F","M","F", "M","F","M","F", "F","F","F","M")), Income=c(31,42,71,65, 50,51,101,38, 47,50,55,23)) train CountryID RegionID CityID …
29 regression  machine-learning  multilevel-analysis  correlation  dataset  spatial  paired-comparisons  cross-correlation  clustering  aic  bic  dependent-variable  k-means  mean  standard-error  measurement-error  errors-in-variables  regression  multiple-regression  pca  linear-model  dimensionality-reduction  machine-learning  neural-networks  deep-learning  conv-neural-network  computer-vision  clustering  spss  r  weighted-data  wilcoxon-signed-rank  bayesian  hierarchical-bayesian  bugs  stan  distributions  categorical-data  variance  ecology  r  survival  regression  r-squared  descriptive-statistics  cross-section  maximum-likelihood  factor-analysis  likert  r  multiple-imputation  propensity-scores  distributions  t-test  logit  probit  z-test  confidence-interval  poisson-distribution  deep-learning  conv-neural-network  residual-networks  r  survey  wilcoxon-mann-whitney  ranking  kruskal-wallis  bias  loss-functions  frequentist  decision-theory  risk  machine-learning  distributions  normal-distribution  multivariate-analysis  inference  dataset  factor-analysis  survey  multilevel-analysis  clinical-trials 



5
Czy istnieje wyjaśnienie, dlaczego istnieje tak wiele zjawisk naturalnych, które następują po normalnym rozkładzie?
Myślę, że to fascynujący temat i nie do końca go rozumiem. Jakie prawo fizyki sprawia, że ​​tak wiele zjawisk naturalnych ma rozkład normalny? Wydaje się bardziej intuicyjne, że mieliby jednolity rozkład. Tak trudno mi to zrozumieć i czuję, że brakuje mi niektórych informacji. Czy ktoś może mi pomóc z dobrym …

4
Gdzie jest teoria grafów w modelach graficznych?
Wprowadzenie do modeli graficznych opisuje je jako „... połączenie teorii grafów z teorią prawdopodobieństwa”. Rozumiem część teorii prawdopodobieństwa, ale mam problem ze zrozumieniem, gdzie dokładnie pasuje teoria grafów. Jakie spostrzeżenia z teorii grafów pomogły nam pogłębić nasze rozumienie rozkładów prawdopodobieństwa i podejmowania decyzji w warunkach niepewności? Szukam konkretnych przykładów poza …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.