Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy większość opublikowanych korelacji w naukach społecznych jest niewiarygodna i co należy z tym zrobić? [Zamknięte]
Zamknięte . To pytanie jest oparte na opiniach . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby można było na nie odpowiedzieć faktami i cytatami, edytując ten post . Zamknięte 2 lata temu . Pomimo ważnego, ale odrobiny „gotcha” -istycznych wysiłków podejmowanych przez jednostki w celu ujawnienia …

2
Badanie różnic między populacjami
Powiedzmy, że mamy próbkę z dwóch populacji: Ai B. Załóżmy, że te populacje składają się z pojedynczych osób i wybieramy opisywanie poszczególnych osób pod względem cech. Niektóre z tych funkcji są jakościowe (np. Czy jeżdżą do pracy?), A niektóre są liczbowe (np. Ich wysokość). Nazwijmy te funkcje: . Zbieramy setki …

4
Dlaczego fakt, że 1 mediana jest niższa niż inna mediana, nie oznacza, że ​​większość w grupie 1 jest mniejsza niż większość w grupie 2?
Uważałem, że poniższe wykresy pudełkowe można interpretować jako „większość mężczyzn jest szybsza niż większość kobiet” (w tym zbiorze danych), przede wszystkim dlatego, że mediana czasu mężczyzn była krótsza niż mediana czasu kobiet. Ale kurs EdX na temat R i quizu statystycznego powiedział mi, że jest niepoprawny. Pomóż mi zrozumieć, dlaczego …

1
Dlaczego w kwadratach łacińskich mówi się, że rzędy, zabiegi i kolumny są prostopadłe
Zawsze słyszałem „ortogonalne” w dziedzinie geometrii (proszę również pamiętać, że nie jestem rodzimym językiem angielskim). Nie rozumiem co do kwadratów łacińskich (cytat z podręcznika): Każde leczenie (ABCD) pojawia się raz w każdym rzędzie. Dlatego zabiegi i rzędy są ortogonalne. ... Rzędy i kolumny są prostopadłe do zabiegów. 12341ABCD2BCDA3CDAB4DABC12341ABCD2BCDA3CDAB4DABC\begin{matrix}\,&1&2&3&4\\1&A&B&C&D\\2&B&C&D&A\\3&C&D&A&B\\4&D&A&B&C\end{matrix} Co oznacza …

1
Wartości p i zasada prawdopodobieństwa
To pytanie pojawiło się w klasie: Jeśli używamy wartości p do oceny hipotez w eksperymencie, to jakiej części zasady prawdopodobieństwa nie przestrzegamy: wystarczalności czy warunkowości ? Moją intuicją byłoby powiedzieć wystarczalność , ponieważ obliczenie wartości p opiera się na nieobserwowanych wynikach eksperymentu, a wystarczająca wydaje się, że więcej zajmuje się …

2
Krzywe Kaplana-Meiera wydają się mówić inaczej niż regresja Coxa
W R przeprowadzam analizę danych dotyczących przeżycia chorych na raka. Czytałem bardzo pomocne rzeczy na temat analizy przeżycia w CrossValidated i innych miejscach i myślę, że zrozumiałem, jak interpretować wyniki regresji Coxa. Jednak jeden wynik wciąż mnie wkurza ... Porównuję przeżycie vs. płeć. Krzywe Kaplana-Meiera są wyraźne na korzyść pacjentek …

2
Odwrotny problem urodzinowy z wieloma kolizjami
Załóżmy, że miałeś rok obcy o nieznanej długości N. Jeśli masz losową próbkę wspomnianych kosmitów, a niektórzy z nich dzielą urodziny, czy możesz użyć tych danych do oszacowania długości roku? Na przykład, w próbie 100, możesz mieć dwie trojaczki (tj. Dwa urodziny, z których każdy dzieli trzech kosmitów) oraz pięć …


2
Jaki jest rozkład prawdopodobieństwa tej losowej sumy nie-iidowych zmiennych Bernoulliego?
Próbuję znaleźć rozkład prawdopodobieństwa sumy losowej liczby zmiennych, które nie są identycznie rozmieszczone. Oto przykład: John pracuje w centrum obsługi klienta. Otrzymuje połączenia z problemami i próbuje je rozwiązać. Tych, których nie potrafi rozwiązać, przekazuje je swojemu przełożonemu. Załóżmy, że liczba połączeń, które otrzymuje w ciągu dnia, jest równa średniej …


1
Kiedy stosować regresję Deminga
Obecnie pracuję nad sposobem na przekształcenie dwóch różnych wartości testowych fosforu. tło Istnieje wiele (ekstrakcyjnych) metod pomiaru dostępnego fosforu w glebie. Różne kraje stosują różne metody, dlatego w celu porównania płodności P we wszystkich krajach należy obliczyć wartość testu P x na podstawie wartości testu P y i vice versa. …

3
Określanie istotności statystycznej współczynnika regresji liniowej w obecności wielokoliniowości
Załóżmy, że mam kilka miast o różnej wielkości populacji i chciałem sprawdzić, czy istnieje dodatnia liniowa zależność między liczbą sklepów monopolowych w mieście a liczbą DUI. Gdzie określam, czy związek ten jest znaczący, czy nie, na podstawie testu t szacowanego współczynnika regresji. Teraz wyraźnie pop. wielkość miasta będzie pozytywnie skorelowana …

1
Który model głębokiego uczenia może klasyfikować kategorie, które nie wykluczają się wzajemnie
Przykłady: w opisie stanowiska mam zdanie: „Starszy inżynier Java w Wielkiej Brytanii”. Chcę użyć modelu głębokiego uczenia się, aby przewidzieć go jako 2 kategorie: English i IT jobs. Jeśli użyję tradycyjnego modelu klasyfikacji, może on przewidzieć tylko 1 etykietę z softmaxfunkcją na ostatniej warstwie. Dlatego mogę użyć 2 modelowych sieci …
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 

1
Czy Naive Bayes staje się coraz bardziej popularny? Dlaczego?
Jest to wynik trendów Google uzyskany dla frazy „Naive Bayes” od stycznia 2004 do kwietnia 2017 ( link ). Według tej liczby współczynnik wyszukiwania „Naive Bayes” w kwietniu 2017 r. Jest o około 25% wyższy niż maksimum w całym okresie. Czy to oznacza, że ​​ta prosta i stara metoda zyskuje …

6
Wykorzystanie wartości p do obliczenia prawdopodobieństwa prawdziwości hipotezy; co jeszcze jest potrzebne?
Pytanie: Jednym z powszechnych nieporozumień dla wartości p jest to, że reprezentują one prawdopodobieństwo prawdziwości hipotezy zerowej. Wiem, że to nieprawda i wiem, że wartości p reprezentują jedynie prawdopodobieństwo znalezienia próbki tak ekstremalnej jak ta, biorąc pod uwagę, że hipoteza zerowa jest prawdziwa. Jednak intuicyjnie, powinno być możliwe wyprowadzenie pierwszego …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.