Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Klasyfikator vs model vs estymator
Jaka jest różnica między klasyfikatorem, modelem a estymatorem? Z tego co mogę powiedzieć: estymator jest predyktorem znalezionym na podstawie algorytmu regresji klasyfikator to predyktor znaleziony na podstawie algorytmu klasyfikacji model może być zarówno estymatorem, jak i klasyfikatorem Ale patrząc z Internetu wydaje się, że te definicje mogą być pomieszane. Więc …




3
Jakie są zalety regresji liniowej w porównaniu z regresją kwantową?
Model regresji liniowej przyjmuje szereg założeń, że regresja kwantylowa nie spełnia, a jeśli założenia regresji liniowej zostaną spełnione, to moja intuicja (i pewne bardzo ograniczone doświadczenie) jest taka, że ​​regresja mediana dałaby prawie identyczne wyniki jak regresja liniowa. Jakie zalety ma regresja liniowa? Z pewnością jest bardziej znajomy, ale poza …

7
Jaką krzywą (lub model) powinienem dopasować do danych procentowych?
Próbuję stworzyć postać, która pokazuje związek między kopiami wirusów a pokryciem genomu (GCC). Tak wyglądają moje dane: Na początku po prostu nakreśliłem regresję liniową, ale moi przełożeni powiedzieli mi, że to nieprawda, i wypróbowałem krzywą sigmoidalną. Zrobiłem to za pomocą geom_smooth: library(scales) ggplot(scatter_plot_new, aes(x = Copies_per_uL, y = Genome_cov, colour …

2
Czy testy nadmiernej dyspersji w GLM są * przydatne *?
Zjawisko „nadmiernej dyspersji” w GLM powstaje za każdym razem, gdy używamy modelu, który ogranicza wariancję zmiennej odpowiedzi, a dane wykazują większą wariancję, niż pozwala na to ograniczenie modelu. Zdarza się to często podczas modelowania danych zliczeniowych przy użyciu Poissona GLM i można je zdiagnozować za pomocą dobrze znanych testów. Jeśli …


2
Jakie są ważne zastosowania generowania liczb losowych w statystyce obliczeniowej?
Jak i dlaczego generatory liczb losowych (RNG) są ważne w statystyce obliczeniowej? Rozumiem, że losowość jest ważna przy wyborze próbek do wielu testów statystycznych, aby uniknąć stronniczości wobec którejkolwiek hipotezy, ale czy istnieją inne obszary statystyki obliczeniowej, w których ważne są generatory liczb losowych?

5
Dlaczego ?
Przypuszczam, że P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B) = P(A | B,C) * P(C) + P(A|B,\neg C) * P(\neg C) jest poprawny, podczas gdy P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B) = P(A | B,C) + P(A|B,\neg C) jest nieprawidłowe. Mam jednak „intuicję” na temat późniejszej, to znaczy rozważasz prawdopodobieństwo P (A | B), dzieląc dwa przypadki (C lub Not C). …


2
Intuicja na temat estymacji parametrów w modelach mieszanych (parametry wariancji vs. tryby warunkowe)
Czytałem wiele razy, że efekty losowe (BLUP / tryby warunkowe dla, powiedzmy, badanych) nie są parametrami liniowego modelu efektów mieszanych, ale zamiast tego można je wyprowadzić z oszacowanych parametrów wariancji / kowariancji. Np. Reinhold Kliegl i in. (2011) stan: Efekty losowe to odchylenia badanych od średniej średniej RT i odchylenia …

3
Kiedy nie można kontrolować zmiennej?
Mogę wymyślić przynajmniej jeden naiwny przykład. Załóżmy, że chcę zbadać związek między X i Z. Podejrzewam także, że Y wpływa na Z, więc kontroluję Y. Jednak, jak się okazuje, X nie wie o mnie, X powoduje Y, a Y powoduje Z. Dlatego kontrolując dla Y „zakrywam” związek między X i …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.