Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


6
Podręcznik dotyczący statystyk z R - czy istnieje i co powinien zawierać?
tło Jest wiele dyskusji na ten temat, więc pomyślałem, że mogę znaleźć odpowiedź z wcześniejszych kroków na StackExchange i wściekle googlować. Po pół dnia próbowania znalezienia tylko jednego podręcznika dla (bio) statystyk z R., byłem całkowicie zdezorientowany i musiałem się poddać. Może łączony darmowy materiał jest w rzeczywistości lepszy niż …
25 r  references 



6
Jakie są dobre techniki wizualizacji danych do porównywania dystrybucji?
Piszę pracę doktorską i zdałem sobie sprawę, że nadmiernie polegam na wykresach pudełkowych w celu porównania rozkładów. Jakie inne alternatywy podoba Ci się w realizacji tego zadania? Chciałbym również zapytać, czy znasz inne zasoby, takie jak galeria R, w której mogę zainspirować się różnymi pomysłami na wizualizację danych.



4
Ziliak (2011) sprzeciwia się stosowaniu wartości p i wymienia niektóre alternatywy; czym oni są?
W niedawnym artykule na temat wad polegania na wartości p do wnioskowania statystycznego, zatytułowanym „Matrixx przeciwko Siracusano i Student przeciwko Fisher, znaczenie statystyczne w próbie” (DOI: 10.1111 / j.1740-9713.2011.00511.x), Stephen T. Ziliak sprzeciwia się zastosowaniu wartości p. W końcowych akapitach mówi: Dane to jedna rzecz, którą już wiemy i na …

1
Konstruowanie przedziałów ufności w oparciu o prawdopodobieństwo profilu
Na moim kursie statystyki elementarnej nauczyłem się konstruować 95% przedział ufności, taki jak średnia populacji, , w oparciu o asymptotyczną normalność dla „dużych” próbek. Oprócz metod ponownego próbkowania (takich jak bootstrap), istnieje inne podejście oparte na „prawdopodobieństwie profilu” . Czy ktoś mógłby wyjaśnić to podejście?μμ\mu W jakich sytuacjach skonstruowany 95% …

4
Rozwiązanie problemu niepewności modelu
Zastanawiałem się, jak Bayesianie ze społeczności CrossValidated postrzegają problem niepewności modelu i jak wolą sobie z tym poradzić? Postaram się zadać pytanie w dwóch częściach: Jak ważne (według twojego doświadczenia / opinii) jest radzenie sobie z niepewnością modelu? Nie znalazłem żadnych artykułów na ten temat w społeczności uczącej się maszynowo, …


2
Kiedy powinienem * nie * korzystać z funkcji nlm R dla MLE?
Natknąłem się na kilka przewodników sugerujących, że używam nlm R do oszacowania maksymalnego prawdopodobieństwa. Ale żadna z nich (w tym dokumentacja R ) nie zawiera wielu teoretycznych wskazówek dotyczących tego, kiedy używać lub nie korzystać z tej funkcji. O ile mi wiadomo, nlm po prostu wykonuje opadanie gradientu wzdłuż linii …

2
Ogólny model liniowy a uogólniony model liniowy (z funkcją powiązania tożsamości?)
To jest mój pierwszy post, więc uspokój się, jeśli nie przestrzegam niektórych standardów! Poszukałem pytania i nic nie wyszło. Moje pytanie dotyczy głównie praktycznych różnic między ogólnym modelowaniem liniowym (GLM) a uogólnionym modelowaniem liniowym (GZLM). W moim przypadku byłoby to kilka zmiennych ciągłych jako współzmiennych i kilka czynników w ANCOVA …

2
Czy PCA jest niestabilna w wielokoliniowości?
Wiem, że w sytuacji regresji, jeśli masz zestaw wysoce skorelowanych zmiennych, jest to zwykle „złe” ze względu na niestabilność szacowanych współczynników (wariancja zmierza w kierunku nieskończoności, gdy wyznacznik zmierza w kierunku zera). Moje pytanie brzmi, czy ta „zła” utrzymuje się w sytuacji PCA. Czy współczynniki / obciążenia / ciężary / …

3
Pięć najlepszych klasyfikatorów do wypróbowania w pierwszej kolejności
Poza oczywistymi cechami klasyfikatora, takimi jak koszt obliczeniowy, oczekiwane typy danych funkcji / etykiet i przydatność do określonych rozmiarów i wymiarów zbiorów danych, jakich pięciu najlepszych (lub 10, 20?) klasyfikatorów wypróbowuje najpierw na nowym zbiorze danych , o którym jeszcze niewiele wiadomo (np. semantyka i korelacja poszczególnych cech)? Zwykle wypróbowuję …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.