Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Dlaczego rozwiązanie najmniejszych kwadratów daje w tym przypadku słabe wyniki?
Obraz znajduje się na stronie 204, rozdział 4 „Rozpoznawanie wzorów i uczenie maszynowe” autorstwa Bishopa, gdzie nie rozumiem, dlaczego rozwiązanie najmniejszych kwadratów daje tutaj słabe wyniki: Poprzedni akapit dotyczył faktu, że rozwiązania najmniejszych kwadratów nie są odporne na wartości odstające, jak widać na poniższym obrazie, ale nie rozumiem, co się …

3
Porównywanie i kontrastowanie, wartości p, poziomy istotności i błąd typu I.
Zastanawiałem się, czy ktokolwiek mógłby przedstawić zwięzłe podsumowanie definicji i zastosowania wartości p, poziomu istotności i błędu typu I. Rozumiem, że wartości p są definiowane jako „prawdopodobieństwo uzyskania statystyki testowej co najmniej tak ekstremalnej jak ta, którą faktycznie obserwowaliśmy”, podczas gdy poziom istotności jest tylko arbitralną wartością odcięcia do oceny, …

3
Co mówi mi o danych dodatnia nieokreślona macierz kowariancji?
Mam wiele obserwacji na wielu odmianach i chciałbym ocenić gęstość prawdopodobieństwa dla wszystkich zmiennych. Zakłada się, że dane są zwykle dystrybuowane. Przy niskiej liczbie zmiennych wszystko działa tak, jakbym się spodziewał, ale przejście do większej liczby powoduje, że macierz kowariancji staje się niejednoznaczna. Zmniejszyłem problem w Matlabie do: load raw_data.mat; …

1
Diagnostyka resztkowa w modelach regresji opartych na MCMC
Niedawno przystąpiłem do dopasowywania modeli mieszanych z regresją w ramach Bayesa, używając algorytmu MCMC (właściwie funkcja MCMCglmm w R). Wydaje mi się, że zrozumiałem, jak zdiagnozować zbieżność procesu szacowania (ślad, wykres Geweke'a, autokorelacja, rozkład tylny ...). Jedną z rzeczy, która uderza mnie w ramy Bayesa, jest to, że wiele wysiłku …

1
Jak mogę wyrównać / zsynchronizować dwa sygnały?
Robię badania, ale utknąłem na etapie analizy (powinienem był poświęcić więcej uwagi wykładom statystyk). Zebrałem dwa jednoczesne sygnały: zintegrowane natężenie przepływu dla objętości i zmiany w rozszerzaniu klatki piersiowej. Chciałbym porównać sygnały i ostatecznie mam nadzieję uzyskać głośność na podstawie sygnału rozszerzania klatki piersiowej. Ale najpierw muszę wyrównać / zsynchronizować …

2
Jak możemy ograniczyć prawdopodobieństwo, że zmienna losowa jest maksymalna?
\newcommand{\P}{\mathbb{P}} Załóżmy, że mamy NNN niezależnych zmiennych losowych X1X1X_1 , ……\ldots , XnXnX_n ze skończonymi środkami μ1≤…≤μNμ1≤…≤μN\mu_1 \leq \ldots \leq \mu_N i wariancji σ21σ12\sigma_1^2 , ……\ldots , σ2NσN2\sigma_N^2 . Szukam granic bez dystrybucji prawdopodobieństwa, że ​​każdy Xi≠XNXi≠XNX_i \neq X_N jest większy niż wszystkie inne XjXjX_j , j≠ij≠ij \neq i . …

4
Różnica między analizą regresji a analizą wariancji?
To pytanie zostało przeniesione z Mathematics Stack Exchange, ponieważ można na nie odpowiedzieć podczas weryfikacji krzyżowej. Migrował 7 lat temu . Uczę się teraz o analizie regresji i analizie wariancji. W analizie regresji masz jedną zmienną ustaloną i chcesz wiedzieć, jak ta zmienna idzie z drugą zmienną. W analizie wariancji …
21 regression 

3
Pierwszy krok dla dużych zbiorów danych (
Załóżmy, że analizujesz ogromny zestaw danych w wysokości miliardów obserwacji dziennie, gdzie każda obserwacja ma kilka tysięcy rzadkich i prawdopodobnie zbędnych zmiennych liczbowych i kategorialnych. Powiedzmy, że istnieje jeden problem regresji, jeden niezrównoważony problem klasyfikacji binarnej i jedno zadanie „dowiedzieć się, które predyktory są najważniejsze”. Myślałem o tym, jak podejść …

5
Nowy rewolucyjny sposób eksploracji danych?
Poniższy fragment pochodzi z wywiadu przeprowadzonego przez Schwager's Hedge Fund Market Wizzards (maj 2012 r.), Jaffraya Woodriffa, zarządzającego funduszem hedgingowym, który odnosi sukcesy: Na pytanie: „Jakie są najgorsze błędy popełniane podczas eksploracji danych?”: Wiele osób uważa, że ​​są w porządku, ponieważ używają danych z próby do szkolenia i danych z …

3
Układanie modeli w stos z karetką
Często carettrenuję kilka różnych modeli predykcyjnych przy użyciu w R. Wyszkolę je wszystkie na tych samych fałdach sprawdzania krzyżowego, używając caret::: createFolds, a następnie wybieram najlepszy model na podstawie błędu zweryfikowanego krzyżowo. Jednak mediana prognoz z kilku modeli często przewyższa najlepszy pojedynczy model w niezależnym zestawie testów. Zastanawiam się nad …
21 r  caret  ensemble 

3
PCA, gdy wymiarowość jest większa niż liczba próbek
Natknąłem się na scenariusz, w którym mam 10 sygnałów / osobę na 10 osób (czyli 100 próbek) zawierających 14000 punktów danych (wymiarów), które muszę przekazać klasyfikatorowi. Chciałbym zmniejszyć wymiarowość tych danych, a PCA wydaje się być na to dobrym sposobem. Jednak udało mi się znaleźć tylko przykłady PCA, w których …

1
Kiedy Markowa pól losowych
W swoim podręczniku, graficznych modelach rodziny wykładniczej i wariacyjne Inference , M. Jordana i M. Wainwright omówić związek między rodzinami wykładnicze i Markowa pól losowych (nieukierunkowane modeli graficznych). Staram się lepiej zrozumieć związek między nimi za pomocą następujących pytań: Czy wszyscy członkowie MRF należą do rodzin wykładniczych? Czy wszyscy członkowie …



2
„Intencja badacza” i progi / wartości p
Czytam slajdy „Doing Bayesian Data Analysis” Johna Kruschkego , ale tak naprawdę mam pytanie o jego interpretację testów t i / lub całą strukturę testowania znaczenia hipotezy zerowej. Twierdzi, że wartości p są źle zdefiniowane, ponieważ zależą od intencji badacza. W szczególności podaje przykład (strony 3-6) dwóch laboratoriów, które zbierają …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.