Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Jak porównać siłę dwóch korelacji Pearsona?
Recenzent zapytał mnie, czy przedstawione w tabeli korelacje Pearsona (wartości r) można ze sobą porównać, aby można było twierdzić, że jedna jest „silniejsza” od drugiej (inna niż tylko sprawdzenie rzeczywistych wartości r) . Jak byś to zrobił? Znalazłem tę metodę http://vassarstats.net/rdiff.html ale nie jestem pewien, czy to dotyczy.

1
Rozkład prawdopodobieństwa funkcji zmiennych losowych?
Mam wątpliwości: rozważ zmienne losowe o wartościach rzeczywistych XXX i ZZZ oba zdefiniowane w przestrzeni prawdopodobieństwa ( Ω , F, P )(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}). Pozwolić Y:=g(X,Z)Y:=g(X,Z)Y:= g(X,Z), gdzie g(⋅)g(⋅)g(\cdot)jest funkcją o wartościach rzeczywistych. OdYYY jest funkcją zmiennych losowych jest to zmienna losowa. Pozwolić x:=X(ω)x:=X(ω)x:=X(\omega) tj. realizacja XXX. Jest P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(g(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x) równy P(g(x,Z))P(g(x,Z))\mathbb{P}(g(x,Z))?

2
Szacowanie rozmiaru przecięcia wielu zestawów za pomocą próbki jednego zestawu
Pracuję nad algorytmem, który musi obliczyć rozmiar zestawu wygenerowanego przez przecięcie co najmniej 2 zestawów. Dokładniej: z=|A0∩…∩An|z=|A0∩…∩An| z = \left |A_0 \cap \ldots \cap A_n \right | Przecinane zestawy są generowane przez zapytania SQL i starając się utrzymać szybkość, otrzymuję z wyprzedzeniem liczbę każdego zapytania, a następnie biorę zestaw o …
10 error  sample 

1
Jak interpretować wartości P GAM?
Nazywam się Hugh i jestem doktorantem używającym uogólnionych modeli addytywnych w celu przeprowadzenia analizy eksploracyjnej. Nie jestem pewien, jak interpretować wartości p pochodzące z pakietu MGCV i chciałem sprawdzić swoje zrozumienie (używam wersji 1.7-29 i zapoznałem się z dokumentacją Simona Wooda). Najpierw szukałem innych pytań CV, ale te najbardziej odpowiednie …
10 p-value  mgcv 

2
Dlaczego algorytm iteracji polityki jest zbieżny z optymalną funkcją polityki i wartości?
Czytałem notatki z wykładu Andrew Ng na temat uczenia się przez wzmacnianie i próbowałem zrozumieć, dlaczego iteracja polityki jest zbieżna z funkcją optymalnej wartości i optymalną polityką .V∗V∗V^*π∗π∗\pi^* Przypomnijmy, że iteracja zasad to: Zainicjuj π losowoPowtórz {L e t V. : =V.π \ dla bieżącej polityki, rozwiąż eqn bellman i …




2
Czy istnieje jakaś funkcjonalna różnica między ilorazem szans a ilorazem ryzyka?
W regresji logistycznej iloraz szans równy 2 oznacza, że ​​zdarzenie jest 2 razy bardziej prawdopodobne, biorąc pod uwagę wzrost o jedną jednostkę predyktora. W regresji Coxa współczynnik ryzyka wynoszący 2 oznacza, że ​​zdarzenie wystąpi dwa razy częściej w każdym punkcie czasowym, biorąc pod uwagę wzrost o jedną jednostkę predyktora. Czy …

1
Jak zmierzyć wiarygodność rankingu konsensusu (problem z książki Kemeny-Snell)
Załóżmy, że każdy z ekspertów jest proszony o uszeregowanie zestawu obiektów w kolejności lub preferencjach. Pozwól na remisy w rankingach.kkknnn John Kemeny i Laurie Snell w swojej książce z 1962 roku „Modele matematyczne w naukach społecznych” proponują rozwiązanie następnego problemu: PROJEKT . Opracuj miarę wiarygodności rankingu konsensusu przez ekspertów. Na …


3
Który jest lepszy, stl lub rozkład?
Robię analizę szeregów czasowych za pomocą R. Muszę rozłożyć dane na trend, sezonowość i losowy składnik. Mam tygodniowe dane od 3 lat. Znalazłem dwie funkcje w R - stl()i decompose(). Przeczytałem, że stl()to nie jest dobre dla multiplikatywnego rozkładu. Czy ktoś może mi powiedzieć, w jakim scenariuszu można korzystać z …
10 r  time-series 

3
Czy obliczanie „rzeczywistego prawdopodobieństwa pokrycia” jest tym samym, co obliczanie „wiarygodnego przedziału”?
Czytałem podręcznik statystyk na poziomie podstawowym. W rozdziale dotyczącym szacowania maksymalnego prawdopodobieństwa odsetka sukcesu w danych o rozkładzie dwumianowym podał wzór na obliczenie przedziału ufności, a następnie nonszalancko wspomniano Rozważmy jego rzeczywiste prawdopodobieństwo pokrycia, to znaczy prawdopodobieństwo, że metoda wygeneruje przedział, który uchwyci prawdziwą wartość parametru. Może to być nieco …

3
Prawdopodobieństwo przecięcia z wielokrotnego próbkowania tej samej populacji
Oto przykładowy przypadek: Mam populację 10 000 przedmiotów. Każdy element ma unikalny identyfikator. Losowo wybieram 100 przedmiotów i zapisuję identyfikatory Odłożyłem 100 przedmiotów z powrotem do populacji Losowo ponownie wybieram 100 przedmiotów, zapisuję identyfikatory i wymieniam. W sumie powtarzam losowe próbkowanie 5 razy Jakie jest prawdopodobieństwo, że liczba elementów pojawi …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.