Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Określenie negatywnego rozkładu dwumianowego do sekwencjonowania DNA
Ujemny rozkład dwumianowy stał się popularnym modelem do zliczania danych (w szczególności oczekiwanej liczby odczytów sekwencjonowania w danym regionie genomu z danego eksperymentu) w bioinformatyce. Wyjaśnienia różnią się: Niektórzy tłumaczą to jako coś, co działa jak rozkład Poissona, ale ma dodatkowy parametr, pozwalający na większą swobodę modelowania rzeczywistego rozkładu, przy …

1
Jak symulować z kopuły Gaussa?
Załóżmy, że mam dwa jednoznaczne rozkłady krańcowe, powiedzmy i , z których mogę symulować. Teraz skonstruuj ich wspólny rozkład za pomocą kopuły Gaussa , oznaczonej jako . Wszystkie parametry są znane.FFFGGGC(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) Czy istnieje metoda inna niż MCMC do symulacji z tej kopuły?

3
Szacowanie prawdopodobieństwa przejścia Markowa na podstawie danych sekwencji
Mam pełny zestaw sekwencji (dokładnie 432 obserwacje) z 4 stanów A−DA−DA-D : np Y=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AA−⋮BC−⋮A⎞⎠⎟⎟⎟⎟Y=(ACDDBACBAACA−−⋮⋮⋮⋮⋮⋮⋮BCADABA)Y=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&- &-\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & A\\ \end{array}\right) EDYCJA : Sekwencje obserwacji mają …

3
Bezstronna ocena mediany
Załóżmy, że mamy losową zmienną XXX obsługiwaną na [0,1][0,1][0,1] z której możemy czerpać próbki. Jak możemy bezstronnie oszacować medianę XXX ? Możemy oczywiście wygenerować niektóre próbki i pobrać medianę próbki, ale rozumiem, że generalnie nie będzie to obiektywne. Uwaga: to pytanie jest powiązane, ale nie identyczne, z moim ostatnim pytaniem …
16 sampling 

1
Definicja i zbieżność iteracyjnie ważonych najmniejszych kwadratów
Używałem iteracyjnie ponownie ważonych najmniejszych kwadratów (IRLS), aby zminimalizować funkcje następującej formy, J(m)=∑Ni=1ρ(|xi−m|)J(m)=∑i=1Nρ(|xi−m|)J(m) = \sum_{i=1}^{N} \rho \left(\left| x_i - m \right|\right) gdzie jest liczbą wystąpień , jest dokładnym oszacowaniem, którego chcę, a jest odpowiednią solidną funkcją kary. Powiedzmy, że jest wypukły (choć niekoniecznie ściśle) i na razie różnicowalny. Dobrym przykładem …

1
Model mieszany a łączenie standardowych błędów w badaniach w wielu lokalizacjach - dlaczego model mieszany jest o wiele bardziej wydajny?
Mam zestaw danych składający się z serii miesięcznych przypadków „złamanego kija” z kilku stron. Usiłuję uzyskać jedno oszacowanie podsumowujące na podstawie dwóch różnych technik: Technika 1: Dopasuj „złamany drążek” za pomocą Poissona GLM ze zmienną wskaźnikową 0/1 i używając zmiennej czasu i czasu ^ 2 do kontrolowania trendów w czasie. …

3
Co znaczy Theta?
Jestem nowicjuszem w statystykach i znalazłem to . W statystykach θ, mała grecka litera „theta”, jest zwykłą nazwą parametru (wektora) o pewnym ogólnym rozkładzie prawdopodobieństwa. Częstym problemem jest znalezienie wartości theta. Zauważ, że nazwanie parametru w ten sposób nie ma żadnego znaczenia. Równie dobrze moglibyśmy nazwać to czymkolwiek innym. W …

3
Wyszukiwanie w siatce na podstawie k-krotnego sprawdzania poprawności
Mam zestaw danych 120 próbek w 10-krotnym ustawieniu walidacji krzyżowej. Obecnie wybieram dane treningowe pierwszego wstrzymania i wykonuję na nim 5-krotną weryfikację krzyżową, aby wybrać wartości gamma i C za pomocą wyszukiwania siatki. Używam SVM z jądrem RBF. Ponieważ przeprowadzam dziesięć-krotną weryfikację krzyżową, aby zgłosić precyzję, pamiętajcie, czy wykonuję to …

1
Jakie są rozkłady dla simpleks prawdopodobieństwa?
Niech będzie prawdopodobieństwem simpleks wymiaru , tzn. jest taki, że i .ΔKΔK\Delta_{K}K−1K−1K-1x∈ΔKx∈ΔKx \in \Delta_{K}xi≥0xi≥0x_i \ge 0∑ixi=1∑ixi=1\sum_i x_i = 1 Jakie dystrybucje, które są często (lub dobrze znane lub zdefiniowane w przeszłości) nad ?ΔK.ΔK.\Delta_{K} Oczywiście istnieją rozkłady Dirichleta i Logit-Normal. Czy są jakieś inne dystrybucje, które pojawiają się naturalnie w tym …

1
Wyrażenie w postaci zamkniętej dla kwantyli
Mam dwie zmienne losowe, αi∼iid U(0,1),i=1,2αi∼iid U(0,1),i=1,2\alpha_i\sim \text{iid }U(0,1),\;\;i=1,2 , gdzieU(0,1)U(0,1)U(0,1) jest jednolity rozkład 0-1. Następnie dają proces, powiedzmy: P(x)=α1sin(x)+α2cos(x),x∈(0,2π)P(x)=α1sin⁡(x)+α2cos⁡(x),x∈(0,2π)P(x)=\alpha_1\sin(x)+\alpha_2\cos(x), \;\;\;x\in (0,2\pi) Zastanawiałem się teraz, czy istnieje wyrażenie w postaci zamkniętej dla F−1(P(x);0.75)F−1(P(x);0.75)F^{-1}(P(x);0.75) teoretycznego 75-procentowego kwantylu P(x)P(x)P(x) dla danego x∈(0,2π)x∈(0,2π)x\in(0,2\pi) przypuszczam, że i mogę to zrobić za pomocą komputera i …

1
Oczekiwana wartość wyznacznika logarytmicznego macierzy Wishart
Niech , tj. zgodnie z rozkładem wymiarowym Wishart ze średnią i stopniami swobody . Chciałbym wyrażenie dla gdziejest wyznacznikiem.Λ ∼ W.re( ν, Ψ )Λ∼W.re(ν,Ψ)\Lambda \sim \mathcal W_D(\nu, \Psi)D × Dre×reD \times DνΨνΨ\nu \Psiνν\numi( log| Λ | )mi(log⁡|Λ|)E(\log |\Lambda|)| Λ ||Λ||\Lambda| Odpowiedziałem trochę na google i otrzymałem sprzeczne informacje. W niniejszym …

2
Czy klasyfikacja GBM cierpi na niezrównoważone rozmiary klas?
Mam do czynienia z nadzorowanym problemem klasyfikacji binarnej. Chciałbym użyć pakietu GBM do sklasyfikowania osób jako niezainfekowanych / zainfekowanych. Mam 15 razy więcej niezainfekowanych niż zainfekowanych osób. Zastanawiałem się, czy modele GBM cierpią w przypadku niezrównoważonych rozmiarów klas? Nie znalazłem żadnych referencji odpowiadających na to pytanie. Próbowałem skorygować wagi, przypisując …

2
Miary heteroscedastyczności reszt
Ten link do Wikipedii zawiera szereg technik wykrywania heteroscedastyczności resztek OLS. Chciałbym dowiedzieć się, która praktyczna technika jest bardziej skuteczna w wykrywaniu regionów dotkniętych heteroscedastycznością. Na przykład tutaj centralny obszar wykresu OLS „Resztki vs Dopasowane” ma większą wariancję niż boki wykresu (w rzeczywistości nie jestem do końca pewien, ale załóżmy, …

1
Proces Gaussa: właściwości aproksymacji funkcji
Uczę się o procesie Gaussa i słyszałem tylko fragmenty. Byłbym wdzięczny za komentarze i odpowiedzi. Czy w przypadku dowolnego zestawu danych prawdą jest, że aproksymacja funkcji procesu Gaussa dałaby zero lub pomijalny błąd dopasowania w punktach danych? W innym miejscu słyszałem również, że proces Gaussa jest szczególnie dobry w przypadku …

2
Co to jest struktura R struktura G w glmm?
MCMCglmmOstatnio korzystam z pakietu. Jestem zdezorientowany tym, co w dokumentacji nazywane jest strukturą R i strukturą G. Wydaje się, że odnoszą się one do efektów losowych - w szczególności określają parametry wcześniejszego rozkładu na nich, ale dyskusja w dokumentacji wydaje się zakładać, że czytelnik wie, jakie są te warunki. Na …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.