Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Szkolenie podstawowego pola losowego Markowa do klasyfikowania pikseli na obrazie
Próbuję nauczyć się korzystać z losowych pól Markowa do segmentowania regionów na obrazie. Nie rozumiem niektórych parametrów w MRF ani tego, dlaczego maksymalizacja oczekiwań, którą wykonuję, czasami nie jest zbieżna z rozwiązaniem. Zaczynając od twierdzenia Bayesa, mam , gdzie y jest wartością skali szarości piksela, a x jest etykietą klasy. …

4
Oczekiwana wartość mediany próbki na podstawie średniej próbki
Niech oznacza medianę i niech oznacza średnią losowej próbki o wielkości z rozkładu, który jest . Jak obliczyć E (Y | \ bar {X} = \ bar {x}) ?YYYˉXX¯\bar{X}n=2k+1n=2k+1n=2k+1N(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)E(Y|ˉX=ˉx)E(Y|X¯=x¯)E(Y|\bar{X}=\bar{x}) Intuicyjnie, ze względu na założenie normalności, sensowne jest twierdzenie, że E(Y|ˉX=ˉx)=ˉxE(Y|X¯=x¯)=x¯E(Y|\bar{X}=\bar{x})=\bar{x} i rzeczywiście jest to poprawna odpowiedź. Czy można to jednak …

4
W co wierzyć: test Kołmogorowa-Smirnowa czy wykres QQ?
Próbuję ustalić, czy mój zestaw danych ciągłych danych jest zgodny z rozkładem gamma o parametrach kształt 1,7 i szybkość ======= 0,000063. Problem polega na tym, gdy używam R do utworzenia wykresu QQ mojego zestawu danych xxx względem teoretycznego rozkładu gamma (1,7, 0,000063), otrzymuję wykres, który pokazuje, że dane empiryczne w …

1
Wystarczające problemy statystyczne, specyficzne / intuicyjne
Uczę się statystyk dla zabawy i mam pewne wątpliwości co do wystarczających statystyk . Moje zamieszanie napiszę w formie listy: Jeśli rozkład ma parametrów, to czy będzie miał wystarczających statystyk?nnnnnnn Czy istnieje jakakolwiek bezpośrednia zgodność między wystarczającymi statystykami a parametrami? Czy też wystarczające statystyki służą po prostu jako pula „informacji”, …


2
Pokazywanie korelacji przestrzennej i czasowej na mapach
Mam dane dla sieci stacji pogodowych w Stanach Zjednoczonych. To daje mi ramkę danych, która zawiera datę, szerokość, długość i pewną zmierzoną wartość. Załóżmy, że dane są gromadzone raz dziennie i zależą od pogody w skali regionalnej (nie, nie będziemy wchodzić w tę dyskusję). Chciałbym pokazać graficznie, jak jednocześnie mierzone …



2
Jednej klasy SVM vs. przykładowa SVM
Rozumiem, że jednoklasowe maszyny SVM (OSVM) zostały zaproponowane z myślą o braku negatywnych danych i że starają się znaleźć granice decyzji oddzielające zbiór dodatni i niektóre negatywne punkty kotwiczenia, mówią pochodzenie. W pracy z 2011 r. Zaproponowano przykładowe maszyny SVM (ESVM), które uczą „pojedynczego klasyfikatora według kategorii”, który twierdzi, że …

4
Czy istnieje prawo, które mówi, że jeśli wykonasz wystarczającą liczbę prób, zdarzają się rzadkie rzeczy?
Próbuję nakręcić film o załadowanych kostkach, aw pewnym momencie rzucamy około 200 kostkami, bierzemy wszystkie szóstki, rzucamy je ponownie i bierzemy wszystkie szóstki i rzucamy je po raz trzeci. Mieliśmy jedną kostkę, która wypadła 6 razy trzy razy z rzędu, co oczywiście nie jest niczym niezwykłym, ponieważ powinna istnieć 1/216 …

3
Kompozycja Cholesky'ego i eigend do rysowania próbek z wielowymiarowego rozkładu normalnego
Chciałbym narysować próbkę . Wikipedia sugeruje albo stosując Cholesky'iego lub Eigendecomposition , tj i x ∼N( 0 , Σ )x∼N.(0,Σ)\mathbf{x} \sim N\left(\mathbf{0}, \mathbf{\Sigma} \right)Σ =D1DT1Σ=D1re1T. \mathbf{\Sigma} = \mathbf{D}_1\mathbf{D}_1^T Σ = Q Λ QT.Σ=QΛQT. \mathbf{\Sigma} = \mathbf{Q}\mathbf{\Lambda}\mathbf{Q}^T Stąd przykład można pobrać za pomocą: lub gdzie \ mathbf {v} \ sim N …

3
Jak podzielić r-kwadrat między zmienne predykcyjne w regresji wielokrotnej?
Właśnie przeczytałem artykuł, w którym autorzy przeprowadzili regresję wielokrotną z dwoma predyktorami. Ogólna wartość r-kwadrat wynosiła 0,65. Dostarczyły tabelę, która dzieli r-kwadrat między dwa predyktory. Stół wyglądał tak: rsquared beta df pvalue whole model 0.65 NA 2, 9 0.008 predictor 1 0.38 1.01 1, 10 0.002 predictor 2 0.27 0.65 …

1
Dlaczego kontrolowanie FDR jest mniej rygorystyczne niż kontrolowanie FWER?
Czytałem, że kontrolowanie FDR jest mniej rygorystyczne niż kontrolowanie FWER, na przykład w Wikipedii : Procedury kontrolujące FDR mają mniej rygorystyczną kontrolę nad fałszywym wykrywaniem w porównaniu z procedurami rodzinnego wskaźnika błędów (FWER) (takimi jak korekta Bonferroniego). Zwiększa to moc kosztem zwiększenia częstości błędów typu I, tj. Odrzucenia hipotezy zerowej …

2
Pomyłka z rozszerzonym testem Dickeya Fullera
Ja pracuje na danych przedstawionych electricitydostępny w pakiecie R TSA. Moim celem jest sprawdzenie, czy arimamodel będzie odpowiedni dla tych danych i ostatecznie je dopasuje. Postępowałem więc następująco: 1. Wykreśl szereg czasowy, który powstał, jeśli następujący wykres: 2.: Chciałem wziąć logarytm, electricityaby ustabilizować wariancję, a następnie odpowiednio różnicować szereg, ale …

3
Sprawdź, czy zmienne mają ten sam rozkład
Jeśli chcesz sprawdzić, czy dwie zmienne mają ten sam rozkład, czy dobrym pomysłem byłoby posortowanie obu zmiennych, a następnie sprawdzenie ich korelacji? Jeśli jest wysoki (co najmniej 0,9?), Wówczas zmienne najprawdopodobniej pochodzą z tego samego rozkładu. Z rozkładem tutaj rozumiem „normalny”, „chi-kwadrat”, „gamma” itp.

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.