Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Łączenie informacji o szeregach czasowych ze źródeł o wielu rozdzielczościach / skalach przestrzennych
Mam wiele satelitarnych obrazów rastrowych dostępnych z różnych czujników. Z nich grubsze mają bardzo dużą rozdzielczość czasową. Rastry o średniej rozdzielczości mają zwykle mniej dat akwizycji, ale nadal dostępny jest pewien stopień informacji. Te o lepszej rozdzielczości mają bardzo niską rozdzielczość czasową, obejmującą od 2 do 6 dat zaobserwowanych w …

1
Sprawdź, czy dwie próbki rozkładów dwumianowych są zgodne z tym samym p
Załóżmy, że zrobiłem: n1n1n_1 niezależne próby o nieznanym wskaźniku powodzenia p1p1p_1 i zaobserwowano k1k1k_1 sukcesy. n2n2n_2 niezależne próby o nieznanym wskaźniku powodzenia p2p2p_2 i zaobserwowano k2k2k_2 sukcesy. Jeśli teraz p1=p2=:pp1=p2=:pp_1 = p_2 =: p ale wciąż nieznane, prawdopodobieństwo p(k2)p(k2)p(k_2) obserwować k2k2k_2 dla danego k1k1k_1(lub odwrotnie) jest proporcjonalny do , więc …


2
Wskaźnik stabilności populacji - podział przez zero
Wskaźnik stabilności populacji określa ilościowo zmianę rozkładu zmiennej poprzez porównanie próbek danych w dwóch przedziałach czasowych. Jest bardzo często używany do mierzenia przesunięć w wynikach. Oblicza się go w następujący sposób: 1) Próbka z okresu bazowego jest dyskretyzowana. Zwykle dzieli się go na decyle 2) Próbka z okresu docelowego jest …

1
Współczynniki korelacji dla uporządkowanych danych: Tau Kendalla vs Polichoric vs rho Spearmana
Wydaje się, że w przypadku zarządzania zamówionymi pomiarami badacze zwykle zajmują się korelacją polichoryczną . (Na przykład do wykonania matrycy przed wykonaniem analizy czynnikowej.) Dlaczego tak? Współczynnik korelacji rang Kendalla Tau i współczynnik korelacji rang Spearmana są również odpowiednie dla uporządkowanych danych. Wszelkie punkty „pro” i „contra” za te współczynniki …

1
Formuła bezwładności grupowania w scikit learn
Chciałbym zakodować klastry kmeans w pythonie przy użyciu pand i scikit learning. Aby wybrać dobre k, chciałbym zakodować statystykę luk z Tibshirani i in. 2001 ( pdf ). Chciałbym wiedzieć, czy mogę użyć wyniku bezwładności scikit i dostosować formułę statystyki szczeliny bez konieczności przekodowywania wszystkich obliczeń odległości. Czy ktoś zna …

1
Oczekiwana wartość minimalnej statystyki zamówienia z próbki normalnej
AKTUALIZACJA 25 stycznia 2014: błąd został teraz naprawiony. Zignoruj ​​obliczone wartości oczekiwanej wartości w przesłanym obrazie - są one nieprawidłowe - nie usuwam obrazu, ponieważ wygenerował on odpowiedź na to pytanie. AKTUALIZACJA 10 stycznia 2014: znaleziono błąd - literówkę matematyczną w jednym ze źródeł. Przygotowanie korekty ... Gęstość statystyki minimalnego …

1
R: Anova i regresja liniowa
Jestem nowy w statystyce i staram się zrozumieć różnicę między ANOVA a regresją liniową. Używam R. do zbadania tego. Czytałem różne artykuły o tym, dlaczego ANOVA i regresja są różne, ale wciąż takie same, i jak można to wizualizować itp. Myślę, że jestem tam dość, ale wciąż brakuje jednego bitu. …
9 r  regression  anova 

2
Korelacja między kategoriami między jakościowymi zmiennymi nominalnymi
Mam zestaw danych z dwiema kategorycznymi zmiennymi nominalnymi (obie z 5 kategoriami). Chciałbym wiedzieć, czy (i jak) jestem w stanie zidentyfikować potencjalne korelacje między kategoriami na podstawie tych dwóch zmiennych. Innymi słowy, czy na przykład wyniki kategorii w zmiennej 1 wykazują silną korelację z określoną kategorią zmiennej 2. Ponieważ mam …

2
Wariancja średniej próbki próbki ładowania początkowego
Niech będą odrębnymi obserwacjami (bez powiązań). Niech oznacza próbkę bootstrap (próbka z empirycznego CDF) i niech . Znajdź i .X1,...,XnX1,...,XnX_{1},...,X_{n}X∗1,...,X∗nX1∗,...,Xn∗X_{1}^{*},...,X_{n}^{*}X¯∗n=1n∑ni=1X∗iX¯n∗=1n∑i=1nXi∗\bar{X}_{n}^{*}=\frac{1}{n}\sum_{i=1}^{n}X_{i}^{*}E(X¯∗n)E(X¯n∗)E(\bar{X}_{n}^{*})Var(X¯∗n)Var(X¯n∗)\mathrm{Var}(\bar{X}_{n}^{*}) Do tej pory mam to, że to każdy z prawdopodobieństwem więc i co daje X∗iXi∗X_{i}^{*}X1,...,XnX1,...,XnX_{1},...,X_{n}1n1n\frac{1}{n}E(X∗i)=1nE(X1)+...+1nE(Xn)=nμn=μE(Xi∗)=1nE(X1)+...+1nE(Xn)=nμn=μ E(X_{i}^{*})=\frac{1}{n}E(X_{1})+...+\frac{1}{n}E(X_{n})=\frac{n\mu}{n}=\mu E(X∗2i)=1nE(X21)+...+1nE(X2n)=n(μ2+σ2)n=μ2+σ2,E(Xi∗2)=1nE(X12)+...+1nE(Xn2)=n(μ2+σ2)n=μ2+σ2,E(X_{i}^{*2})=\frac{1}{n}E(X_{1}^{2})+...+\frac{1}{n}E(X_{n}^{2})=\frac{n(\mu^{2}+\sigma^{2})}{n}=\mu^{2}+\sigma^{2}\>, Var(X∗i)=E(X∗2i)−(E(X∗i))2=μ2+σ2−μ2=σ2.Var(Xi∗)=E(Xi∗2)−(E(Xi∗))2=μ2+σ2−μ2=σ2. \mathrm{Var}(X_{i}^{*})=E(X_{i}^{*2})-(E(X_{i}^{*}))^{2}=\mu^{2}+\sigma^{2}-\mu^{2}=\sigma^{2} \>. Następnie and od ' są niezależne. To dajeE(X¯∗n)=E(1n∑i=1nX∗i)=1n∑i=1nE(X∗i)=nμn=μE(X¯n∗)=E(1n∑i=1nXi∗)=1n∑i=1nE(Xi∗)=nμn=μE(\bar{X}_{n}^{*})=E(\frac{1}{n}\sum_{i=1}^{n}X_{i}^{*})=\frac{1}{n}\sum_{i=1}^{n}E(X_{i}^{*})=\frac{n\mu}{n}=\mu Var(X¯∗n)=Var(1n∑i=1nX∗i)=1n2∑i=1nVar(X∗i)Var(X¯n∗)=Var(1n∑i=1nXi∗)=1n2∑i=1nVar(Xi∗) \mathrm{Var}(\bar{X}_{n}^{*})=\mathrm{Var}(\frac{1}{n}\sum_{i=1}^{n}X_{i}^{*})=\frac{1}{n^{2}}\sum_{i=1}^{n}\mathrm{Var}(X_{i}^{*})X∗iXi∗X_{i}^{*}Var(X¯∗n)=nσ2n2=σ2nVar(X¯n∗)=nσ2n2=σ2n\mathrm{Var}(\bar{X}_{n}^{*})=\frac{n\sigma^{2}}{n^{2}}=\frac{\sigma^{2}}{n} …

4
Lasso porządkuje opóźnienie?
Załóżmy, że mam dane podłużne postaci (Mam wiele obserwacji, to tylko forma jednego). Interesują mnie ograniczenia dotyczące . Nieograniczony jest równoważny z wzięciem z .Y =(Y1, ... ,Yjot) ∼ N( μ , Σ )Y=(Y1,…,YJ)∼N(μ,Σ)\mathbf Y = (Y_1, \ldots, Y_J) \sim \mathcal N(\mu, \Sigma)ΣΣ\SigmaΣΣ\SigmaYjot=αjot+∑ℓ = 1j - 1ϕℓ jYj - ℓ+εjotYj=αj+∑ℓ=1j−1ϕℓjYj−ℓ+εj …

1
Współczynnik korelacji między dwiema tablicami punktów 2D?
Mam dwie tablice punktów 2D i muszę oszacować ich korelację. Jakiej formuły powinienem użyć? Przykład tablic: X:((1,5),(2,5),(1,7),(4,1)),X:((1,5),(2,5),(1,7),(4,1)),X: ((1,5),(2,5),(1,7),(4,1)), Y:((3,4),(1,6),(4,6),(4,3)).Y:((3,4),(1,6),(4,6),(4,3)).Y: ((3,4),(1,6),(4,6),(4,3)).

2
Oczekiwanie ilorazu sum zmiennych losowych IID (arkusz Cambridge University)
Przygotowuję się do rozmowy kwalifikacyjnej, która wymaga przyzwoitej wiedzy na temat podstawowego prawdopodobieństwa (przynajmniej aby przejść przez sam wywiad). Pracuję nad poniższym arkuszem z moich dni studenckich jako wersją. W większości było to dość proste, ale jestem całkowicie zaskoczony pytaniem 12. http://www.trin.cam.ac.uk/dpk10/IA/exsheet2.pdf Każda pomoc będzie mile widziana. Edycja: pytanie brzmi: …

2
Trzy otwarte problemy filozoficzne w statystyce
Niedawno skończyłem czytać The Lady Tasting Tea , zabawną książkę o historii statystyki. Na końcu książki autor David Salsburg proponuje trzy otwarte problemy filozoficzne w statystyce, a rozwiązania, które jego zdaniem miałyby większe implikacje dla zastosowania teorii statystycznej w nauce. Nigdy wcześniej nie słyszałem o tych problemach, dlatego interesują mnie …

3
Ocena mocy testu normalności (w R)
Chcę ocenić dokładność testów normalności dla różnych wielkości próbek w R (zdaję sobie sprawę, że testy normalności mogą być mylące ). Na przykład, aby spojrzeć na test Shapiro-Wilka, przeprowadzam następującą symulację (a także sporządzam wyniki) i oczekuję, że wraz ze wzrostem wielkości próby maleje prawdopodobieństwo odrzucenia wartości zerowej: n <- …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.