Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Symulowanie wycieczki Browna przy użyciu mostu Browna?
Chciałbym zasymulować proces wycieczki Browna (ruch Browna, który jest warunkowany, zawsze jest dodatni, gdy do przy ). Ponieważ proces wycieczki Browna jest mostem Browna, który jest uwarunkowany, aby zawsze był dodatni, miałem nadzieję symulować ruch wycieczki Browna za pomocą mostu Browna.0 t = 10 < t < 10<t<10 \lt t …

1
Ogólna wartość p i p-wartości parami?
ogólny model liniowy których prawdopodobieństwo dziennika wynosi .y= β0+ β1x1+ β2)x2)+ β3)x3),y=β0+β1x1+β2x2+β3x3,y=\beta_0+\beta_1x_1+\beta_2x_2+\beta_3x_3,L.uLuL_u Teraz chcę sprawdzić, czy współczynniki są takie same. Po pierwsze, ogólny test: prawdopodobieństwo dziennika zredukowanego modelu wynosi . W teście ilorazu wiarygodności pełny model jest znacznie lepszy niż zredukowany przy .L r p = 0,02y= β0+ β1⋅ ( …

2
Dlaczego Ograniczone maksymalne prawdopodobieństwo daje lepsze (obiektywne) oszacowanie wariancji?
Czytam artykuł teoretyczny Douga Batesa o pakiecie R4, aby lepiej zrozumieć drobiazgowość mieszanych modeli, i natknąłem się na intrygujący wynik, który chciałbym lepiej zrozumieć, o zastosowaniu ograniczonego maksymalnego prawdopodobieństwa (REML) do oszacowania wariancji . W części 3.3 dotyczącej kryterium REML stwierdza, że ​​zastosowanie REML do oszacowania wariancji jest ściśle związane …

1
Do jakiego rodzaju wyboru funkcji można zastosować test Chi kwadrat?
Tutaj pytam o to, co inni często robią, aby użyć testu chi-kwadrat do wyboru funkcji w wyniku uczenia się nadzorowanego. Jeśli dobrze rozumiem, czy testują niezależność między każdą cechą a wynikiem i porównują wartości p między testami dla każdej cechy? W http://en.wikipedia.org/wiki/Pearson%27s_chi-squared_test , Test chi-kwadrat Pearsona jest testem statystycznym stosowanym …

2
Dlaczego zgłaszanie przedziałów ufności dla median jest tak rzadkie?
Dlaczego tak rzadko zdarza się znaleźć przedziały ufności zgłaszane w artykułach z nauk stosowanych? Zajmuję się głównie informatyką, ale często czytam artykuły z psychologii (socjologii), socjologii i urbanistyki. Nie mogę sobie przypomnieć, że widziałem CI dla zgłoszonej mediany. Jednocześnie, badając przedziały ufności i tym podobne, stało się dla mnie oczywiste, …


2
uzyskiwanie stopni swobody od lmer
Dopasowałem lmer model z następującymi (aczkolwiek wymyślonymi danymi wyjściowymi): Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 Naprawdę chciałbym zbudować przedział ufności dla każdego efektu, używając następującej formuły: ( n - 1 ) s2)χ2)α / 2 , n - 1, ( n - 1 ) …

2
Wyprowadzenie tylnej części normalnego życzenia
Pracuję nad wyprowadzeniem tylnej normalnej części życzeń, ale utknąłem przy jednym z parametrów (tylnej matrycy skali, patrz na dole). Tylko dla kontekstu i kompletności, oto model i pozostałe pochodne: xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ \boldsymbol{\Lambda} &\sim \mathcal{W}(\upsilon_0, \mathbf{W}_0) \end{align} Rozszerzone formy każdego z trzech czynników …

1
próg obliczeniowy dla minimalnego klasyfikatora ryzyka?
Załóżmy, że dwie klasy i mają atrybut i mają rozkład i . jeśli mamy równe wcześniejsze dla następującej macierzy kosztów:C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} dlaczego jest progiem dla minimalnego klasyfikatora ryzyka (kosztu)?x0&lt;0.5x0&lt;0.5x_0 < 0.5 Oto mój przykład notatki, …

1
Model z efektem mieszanym i zmienną próbkowania
Próbuję określić wzór dla liniowego modelu mieszanego efektu (z lme4) dla mojego projektu eksperymentalnego, ale nie jestem pewien, czy robię to dobrze. Projekt: w zasadzie mierzę parametr odpowiedzi na roślinach. Mam 4 poziomy leczenia i 2 poziomy nawadniania. Rośliny są pogrupowane na 16 poletek, w ramach każdego poletka próbuję 4 …

3
„Odwrócony” Shapiro – Wilk
Test Sharipo-Wilka, według wikipedii , testuje hipotezę zerową ( ) „Populacja jest normalnie rozmieszczona”.H0H0H_0 Szukam podobnego testu normalności z H0H0H_0 „Populacja nie jest normalnie rozmieszczona”. Po takim teście chcę obliczyć wartość ppp aby odrzucić H0H0H_0 na poziomie istotności αα\alpha iff p&lt;αp&lt;αp < \alpha ; udowadniając, że moja populacja jest normalnie …

3
Jak przeprowadzić analizę czynnikową, gdy macierz kowariancji nie jest pozytywnie określona?
Mam zestaw danych, który składa się z 717 obserwacji (wierszy), które są opisane przez 33 zmienne (kolumny). Dane są standaryzowane przez punktację Z wszystkich zmiennych. Żadne dwie zmienne nie są liniowo zależne ( ). Usunąłem również wszystkie zmienne o bardzo niskiej wariancji (mniej niż ). Poniższy rysunek pokazuje odpowiednią macierz …

1
Jak wybrać najlepsze dopasowanie bez nadmiernego dopasowania danych? Modelowanie rozkładu bimodalnego za pomocą N normalnych funkcji itp
Mam oczywiście bimodalny rozkład wartości, który staram się dopasować. Dane mogą być dobrze dopasowane do 2 normalnych funkcji (bimodalnych) lub 3 normalnych funkcji. Ponadto istnieje prawdopodobny fizyczny powód dopasowania danych do 3. Im więcej parametrów zostanie wprowadzonych, tym lepsze będzie dopasowanie, ponieważ przy wystarczającej liczbie stałych można „ dopasować słonia …


1
Jak interpretować dane wyjściowe lawy?
Próbuję użyć potwierdzającej analizy czynnikowej (CFA) lavaan. Trudno mi interpretować wyniki uzyskane przez lavaan. Mam prosty model - po 4 czynniki wspierane przez przedmioty z zebranych danych z ankiety. Czynniki są zgodne z tym, co jest mierzone przez pozycje, w zakresie, w jakim wydaje się prawdopodobne, że mogłyby one służyć …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.