Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Obliczanie przedziałów ufności za pomocą paska startowego na podstawie obserwacji zależnych
Pasek startowy, w standardowej formie, może być używany do obliczania przedziałów ufności szacunkowych statystyk, pod warunkiem, że obserwacje są identyczne. I. Visser i in. w „ Przedziałach ufności dla parametrów ukrytego modelu Markowa ” wykorzystano parametryczny bootstrap do obliczenia CI dla parametrów HMM. Jednak, gdy dopasowujemy HMM do sekwencji obserwacji, …

2
Rysowanie wielu wykresów słupkowych na wykresie w R [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 4 lata temu . Chciałbym narysować cztery wykresy słupkowe na jednym wykresie w R. Użyłem następującego kodu. Tutaj, jak utrzymać legendę na wykresie, w szczególności …

1
Definiowanie kwantyli na podstawie ważonej próbki
Mam ważoną próbkę, dla której chcę obliczyć kwantyle. 1 Najlepiej, przy czym masy są takie same (zarówno = 1 lub inaczej), wyniki mogą być zgodne z tymi, scipy.stats.scoreatpercentile()i R: quantile(...,type=7). Jednym prostym podejściem byłoby „pomnożenie” próbki przy użyciu podanych wag. To skutecznie daje lokalnie „płaski” plik pdf w obszarach wagi> …

2
Jak określić konkretne kontrasty dla ANOVA z powtarzanymi pomiarami za pomocą samochodu?
Próbuję uruchomić powtarzane miary Anova w R, a następnie pewne specyficzne kontrasty dla tego zestawu danych. Myślę, że właściwym podejściem byłoby skorzystanie Anova()z pakietu samochodowego. Zilustrujmy moje pytanie na przykładzie zaczerpniętym z ?Anovaużycia OBrienKaiserdanych (uwaga: odrzuciłem czynnik płci z przykładu): Mamy wzór z jednym czynnikiem między podmiotami, leczeniem (3 poziomy: …

9
Książka dla szerokiego i koncepcyjnego przeglądu metod statystycznych
Jestem bardzo zainteresowany potencjałem analizy statystycznej do symulacji / prognozowania / szacowania funkcji itp. Jednak niewiele wiem na ten temat, a moja wiedza matematyczna jest wciąż dość ograniczona - jestem młodym studentem inżynierii oprogramowania. Szukam książki, w której zacznę od pewnych rzeczy, o których wciąż czytam: regresji liniowej i innych …

2
Co maksymalizują pierwsze
W analizie głównych składników pierwsze głównych składników to k ortogonalne kierunki o maksymalnej wariancji. Innymi słowy, pierwszy główny składnik jest wybrany jako kierunek maksymalnej wariancji, drugi główny składnik jest wybrany jako kierunek ortogonalny do pierwszego z maksymalną wariancją i tak dalej.kkkkkk Czy istnieje podobna interpretacja analizy czynnikowej? Na przykład myślę, …



3
Co zyskam, jeśli uznam wynik za porządkowy zamiast kategoryczny?
Istnieją różne metody przewidywania zmiennych porządkowych i kategorialnych. Nie rozumiem, jak ważne jest to rozróżnienie. Czy istnieje prosty przykład, który może wyjaśnić, co się stanie, jeśli złożę zamówienie? W jakich okolicznościach to nie ma znaczenia? Na przykład, jeśli wszystkie zmienne niezależne również są kategoryczne / porządkowe, czy byłaby różnica? To …

1
Przykładowa formuła wielkości dla testu F?
Zastanawiam się, czy istnieje wzór wielkości próby taki jak wzór Lehra, który ma zastosowanie do testu F. Wzór Lehra dla testów t to , gdzie to wielkość efektu ( np. ). Można to uogólnić na gdzie jest stałą, która zależy od szybkości typu I, pożądanej mocy i tego, czy wykonuje …


2
Grupowanie danych przestrzennych w R.
Mam zestaw danych miesięcznych dotyczących temperatury powierzchni morza (SST) i chcę zastosować metodologię klastrową do wykrywania regionów o podobnych wzorcach SST. Mam zestaw miesięcznych plików danych od 1985 do 2009 roku i chcę zastosować klastrowanie do każdego miesiąca jako pierwszy krok. Każdy plik zawiera dane siatkowe dla 358416 punktów, z …
12 r  clustering  spatial 


1
Warunkowa homoskedastyczność vs. heteroskedastyczność
Z ekonometrii , autor: Fumio Hayashi (rozdział 1): Bezwarunkowa homoskedastyczność: Drugi moment wyrażenia błędu E (εᵢ²) jest stały we wszystkich obserwacjach Forma funkcjonalna E (εᵢ² | xi) jest stała we wszystkich obserwacjach Warunkowa homoskedastyczność: Zniesiono ograniczenie, że drugi moment składników błędu E (εᵢ²) jest stały w obserwacjach Zatem warunkowy drugi …

2
Znalezienie precyzji oszacowania symulacji Monte Carlo
tło Projektuję symulację Monte Carlo, która łączy dane wyjściowe serii modeli i chcę mieć pewność, że symulacja pozwoli mi wysunąć uzasadnione twierdzenia dotyczące prawdopodobieństwa symulowanego wyniku i dokładności tego oszacowania prawdopodobieństwa. Symulacja pozwoli ustalić prawdopodobieństwo, że ława przysięgłych z określonej społeczności skaza określonego oskarżonego. Oto kroki symulacji: Korzystając z istniejących …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.