Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


6
Czym byłby solidny model bayesowski do szacowania skali mniej więcej normalnego rozkładu?
Istnieje wiele niezawodnych estymatorów skali . Godnym uwagi przykładem jest mediana bezwzględnego odchylenia, które odnosi się do odchylenia standardowego jako σ=MAD⋅1.4826σ=MAD⋅1.4826\sigma = \mathrm{MAD}\cdot1.4826 . W ramach bayesowskich istnieje wiele sposobów dokładnego oszacowania lokalizacji mniej więcej normalnej dystrybucji (powiedzmy normalnej zanieczyszczonej wartościami odstającymi), na przykład można założyć, że dane są dystrybuowane …

2
Jak znaleźć przedziały ufności dla ocen?
„ Jak nie sortować według średniej oceny ” Evana Millera proponuje użycie dolnej granicy przedziału ufności, aby uzyskać sensowny łączny „wynik” dla ocenianych pozycji. Działa jednak z modelem Bernoulli: oceny są albo kciuki w górę, albo kciuki w dół. Jaki rozsądny przedział ufności należy zastosować dla modelu oceny, który przypisuje …

3
Jak obliczyć wariancję zbiorczą dwóch lub więcej grup, biorąc pod uwagę znane wariancje grup, średnie i wielkości próbek?
Powiedzmy, że istnieje m+nm+nm+n elementów podzielonych na dwie grupy ( i ). Wariancja pierwszej grupy to a wariancja drugiej grupy to . Zakłada się, że same elementy są nieznane, ale znam środki i .mmmnnnσ2mσm2\sigma_m^2σ2nσn2\sigma^2_nμmμm\mu_mμnμn\mu_n Czy istnieje sposób obliczenia łącznej wariancji ?σ2(m+n)σ(m+n)2\sigma^2_{(m+n)} Wariancja nie musi być obiektywna, więc mianownik to a …
32 variance  pooling 


7
Czy istnieją algorytmy obliczania „działających” parametrów regresji liniowej lub logistycznej?
Artykuł „Dokładne obliczanie wariancji biegu” na stronie http://www.johndcook.com/standard_deviation.html pokazuje, jak obliczyć średnią biegu, wariancję i odchylenia standardowe. Czy istnieją algorytmy, w których parametry modelu regresji liniowej lub logistycznej mogą być podobnie „dynamicznie” aktualizowane w miarę dostarczania każdego nowego rekordu szkolenia?

4
ANOVA dotycząca danych dwumianowych
Analizuję eksperymentalny zestaw danych. Dane składają się ze sparowanego wektora rodzaju leczenia i wyniku dwumianowego: Treatment Outcome A 1 B 0 C 0 D 1 A 0 ... W kolumnie wyników 1 oznacza sukces, a 0 oznacza niepowodzenie. Chciałbym dowiedzieć się, czy leczenie znacząco zmienia wynik. Istnieją 4 różne zabiegi, …

1
Odchylenie od sumy przewidywanych wartości z modelu efektu mieszanego na szeregu czasowym
Mam model mieszanego efektu (w rzeczywistości uogólniony model mieszany dodatku), który daje mi prognozy dla szeregów czasowych. Aby przeciwdziałać autokorelacji, używam modelu corCAR1, biorąc pod uwagę fakt, że brakuje mi danych. Dane powinny dać mi całkowite obciążenie, więc muszę sumować przez cały przedział prognozowania. Ale powinienem również uzyskać oszacowanie błędu …

12
Jaka jest najtrudniejsza koncepcja statystyczna do zrozumienia?
To pytanie jest podobne do pytania tutaj , ale myślę, że na tyle różne, że warto je zadać. Pomyślałem, że postawię na początek, co moim zdaniem jest najtrudniejsze do zrozumienia. Mój jest różnicą między prawdopodobieństwem a częstotliwością . Jeden jest na poziomie „wiedzy o rzeczywistości” (prawdopodobieństwo), a drugi na poziomie …
32 teaching 

2
Czy istnieje przykładowa wersja jednostronnej nierówności Czebyszewa?
Interesuje mnie następująca jednostronna wersja nierówności Czebyszewa Cantellego : P(X−E(X)≥t)≤Var(X)Var(X)+t2.P(X−E(X)≥t)≤Var(X)Var(X)+t2. \mathbb P(X - \mathbb E (X) \geq t) \leq \frac{\mathrm{Var}(X)}{\mathrm{Var}(X) + t^2} \,. Zasadniczo, jeśli znasz średnią populacji i wariancję, możesz obliczyć górną granicę prawdopodobieństwa zaobserwowania określonej wartości. (Tak przynajmniej rozumiałem.) Chciałbym jednak użyć średniej próby i wariancji próbki zamiast …


3
Jak narysować czyste wielokąty wokół regionów wykresu rozrzutu w ggplot2 [zamknięte]
Jak dodać zgrabny wielokąt wokół grupy punktów na wykresie rozrzutu? Korzystam z ggplot2, ale jestem rozczarowany wynikami geom_polygon. Zestaw danych jest tam , jako plik tekstowy rozdzielany tabulatorami. Poniższy wykres pokazuje dwie miary postaw wobec zdrowia i bezrobocia w wielu krajach: Chciałbym przejść z geom_density2dmniej fantazyjnych, ale bardziej empirycznych geom_polygon. …


5
Modelowanie danych podłużnych, w których wpływ czasu zmienia się w formie funkcjonalnej między poszczególnymi osobami
Kontekst : Wyobraź sobie, że miałeś badanie podłużne, w którym mierzono zmienną zależną (DV) raz w tygodniu przez 20 tygodni na 200 uczestnikach. Chociaż ogólnie interesuje mnie, typowe DV, o których myślę, obejmują wyniki pracy po zatrudnieniu lub różne środki dobrostanu po interwencji psychologii klinicznej. Wiem, że modelowanie wielopoziomowe może …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.