Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy stopnie swobody w lmerTest :: anova są poprawne? Różnią się bardzo od RM-ANOVA
Analizuję wyniki eksperymentu czasu reakcji w R. Przeprowadziłem ANOVA z powtarzanymi pomiarami (1 czynnik wewnątrz podmiotu z 2 poziomami i 1 czynnik między podmiotem z 2 poziomami). Uruchomiłem podobny liniowy model mieszany i chciałem podsumować wyniki lmera w formie tabeli ANOVA lmerTest::anova. Nie zrozumcie mnie źle: nie spodziewałem się identycznych …

1
Jaki rozkład ma maksymalną entropię dla znanego średniego bezwzględnego odchylenia?
Czytałem dyskusję w Hacker News na temat stosowania standardowego odchylenia w przeciwieństwie do innych wskaźników, takich jak średnie bezwzględne odchylenie. A więc, jeśli mielibyśmy przestrzegać zasady maksymalnej entropii, z jakiego rodzaju rozkładu korzystalibyśmy, gdybyśmy tylko znali średnią rozkładu i średnie bezwzględne odchylenie? Czy może bardziej sensowne jest zastosowanie mediany i …

3
W jaki sposób zmiana wagi danych z różnorodności w American Community Survey wpłynie na margines błędu?
Kontekst: Moja organizacja obecnie porównuje statystyki dotyczące różnorodności siły roboczej (np.% Osób niepełnosprawnych,% kobiet,% weteranów) z całkowitą dostępnością siły roboczej dla tych grup na podstawie American Community Survey (projekt ankietowy przeprowadzony przez US Census Bureau). Jest to niedokładny punkt odniesienia, ponieważ mamy bardzo konkretny zestaw miejsc pracy, które mają inne …


4
Pomysł modelu mieszanego i metoda bayesowska
W modelu mieszanym zakładamy, że efekty losowe (parametry) są zmiennymi losowymi, które mają rozkład normalny. Wygląda bardzo podobnie do metody bayesowskiej, w której zakłada się, że wszystkie parametry są losowe. Czy zatem model efektu losowego jest rodzajem specjalnego przypadku metody bayesowskiej?

2
Odpowiednia miara, aby znaleźć najmniejszą macierz kowariancji
W podręczniku, który czytam, używają one pozytywnej definitywności (półdodatniej definitywności) do porównania dwóch macierzy kowariancji. Pomysł jest, że jeśli jest Pd następnie jest mniejsza niż . Ale walczę o intuicję tego związku?A - BA−BA-BbBBZAAA Istnieje podobny wątek tutaj: /math/239166/what-is-the-intuition-for-using-definiteness-to-compare-matrices Jaka jest intuicja używania definitywności do porównywania macierzy? Chociaż odpowiedzi są …

2
Czy planujesz statystyki podsumowujące ze średnimi, sd, min i max?
Pochodzę ze środowisk ekonomicznych i zazwyczaj w tej dyscyplinie statystyki podsumowujące zmienne są przedstawione w tabeli. Chciałbym je jednak nakreślić. Mógłbym zmodyfikować wykres pudełkowy, aby wyświetlał średnią, odchylenie standardowe, minimum i maksimum, ale nie chcę tego robić, ponieważ wykresy pudełkowe są tradycyjnie używane do wyświetlania median oraz Q1 i Q3. …

2
Sprawdź, czy ludzie rezygnują lub zmniejszają zakłady po powtarzających się stratach
Mam dane dotyczące serii wygranych i przegranych zakładów w 5 rundach zakładów z wyczerpaniem po każdej rundzie. Korzystam z drzewa decyzyjnego, takiego jak poniżej, do wyświetlania danych. Węzły w górnej części drzewa to te, które mają wygrane zakłady, a te w dolnej części drzewa mają serie przegranych zakładów. Chcę spojrzeć …

2
Solidne wnioskowanie o regresji i estymatory Sandwich
Czy możesz podać przykład użycia estymatorów wielowarstwowych w celu przeprowadzenia silnego wnioskowania o regresji? Widzę ten przykład ?sandwich, ale nie do końca rozumiem, jak możemy przejść od lm(a ~ b, data)( zakodowany r ) do oszacowania i wartości p wynikającej z modelu regresji z wykorzystaniem macierzy wariancji-kowariancji zwróconej przez funkcję …
10 r  regression  lm  sandwich 


2
Jak porównać średnią z dwóch próbek, których dane pasują do rozkładów wykładniczych
Mam dwie próbki danych, próbkę wyjściową i próbkę do leczenia. Hipoteza jest taka, że ​​próbka do leczenia ma wyższą średnią niż próbka wyjściowa. Obie próbki mają kształt wykładniczy. Ponieważ dane są dość duże, mam tylko średnią i liczbę elementów dla każdej próbki w momencie, w którym będę przeprowadzał test. Jak …

1
Szybka integracja z eCDF w R
Mam równania formy T.1( x ) = ∫x0sol( T1( y) ) d fa^n( y)T.1(x)=∫0xsol(T.1(y)) refa^n(y) T_1(x) = \int_0^x g(T_1(y)) \ d\hat{F}_n(y) w którym jest empiryczna ED i jest funkcją. Mam odwzorowanie skurczu, dlatego próbuję rozwiązać równanie całkowe za pomocą sekwencji twierdzeń Banacha o stałym punkcie.gfa^nfa^n\hat{F}_nsolsolg Jednak działa to bardzo wolno …

1
Czy istnieje jakiś „standard” dla zapisu modelu statystycznego?
Na przykład w podręczniku BUGS lub nadchodzącej książce Lee i Wagenmakers ( pdf ) oraz w wielu innych miejscach stosowany jest rodzaj zapisu, który wydaje mi się bardzo elastyczny, ponieważ można go użyć do zwięzłego opisu większości modeli statystycznych. Przykładem tego zapisu jest: yi∼Binomial(pi,ni)log(pi1−pi)=bibi∼Normal(μp,σp)yi∼Binomial(pi,ni)log⁡(pi1−pi)=bibi∼Normal(μp,σp) y_i \sim \text{Binomial}(p_i,n_i) \\ \log(\frac{p_i}{1 - …

4
Chcę pokazać
Niech będzie zmienną losową w przestrzeni prawdopodobieństwa żeX:Ω→NX:Ω→NX:\Omega \to \mathbb N(Ω,B,P)(Ω,B,P)(\Omega,\mathcal B,P)E(X)=∑n=1∞P(X≥n).E(X)=∑n=1∞P(X≥n).E(X)=\sum_{n=1}^\infty P(X\ge n). moja definicja z jest równa E(X)E(X)E(X)E(X)=∫ΩXdP.E(X)=∫ΩXdP.E(X)=\int_\Omega X \, dP. Dzięki.

2
dotyczące niezależności warunkowej i jej reprezentacji graficznej
Podczas studiowania doboru kowariancji przeczytałem kiedyś następujący przykład. W odniesieniu do następującego modelu: Macierz kowariancji i odwrotna macierz kowariancji podano w następujący sposób: I nie rozumiem, dlaczego niezależności i decyduje odwrotnym kowariancji tutaj?yxxxyyy Jaka jest matematyczna logika leżąca u podstaw tego związku? Ponadto, wykres po lewej stronie na poniższym rysunku …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.