Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Zgłaszanie stopni swobody dla testu t Welcha
Test t-Welch dla nierównych wariancji (znany również jako Welch-Satterthwaite lub Welch-Aspin) ogólnie ma niecałkowite stopnie swobody . Jak należy podawać te stopnie swobody przy zgłaszaniu wyników testu? „Konwencjonalne jest zaokrąglanie w dół do najbliższej liczby całkowitej przed sprawdzeniem standardowych tabel t” według różnych źródeł * - co ma sens, ponieważ …

1
Dlaczego definicja spójnego estymatora jest taka, jaka jest? Co z alternatywnymi definicjami spójności?
Cytat z wikipedii: W statystyce spójny estymator lub asymptotycznie spójny estymator jest estymatorem - regułą obliczania szacunków parametru mając właściwość, że wraz ze wzrostem liczby wykorzystywanych punktów danych w nieskończoność wzrasta wynikowa sekwencja estymacji z prawdopodobieństwem do .θ ∗θ∗θ∗θ^*θ∗θ∗θ^* Aby uczynić tę instrukcję precyzyjną, niech będzie wartością prawdziwego parametru, który …


1
Jak korzystać z metody delta, gdy pochodna pierwszego rzędu wynosi zero?
http://en.wikipedia.org/wiki/Delta_method W artykule w Wikipedii założono, że musi istnieć i że g ′ ( θ ) ma wartość niezerową. Czy można znaleźć rozkład asymptotyczny dla √g′(θ)g′(θ)g'(\theta)g′(θ)g′(θ)g'(\theta) biorąc pod uwagę, żeg′(θ)może wynosić zero, a √n−−√(g(Xn)−g(θ))n(g(Xn)−g(θ))\sqrt{n}(g(X_n)-g(\theta)) g′(θ)g′(θ)g'(\theta) ?n−−√(Xn−θ)→dN(0,σ2)n(Xn−θ)→dN(0,σ2)\sqrt{n}(X_n-\theta) \stackrel{d}{\rightarrow} N(0,\sigma^2)

3
Teoria odpowiedzi na pytanie a analiza czynnikowa potwierdzająca
Zastanawiałem się, jakie są podstawowe, znaczące różnice między Teorią Reakcji na Pozycję a Analizą Czynnika Potwierdzającego. Rozumiem, że istnieją różnice w obliczeniach (bardziej skupiając się na elemencie vs. kowariancje; log-liniowy vs. liniowy). Nie mam jednak pojęcia, co to oznacza z perspektywy wyższego poziomu - czy to oznacza, że ​​IRT jest …

5
Czy istnieje miara „równości” rozprzestrzeniania się?
Spojrzałem w górę w Internecie, ale nie mogłem znaleźć nic pomocnego. Zasadniczo szukam sposobu na zmierzenie, jak „równomiernie” rozkładana jest wartość. Jak w „równomiernie” rozproszonej dystrybucji, takiej jak X : oraz „nierównomiernie” rozkład Y o mniej więcej tej samej średniej i odchyleniu standardowym: Ale czy istnieje jakakolwiek miara równości m, …

5
Czym dokładnie są dane cenzurowane?
Przeczytałem różne opisy cenzurowanych danych: A) Jak wyjaśniono w tym wątku, dane niekwantowane poniżej lub powyżej pewnego progu są cenzurowane. Nieoznaczony oznacza, że ​​dane są powyżej lub poniżej pewnego progu, ale nie znamy dokładnej wartości. Dane są następnie oznaczane przy niskiej lub wysokiej wartości progowej w modelu regresji. Pasuje do …

3
Bootstrap: problem nadmiernego dopasowania
Załóżmy, że wykonuje się tak zwany nieparametryczny bootstrap, pobierając próbki BBB o wielkości nnn każda z oryginalnych nnn obserwacji z zastąpieniem. Uważam, że ta procedura jest równoważna z oszacowaniem skumulowanej funkcji rozkładu przez empiryczny plik cdf: http://en.wikipedia.org/wiki/Empirical_distribution_function a następnie uzyskanie próbek bootstrap poprzez symulację obserwacji z szacowanych czasów cdf z …

2
k-średnie vs k-mediana?
Wiem, że istnieje algorytm grupowania k-średnich i k-mediana. Jeden, który wykorzystuje średnią jako środek skupienia, a drugi wykorzystuje medianę. Moje pytanie brzmi: kiedy / gdzie użyć którego?

1
Pasma ufności dla linii QQ
To pytanie nie dotyczy konkretnie R, ale postanowiłem Rto zilustrować. Rozważ kod do tworzenia pasm ufności wokół (normalnej) linii qq: library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Szukam wyjaśnienia (lub alternatywnego linku do dokumentu papierowego / internetowego wyjaśniającego), w jaki sposób zbudowane są te przedziały ufności (widziałem odniesienie do Foxa 2002 w plikach …

4
Odchylenie w wyborze jury?
Przyjaciel reprezentuje klienta w postępowaniu odwoławczym, po procesie karnym, w którym wydaje się, że wybór jury był rasistowski. Jury składało się z 30 osób, w 4 grupach rasowych. Prokuratura zastosowała stanowcze wyzwania, aby wyeliminować 10 z tych osób z puli. Liczba ludzi i liczba faktycznych wyzwań w każdej grupie rasowej …

3
Czy współczynniki regresji logistycznej mają znaczenie?
Mam problem z klasyfikacją binarną z kilku funkcji. Czy współczynniki (uregulowanej) regresji logistycznej mają znaczenie do interpretacji? Pomyślałem, że mogą wskazać wielkość wpływu, biorąc pod uwagę, że cechy są wcześniej znormalizowane. Jednak w moim problemie wydaje się, że współczynniki zależą wrażliwie od wybranych funkcji. Nawet znak współczynników zmienia się przy …

2
Subiektywność w statystyce częstych
Często słyszę twierdzenie, że statystyki bayesowskie mogą być bardzo subiektywne. Głównym argumentem jest to, że wnioskowanie zależy od wyboru przeora (chociaż można użyć zasady obojętności o maksymalnej entropii, aby wybrać przeor). Dla porównania, jak twierdzi twierdzenie, statystyki częstokroć są na ogół bardziej obiektywne. Ile prawdy jest w tym stwierdzeniu? Ponadto …

1
Diagnostyka konwergencji Gelmana i Rubina, jak uogólnić do pracy z wektorami?
Diagnostyka Gelmana i Rubina służy do sprawdzania zbieżności wielu równoległych łańcuchów mcmc. Porównuje wariancję wewnątrz łańcucha z wariancją między łańcuchem, opis poniżej: Kroki (dla każdego parametru): Poprowadź m ≥ 2 łańcuchy o długości 2n od nadmiernie rozproszonych wartości początkowych. Odrzuć pierwsze n losowań w każdym łańcuchu. Oblicz wariancję wewnątrz łańcucha …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.