Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



5
John Kerrich Coin-flip Data
Czy ktoś może zasugerować, gdzie uzyskać wyniki 10 000 rzutów monetą (tj. Wszystkich 10 000 głów i reszek) wykonanych przez Johna Kerricha podczas II wojny światowej?

4
Dobroć dopasowania dla bardzo dużych próbek
Codziennie zbieram bardzo duże próbki (> 1 000 000) danych kategorycznych i chcę, aby dane wyglądały „znacząco” różnie między poszczególnymi dniami w celu wykrycia błędów w gromadzeniu danych. Myślałem, że użycie testu dobrego dopasowania (w szczególności testu G) byłoby dobrym dopasowaniem (gra słów). Oczekiwany rozkład wynika z rozkładu z poprzedniego …

1
Wnioskowanie na temat efektów stałych w modelu efektów mieszanych
Skorelowałem dane i używam modelu mieszanych efektów regresji logistycznej do oszacowania indywidualnego (warunkowego) efektu dla predyktora zainteresowania. Wiem, że w przypadku standardowych modeli brzeżnych wnioskowanie na temat parametrów modelu za pomocą testu Walda jest spójne dla współczynników prawdopodobieństwa i testów punktowych. Zazwyczaj są one w przybliżeniu takie same. Ponieważ Wald …

2
Jakie statystyki są przechowywane w ramach agregacji?
Jeśli mamy długi szereg czasowy o wysokiej rozdzielczości, z dużym hałasem, często sensowne jest agregowanie danych do niższej rozdzielczości (np. Wartości dzienne do miesięcznych), aby lepiej zrozumieć, co się dzieje, skutecznie usuwając niektóre z hałas. Widziałem co najmniej jeden artykuł, który stosuje pewne statystyki do danych zagregowanych, w tym dla …

1
Czy występuje problem z wielokoliniowością i regresją splajnów?
Podczas korzystania z naturalnych (tj. Ograniczonych) splajnów sześciennych, tworzone funkcje podstawowe są wysoce współliniowe, a po zastosowaniu w regresji wydają się generować bardzo wysokie statystyki VIF (współczynnik inflacji wariancji), sygnalizując wielokoliniowość. Czy rozważając przypadek modelu do celów prognozowania, jest to problem? Wydaje się, że zawsze tak będzie ze względu na …

1
Czy istnieje lepsza nazwa niż „średnia całki”?
Testuję czujniki położenia przepustnicy (TPS), które sprzedaje moja firma i drukuję wykres odpowiedzi napięcia na obrót wału przepustnicy. TPS jest czujnikiem obrotowym o zakresie 90 °, a wyjście jest jak potencjometr z pełnym otwarciem wynoszącym 5 V (lub wartością wejściową czujnika) i początkowym otwarciem o wartości między 0 a 0,5 …

1
Przykład ścisłej nierówności von Neumanna
Niech oznacza ryzyko Bayesa estymatora w odniesieniu do wcześniejszego , niech oznacza zbiór wszystkich priorów w przestrzeni parametrów , a niech oznacza zbiór wszystkie (ewentualnie losowe) reguły decyzyjne.δ π Π Θ Δr(π,δ)r(π,δ)r(\pi, \delta)δδ\deltaππ\piΠΠ\PiΘΘ\ThetaΔΔ\Delta Stwierdza to statystyczna interpretacja nierówności minimax Johna von Neumanna supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ),supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ), \sup_{\pi\in\Pi} \inf_{\delta\in\Delta} r(\pi, \delta) \leq \inf_{\delta\in\Delta}\sup_{\pi\in\Pi} r(\pi, …


4
Wartość, która zwiększa odchylenie standardowe
Zastanawia mnie następujące zdanie: „Aby zwiększyć standardowe odchylenie zestawu liczb, należy dodać wartość, która jest więcej niż jedno odchylenie standardowe od średniej” Co jest tego dowodem ? Wiem oczywiście, jak definiujemy odchylenie standardowe, ale tę część wydaje mi się jakoś tęsknić. Jakieś komentarze?

1
Zamieszanie z wartościami lmer i p: jak wartości p z pakietu memisc różnią się od wartości MCMC?
Miałem wrażenie, że funkcja lmer()w lme4pakiecie nie generowała wartości p (patrz lmerwartości p i tak dalej ). Używam MCMC wygenerowane wartości p zamiast, jak na to pytanie: znaczący wpływ w lme4modelu mieszanym i to pytanie: nie można odnaleźć wartości p w wyjściu ze lmer()w lm4opakowaniu wR . Ostatnio wypróbowałem pakiet …

2
Jeśli jakikolwiek test parametryczny nie odrzuca wartości zerowej, czy jego nieparametryczna alternatywa robi to samo?
Jeśli zakłada się, że testy nieparametryczne mają mniejszą moc niż ich alternatywy parametryczne, czy to oznacza, że ​​jeśli jakikolwiek test parametryczny nie odrzuca wartości zerowej, to jego nieparametryczna alternatywa również nie odrzuca wartości zerowej? Jak to zmienić, jeśli założenia testu parametrycznego nie zostaną spełnione, a test i tak zostanie zastosowany?


2
Jak zastosować sieci neuronowe do problemów z klasyfikacją wielu marek?
Opis: Niech domeną problemową będzie klasyfikacja dokumentów tam, gdzie istnieje zestaw wektorów cech, z których każdy należy do jednej lub więcej klas. Na przykład dokument doc_1może należeć do kategorii Sportsi English. Pytanie: Używając sieci neuronowej do klasyfikacji, jaka byłaby etykieta dla wektora cech? czy byłby to wektor składający się ze …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.