Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Konsekwencje bieżącej debaty na temat znaczenia statystycznego
W ciągu ostatnich kilku lat różni uczeni podnieśli szkodliwy problem testowania hipotez naukowych, nazwany „stopniem swobody badacza”, co oznacza, że ​​naukowcy mają podczas swojej analizy wiele wyborów, które mogą wpływać na znalezienie wartości p <5%. Te niejednoznaczne wybory to na przykład, który przypadek należy uwzględnić, który przypadek jest sklasyfikowany jako …


2
Zrozumienie funkcji mieszania funkcji
Wikipedia podaje następujący przykład opisujący skrót funkcji ; ale mapowanie nie wydaje się spójne ze zdefiniowanym słownikiem Na przykład tonależy przekonwertować na 3zgodnie ze słownikiem, ale 1zamiast tego jest zakodowany . Czy w opisie jest błąd? Jak działa funkcja mieszania funkcji? Teksty: John likes to watch movies. Mary likes too. …

1
W jakich implementacjach wymagane jest skalowanie zmiennych (cech) i normalizacja (strojenie) zmiennych (cech)
W wielu algorytmach uczenia maszynowego skalowanie funkcji (inaczej skalowanie zmiennych, normalizacja) jest częstym krokiem wstępnego przetwarzania Wikipedia - Skalowanie funkcji - to pytanie było blisko Pytanie nr 41704 - Jak i dlaczego działa normalizacja i skalowanie funkcji? Mam dwa pytania dotyczące drzew decyzyjnych: Czy są jakieś implementacje drzewa decyzyjnego, które …

1
Określanie wielkości próbki za pomocą proporcji i rozkładu dwumianowego
Próbuję nauczyć się statystyk za pomocą książki, Biometry autorstwa Sokala i Rohlfa (3e). Jest to ćwiczenie z 5 rozdziału, który obejmuje prawdopodobieństwo, rozkład dwumianowy i rozkład Poissona. Zdaję sobie sprawę, że istnieje formuła pozwalająca uzyskać odpowiedź na to pytanie: Jednak tego równania nie ma w tym tekście. Chciałbym wiedzieć, jak …

1
Czy powinienem używać przybliżonych stopni swobody Welcha (1947), czy Satterthwaite (1946)?
Jestem zdezorientowany co do prawidłowej formuły przybliżonych stopni swobody użycia w teście Welcha. Formuła Satterthwaite (1946) jest najczęściej cytowaną formułą, ale Welch dał alternatywę w 1947 r. Nie jestem pewien, która jest lepsza (lub stosowana przez większość programów statystycznych). Wzór Satterthwaite: ( s2)x/ nx+ s2)y/ ny)2)( s2)x/ nx)2)/ ( nx- …

1
Wyjaśnienie filtrów Kalmana w modelach przestrzeni stanów
Jakie są kroki związane z użyciem filtrów Kalmana w modelach przestrzeni stanów? Widziałem kilka różnych sformułowań, ale nie jestem pewien szczegółów. Na przykład Cowpertwait zaczyna się od następującego zestawu równań: yt= F.′tθt+ vtyt=fat′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θt= Gtθt - 1+ wtθt=soltθt-1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} gdzie i , \ theta_ {t} to nasze …

2
Czy dwukierunkowa ANOVA jest odpowiednia?
To jest opis mojego badania. Eksperymentuję z trzema roślinami: A, B i C. Rośliny te mają obniżać poziom glukozy we krwi u pacjentów z cukrzycą. Chcę ustalić, która z tych trzech roślin ma dłuższy wpływ na obniżenie poziomu glukozy we krwi po jednorazowym podaniu myszom. Odbywa się to poprzez pomiar …

3
Jak interpretować współczynnik ryzyka na podstawie zmiennej ciągłej - jednostki różnicy?
Czytam artykuł, który pokazuje współczynniki ryzyka dla zmiennych ciągłych, ale nie jestem pewien, jak interpretować podane wartości. Moje obecne rozumienie współczynników ryzyka polega na tym, że liczba ta reprezentuje względne prawdopodobieństwo [zdarzenia] pod pewnymi warunkami. Np .: jeśli współczynnik ryzyka zgonu z powodu raka płuc przy paleniu (zdarzenie binarne) wynosi …

2
PyMC dla grupowania nieparametrycznego: proces Dirichleta do oszacowania parametrów mieszanki Gaussa nie ulega zgrupowaniu
Konfiguracja problemu Jednym z pierwszych problemów z zabawkami, do których chciałem zastosować PyMC, jest grupowanie nieparametryczne: biorąc pod uwagę pewne dane, zamodeluj je jako mieszaninę Gaussa i poznaj liczbę skupień oraz średnią i kowariancję każdego skupienia. Większość tego, co wiem o tej metodzie, pochodzi z wykładów wideo Michaela Jordana i …

2
Błąd propagacji SD vs SE
Mam od 3 do 5 miar cechy na osobę w dwóch różnych warunkach (A i B). Mam kreślenia średnia dla każdego indywidualnie w każdym stanie i używam błąd standardowy ( tj , , przy = liczba pomiarów) jako pionowe kreski. NS.D / N--√SD/NSD/\sqrt{N}N.NN Teraz chcę wykreślić różnicę między średnią miarą …


2
Czy ma sens obliczanie przedziałów ufności i testowanie hipotez, gdy dostępne są dane z całej populacji?
Czy ma sens obliczanie przedziałów ufności i testowanie hipotez, gdy dostępne są dane z całej populacji? Moim zdaniem odpowiedź brzmi „nie”, ponieważ możemy dokładnie obliczyć prawdziwe wartości parametrów. Ale jaka jest maksymalna proporcja danych z pierwotnej populacji, która pozwala nam korzystać z wyżej wymienionych technik?

3
Zamieszanie związane z elastyczną siatką
Czytałem ten artykuł dotyczący elastycznej siatki. Mówią, że używają elastycznej siatki, ponieważ jeśli użyjemy tylko Lasso, zwykle wybierany jest tylko jeden predyktor spośród predyktorów, które są wysoce skorelowane. Ale czy nie tego chcemy? Mam na myśli, że ratuje nas przed problemem wielokoliniowości, prawda? Wszelkie sugestie / wyjaśnienia?

6
Elastyczne i nieelastyczne modele uczenia maszynowego
Natknąłem się na proste pytanie o porównanie modeli elastycznych (tj. Splajnów) z modelami nieelastycznymi (np. Regresja liniowa) w różnych scenariuszach. Pytanie brzmi: Ogólnie rzecz biorąc, czy oczekujemy, że działanie elastycznej metody uczenia statystycznego będzie lepsze lub gorsze niż metody nieelastycznej, gdy: Liczba predyktorów jest niezwykle duża, a liczba obserwacji jest …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.