Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Porównanie podłużne dwóch rozkładów
Mam wyniki testu krwi przeprowadzonego 2500 osób cztery razy w odstępach sześciomiesięcznych. Wyniki składają się przede wszystkim z dwóch miar odpowiedzi immunologicznej - jednej w obecności niektórych antygenów gruźlicy, drugiej w nieobecności. Obecnie każdy test ocenia się pozytywnie lub negatywnie na podstawie różnicy między odpowiedzią na antygen a odpowiedzią zerową …


4
Jak szukać dolin na wykresie?
Badam niektóre dane pokrycia genomowego, które są w zasadzie długą listą (kilka milionów wartości) liczb całkowitych, z których każda mówi, jak dobrze (lub „głęboka”) pozycja w genomie jest objęta. Chciałbym poszukać w tych danych „dolin”, czyli regionów znacznie „niższych” niż otaczające je środowisko. Zauważ, że rozmiar dolin, których szukam, może …

4
Kwantyfikacja wykresu QQ
Wykres qq może być użyty do wizualizacji podobieństwa dwóch rozkładów (np. Wizualizacji podobieństwa rozkładu do rozkładu normalnego, ale także do porównania dwóch rozkładów danych biblioteki artystycznej). Czy są jakieś statystyki, które generują bardziej obiektywną, liczbową miarę, która reprezentuje ich podobieństwo (najlepiej w znormalizowanej (0 <= x <= 1))? Współczynnik Giniego …

4
Asymptotyczny rozkład wielomianu
Szukam ograniczającego rozkładu wielomianowego w porównaniu do wyników d. IE, dystrybucja następujących limn→∞n−12Xnlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} Gdzie XnXn\mathbf{X_n} jest losową zmienną o wartości wektorowej o gęstości fn(x)fn(x)f_n(\mathbf{x}) dla xx\mathbf{x} taką, że ∑ixi=n∑ixi=n\sum_i x_i=n , xi∈Z,xi≥0xi∈Z,xi≥0x_i\in \mathbb{Z}, x_i\ge 0 i 0 dla wszystkich innych xx\mathbf{x} , gdzie fn(x)=n!∏i=1dpxiixi!fn(x)=n!∏i=1dpixixi!f_{n}(\mathbf{x})=n!\prod_{i=1}^d\frac{p_i^{x_i}}{x_i!} Znalazłem jedną formę …


2
Szerokość pasma jądra w szacowaniu gęstości jądra
Robię pewne oszacowanie gęstości jądra, z ustawionymi punktami ważonymi (tj. Każda próbka ma wagę, która nie jest konieczna), w wymiarach N. Próbki te znajdują się również w przestrzeni metrycznej (tzn. Możemy zdefiniować odległość między nimi), ale nic więcej. Na przykład nie możemy określić średniej punktów próby ani odchylenia standardowego, ani …

1
Jakiego rodzaju analizy resztkowej stosujesz?
Podczas przeprowadzania wielokrotnej regresji liniowej OLS zamiast wykreślania reszt względem dopasowanych wartości, wykreślam (wewnętrzne) studentizowane resztki względem dopasowanych wartości (podobnie jak współzmienne). Te pozostałości są zdefiniowane jako: e∗i=eis2(1−hii)−−−−−−−−−√ei∗=eis2(1−hii)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} gdzie jest resztą, a h_ {ii} to diagonalne elementy macierzy kapelusza. Aby uzyskać te studentizowane resztki w …


11
Rewolucje w statystykach z ostatnich 50 lat? [Zamknięte]
W obecnej formie to pytanie nie pasuje do naszego formatu pytań i odpowiedzi. Oczekujemy, że odpowiedzi poparte będą faktami, referencjami lub wiedzą fachową, ale to pytanie prawdopodobnie będzie wymagało debaty, argumentów, ankiet lub rozszerzonej dyskusji. Jeśli uważasz, że to pytanie można poprawić i ewentualnie ponownie otworzyć, odwiedź centrum pomocy w …
10 history 



1
Szacowanie zmienności w czasie
Mam zestaw danych, który zawiera ~ 7500 badań krwi od ~ 2500 osób. Próbuję dowiedzieć się, czy zmienność wyników badań krwi wzrasta, czy maleje wraz z upływem czasu między dwoma badaniami. Na przykład - pobieram twoją krew do testu podstawowego, a następnie natychmiast pobieram drugą próbkę. Sześć miesięcy później rysuję …

5
Jakie inne transformacje normalizujące są powszechnie stosowane poza zwykłymi, takimi jak pierwiastek kwadratowy, log itp.?
W analizie wyników testu (np. W edukacji lub psychologii) powszechne techniki analizy często zakładają, że dane są zwykle dystrybuowane. Jednak być może częściej niż nie, wyniki często odbiegają od normy. Znam kilka podstawowych transformacji normalizujących, takich jak: pierwiastki kwadratowe, logarytmy, odwrotne transformacje do zmniejszania skosu dodatniego, odbite wersje powyższych dla …

2
Jaka jest różnica między analizą danych funkcjonalnych a analizą danych wielowymiarowych
W literaturze statystycznej istnieje wiele odniesień do „ danych funkcjonalnych ” (tj. Danych, które są krzywymi), a równolegle do „ danych wielowymiarowych ” (tj. Gdy dane są wektorami wielowymiarowymi). Moje pytanie dotyczy różnicy między tymi dwoma typami danych. Mówiąc o zastosowanych metodologiach statystycznych, które mają zastosowanie w przypadku 1, można …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.