Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak Karl Pearson wymyślił statystyki chi-kwadrat?
Jak Pearson opracował następujące statystyki chi-kwadrat Pearsona w 1900 roku? K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} that K∼χ2K∼χ2 K \sim \chi^2 Czy miał na myśli chi-kwadrat i opracował metrykę KKK (podejście od dołu do góry), czy też opracował statystyki, a później udowodnił, że podąża ona za rozkładem chi-kwadrat (z góry …


3
Jak obliczyć nakładanie się między gęstościami prawdopodobieństwa empirycznego?
Szukam metody do obliczenia obszaru nakładania się dwóch oszacowań gęstości jądra w R, jako miary podobieństwa między dwiema próbkami. Aby to wyjaśnić, w poniższym przykładzie musiałbym określić ilościowo obszar pokrywającego się regionu fioletowo: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) ggplot(d, aes(value, fill=variable)) + geom_density(alpha=.4, …

1
Klasyfikatory uczenia maszynowego duże O lub złożoność
Aby ocenić wydajność nowego algorytmu klasyfikatora, próbuję porównać dokładność i złożoność (duże O w treningu i klasyfikacji). Z uczenia maszynowego: recenzja Otrzymuję pełną listę nadzorowanych klasyfikatorów, tabelę dokładności między algorytmami i 44 problemy testowe z repozytorium danych UCI . Nie mogę jednak znaleźć recenzji, artykułu papierowego ani strony internetowej z …

3
Szkolenie, testowanie, sprawdzanie poprawności problemu analizy przeżycia
Przeglądałem tutaj różne wątki, ale nie sądzę, aby na moje dokładne pytanie zostało udzielone odpowiedzi. Mam zbiór danych obejmujący ~ 50 000 studentów i ich czas na rezygnację. Zamierzam przeprowadzić proporcjonalną regresję zagrożeń z dużą liczbą potencjalnych zmiennych towarzyszących. Zamierzam również przeprowadzić regresję logistyczną w przypadku porzucenia / pozostania w. …

1
Jaka jest różnica między współczynnikami regresji a współczynnikami regresji częściowej?
Czytałem w Abdi (2003) , że Gdy zmienne niezależne są parami ortogonalne, wpływ każdej z nich na regresję ocenia się, obliczając nachylenie regresji między tą zmienną niezależną a zmienną zależną. W tym przypadku (tj. Ortogonalność IV) współczynniki regresji częściowej są równe współczynnikom regresji. We wszystkich innych przypadkach współczynnik regresji będzie …

1
Funkcje kosztów dla kontekstowych bandytów
Używam wabbitów ślubnych, aby rozwiązać problem bandytów kontekstowych . Wyświetlam reklamy użytkownikom i mam sporo informacji na temat kontekstu, w którym reklama jest wyświetlana (np. Kim jest użytkownik, w jakiej witrynie się znajduje itp.). To wydaje się być dość klasycznym problemem kontekstowego bandyty, jak opisał John Langford . W mojej …

3
Najlepsze oprogramowanie do wizualizacji danych open source do użytku z programem PowerPoint
Jakie jest najlepsze oprogramowanie do wizualizacji danych typu open source? Potrzebuję: Może importować dane z Microsoft Excel (importowanie danych z baz danych Oracle również byłoby dobre, ale nie jest to obowiązkowe). Wykresy generowane przez oprogramowanie można eksportować do programu Microsoft PowerPoint (kopiowanie i wklejanie jest ze mną w porządku). Open …

2
Rozkład splotu kwadratowych zmiennych normalnych i chi-kwadratowych?
następujący problem pojawił się ostatnio podczas analizy danych. Jeśli zmienna losowa X podąża za rozkładem normalnym, a Y za (z n dof), jak rozkłada się ? Do tej pory wymyśliłem pdf : χ2nχn2\chi^2_nZ=X2+Y2Z=X2+Y2Z = X^2 + Y^2Y2Y2Y^2ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& \frac{\partial F(\sqrt{x})}{\partial x} \\ &=& \left( \int_0^{\sqrt{x}} \frac{t^{n/2-1}\cdot e^{-t/2}}{2^{n/2}\Gamma(n/2)} \mathrm{d}t \right)^\prime_x …

1
Sprawdź różnicę między 2 empirycznymi dyskretnymi rozkładami
Mam dane testowe, w których mam kilka dużych próbek z rozkładów dyskretnych, których używam jako rozkłady empiryczne. Chcę przetestować, czy rozkłady są rzeczywiście różne i jaka jest różnica w średnich dla tych rozkładów, które są naprawdę różne. Ponieważ są to rozkłady dyskretne, rozumiem, że test Kołmogorowa-Smirnowa jest nieważny z uwagi …



3
Oszacowanie nw problemie kolektora kuponów
W odmianie problemu z kolektorem kuponów nie znasz liczby kuponów i musisz to ustalić na podstawie danych. Będę nazywać to problemem związanym z ciasteczkami fortuny: Biorąc pod uwagę nieznaną liczbę odrębnych wiadomości cookie fortuny , oszacuj , próbkując pliki cookie pojedynczo i licząc, ile razy pojawia się każda fortuna. Określ …

4
Z perspektywy prawdopodobieństwa Bayesa dlaczego 95% przedział ufności nie zawiera prawdziwego parametru z prawdopodobieństwem 95%?
Ze strony Wikipedii na temat przedziałów ufności : ... jeśli przedziały ufności są konstruowane na podstawie wielu oddzielnych analiz danych z powtarzanych (i być może różnych) eksperymentów, proporcja takich przedziałów, które zawierają prawdziwą wartość parametru, będzie odpowiadać poziomowi ufności ... I z tej samej strony: Przedział ufności nie przewiduje, że …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.