Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Dla jakiego problemu lub gry optymalne są wariancja i odchylenie standardowe?
Dla danej zmiennej losowej (lub populacji, lub procesu stochastycznego) oczekiwanie matematyczne jest odpowiedzią na pytanie: Która prognoza punktowa minimalizuje oczekiwaną stratę kwadratową? . Jest to również optymalne rozwiązanie dla gry. Zgadnij, kiedy zrealizujesz losową zmienną (lub nowe losowanie z populacji), a ja ukarzę cię kwadratową odległością między wartością a twoim …

3
Rejestrowanie resztek regresji logistycznej na innych rejestratorach
Stosując regresję OLS do ciągłej odpowiedzi, można zbudować równanie regresji wielokrotnej, uruchamiając sekwencyjnie regresje reszt na każdej współzmiennej. Moje pytanie brzmi: czy istnieje sposób, aby to zrobić za pomocą regresji logistycznej za pomocą reszt regresji logistycznej ? To znaczy, jeśli chcę oszacować przy użyciu standardowego uogólnionego modelu modelowania liniowego, czy …

5
Dlaczego suma prawdopodobieństw w ciągłym rozkładzie równomiernym nie jest nieskończonością?
Funkcja gęstości prawdopodobieństwa rozkładu jednolitego (ciągłego) pokazano powyżej. Pole pod krzywą wynosi 1 - co ma sens, ponieważ suma wszystkich prawdopodobieństw w rozkładzie prawdopodobieństwa wynosi 1. Formalnie powyższą funkcję prawdopodobieństwa (f (x)) można zdefiniować jako 1 / (ba) dla x w [a, b] i 0 w przeciwnym razie Zastanów się, …

1
Moja sieć neuronowa nie może nawet nauczyć się odległości euklidesowej
Próbuję więc nauczyć się sieci neuronowych (do zastosowań regresji, nie klasyfikując zdjęć kotów). Moje pierwsze eksperymenty polegały na uczeniu sieci implementacji filtra FIR i dyskretnej transformaty Fouriera (trening sygnałów „przed” i „po”), ponieważ są to operacje liniowe, które mogą być realizowane przez pojedynczą warstwę bez funkcji aktywacji. Oba działały dobrze. …

1
Ogranicza różnicę skorelowanych zmiennych losowych
Biorąc pod uwagę dwie wysoce skorelowane zmienne losowe XXX i YYY, Chciałbym ograniczyć prawdopodobieństwo różnicy |X−Y||X−Y| |X - Y| przekracza pewną kwotę: P(|X−Y|&gt;K)&lt;δP(|X−Y|&gt;K)&lt;δ P( |X - Y| > K) < \delta Załóż dla uproszczenia, że: Współczynnik korelacji jest znany jako „wysoki”, powiedzmy: ρX,Y=covar(X,Y)/σXσY≥1−ϵρX,Y=covar(X,Y)/σXσY≥1−ϵ \rho_{X,Y}= {covar(X,Y)} / {\sigma_X \sigma_Y} \geq 1 …

2
Jaki jest najsilniejszy wynik w maksymalnej liczbie Iid Gaussa? Najczęściej używany w praktyce?
Biorąc pod uwagę iid, rozważ zmienne losoweX1,…,Xn,…∼N(0,1)X1,…,Xn,…∼N(0,1)X_1, \ldots, X_n, \ldots \sim \mathscr{N}(0,1) Zn:=max1≤i≤nXi.Zn:=max1≤i≤nXi. Z_n := \max_{1 \le i \le n} X_i\,. Pytanie: Jaki jest „najważniejszy” wynik dotyczący tych zmiennych losowych? Aby wyjaśnić „znaczenie”, który wynik ma najwięcej innych takich wyników jako logiczną konsekwencję? Który z wyników jest najczęściej wykorzystywany w …

2
Poprawa minimalnego estymatora
Załóżmy, że mam pozytywne parametry oszacować i odpowiadające im pakietów szacunki produkowane przez estymatorów , tj. , i tak dalej.nnnμ1,μ2,...,μnμ1,μ2,...,μn\mu_1,\mu_2,...,\mu_nnnnμ1^,μ2^,...,μn^μ1^,μ2^,...,μn^\hat{\mu_1},\hat{\mu_2},...,\hat{\mu_n}E[μ1^]=μ1E[μ1^]=μ1\mathrm E[\hat{\mu_1}]=\mu_1E[μ2^]=μ2E[μ2^]=μ2\mathrm E[\hat{\mu_2}]=\mu_2 Chciałbym oszacować podstawie dostępnych szacunków. Najwyraźniej naiwny estymator jest tendencyjnie niższy niż min(μ1,μ2,...,μn)min(μ1,μ2,...,μn)\mathrm{min}(\mu_1,\mu_2,...,\mu_n)min(μ1^,μ2^,...,μn^)min(μ1^,μ2^,...,μn^)\mathrm{min}(\hat{\mu_1},\hat{\mu_2},...,\hat{\mu_n})E[min(μ1^,μ2^,...,μn^)]≤min(μ1,μ2,...,μn)E[min(μ1^,μ2^,...,μn^)]≤min(μ1,μ2,...,μn)\mathrm E[\mathrm{min}(\hat{\mu_1},\hat{\mu_2},...,\hat{\mu_n})]\leq \mathrm{min}(\mu_1,\mu_2,...,\mu_n) Załóżmy, że mam pod ręką macierz kowariancji odpowiednich estymatorów . Czy można uzyskać …

3
Niezależność statystyki od rozkładu gamma
Niech będzie losową próbką z rozkładu gamma .X1,...,XnX1,...,XnX_1,...,X_nGamma(α,β)Gamma(α,β)\mathrm{Gamma}\left(\alpha,\beta\right) Niech i będą odpowiednio średnią próbną i wariancją próbki.X¯X¯\bar{X}S2S2S^2 Następnie udowodnij lub obal, że i są niezależne.X¯X¯\bar{X}S2/X¯2S2/X¯2S^2/\bar{X}^2 Moja próba: Ponieważ , musimy sprawdzić niezależnośćS2/X¯2=1n−1∑ni=1(XiX¯−1)2S2/X¯2=1n−1∑i=1n(XiX¯−1)2S^2/\bar{X}^2 = \frac{1}{n-1} \sum_{i=1}^n \left(\frac{X_i}{\bar{X}}-1\right)^2 X¯X¯\bar{X}i , ale jak mam ustalić niezależność między nimi?(XiX¯)ni=1(XiX¯)i=1n\left(\frac{X_i}{\bar{X}} \right)_{i=1}^{n}

2
Czy możemy odrzucić hipotezę zerową z przedziałami ufności uzyskanymi za pomocą próbkowania zamiast hipotezy zerowej?
Nauczono mnie, że możemy uzyskać oszacowanie parametru w postaci przedziału ufności po pobraniu próbki z populacji. Na przykład 95% przedziały ufności, bez naruszonych założeń, powinny mieć 95% wskaźnik sukcesu zawierający dowolny prawdziwy parametr, który oceniamy w populacji. To znaczy, Utwórz oszacowanie punktowe z próbki. Utwórz zakres wartości, które teoretycznie mają …

1
Wygeneruj zmienną losową z podanymi momentami
Znam pierwsze chwil jakiejś dystrybucji. Wiem też, że moja dystrybucja jest ciągła, unimodalna i dobrze ukształtowana (wygląda jak rozkład gamma). Czy jest możliwe:N.N.N Za pomocą jakiegoś algorytmu wygeneruj próbki z tego rozkładu, który w warunkach granicznych będzie miał dokładnie te same chwile? Rozwiąż ten problem analitycznie? Rozumiem, że dopóki nie …

3
Bakterie zbierane na palcach po wielu kontaktach powierzchniowych: dane nienormalne, powtarzane pomiary, skrzyżowane osoby
Wprowadzenie Mam uczestników, którzy wielokrotnie dotykają skażonych powierzchni E. coli w dwóch warunkach ( A = w rękawiczkach, B = bez rękawiczek). Chcę wiedzieć, czy istnieje różnica między ilością bakterii na opuszkach palców w rękawicach i bez rękawiczek, ale także między liczbą kontaktów. Oba czynniki są wewnątrz uczestników. Metoda eksperymentalna: …

2
Jednolity plik PDF różnicy dwóch rv
Czy możliwe jest, aby PDF różnicy dwóch iid rv wyglądał jak prostokąt (zamiast, powiedzmy, trójkąta, który otrzymujemy, jeśli rv zostaną pobrane z rozkładu jednolitego). tzn. czy jest możliwe, aby PDF f jk (dla dwóch iid rv pobranych z jakiejś dystrybucji) miał f (x) = 0,5 dla wszystkich -1 &lt;x &lt;1? …


3
Czy estymator Bayesa wymaga, aby prawdziwy parametr był możliwym wariantem wcześniejszego?
To może być trochę filozoficzne pytanie, ale zaczynamy: W teorii decyzji ryzyko estymatora Bayesa dla jest określone w odniesieniu do wcześniejszego rozkładu \ pi na \ Theta .θ^( x )θ^(x)\hat\theta(x)θ ∈ Θθ∈Θ\theta\in\Thetaππ\piΘΘ\Theta Z jednej strony, aby prawda wygenerowała dane (tj. „Istnieje”), musi być możliwą zmienną poniżej , np. Mieć niezerowe …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.