Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Bezstronny, pozytywny estymator kwadratu średniej
Załóżmy, że mamy dostęp do próbek iid z rozkładu o prawdziwej (nieznanej) średniej i wariancji , i chcemy oszacować .μ ,σ2)μ,σ2)\mu, \sigma^2μ2)μ2)\mu^2 Jak zbudować obiektywny, zawsze pozytywny estymator tej ilości? Biorąc kwadrat próbki, średnia jest tendencyjna i zawyża ilość, szczególnie. jeśli jest bliskie 0, a jest duże.μ~2)μ~2)\tilde{\mu}^2μμ\muσ2)σ2)\sigma^2 To być może …

2
Dlaczego używamy reszt do testowania założeń dotyczących błędów regresji?
Załóżmy, że mamy model .Yi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiYi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiY_i = \beta_0 + \beta_1X_{i1} + \beta_2X_{i2} + \dots + \beta_kX_{ik} + \epsilon_i Regresja ma wiele założeń, na przykład, że błędy powinny być normalnie rozłożone ze średnią zerową i stałą wariancją. Nauczono mnie sprawdzać te założenia przy użyciu normalnego wykresu QQ w celu przetestowania normalności reszt …

4
Jak statystycznie udowodnić, czy kolumna zawiera dane kategoryczne, czy też nie używa Pythona
Mam ramkę danych w pythonie, w której muszę znaleźć wszystkie zmienne jakościowe. Sprawdzanie typu kolumny nie zawsze działa, ponieważ inttyp może być również kategoryczny. Dlatego szukam pomocy w znalezieniu właściwej metody testowania hipotez, aby ustalić, czy kolumna jest kategoryczna, czy nie. Próbowałem poniżej testu chi-kwadrat, ale nie jestem pewien, czy …

1
Jaka jest różnica między funkcją decyzyjną, prognozą_proba i funkcją prognozowania dla problemu regresji logistycznej?
Przeglądałem dokumentację sklearn, ale nie jestem w stanie zrozumieć celu tych funkcji w kontekście regresji logistycznej. Dla decision_functionniego mówi, że jego odległość między hiperpłaszczyznę i instancji testowej. w jaki sposób te konkretne informacje są przydatne? i jak to się odnosi predicti predict-probametody?

3
regresja procesu gaussowskiego dla dużych zestawów danych
Dowiedziałem się o regresji procesu Gaussa z filmów online i notatek z wykładów, rozumiem, że jeśli mamy zbiór danych z punktami to zakładamy, że dane są próbkowane z wymiarowego wielowymiarowego Gaussa. Więc moje pytanie dotyczy przypadku, gdy wynosi 10 milionów, czy regresja procesu Gaussa nadal działa? Czy matryca jądra nie …

2
Cel hałasu Dirichleta w pracy AlphaZero
W dokumentach AlphaGo Zero i AlphaZero DeepMind opisują dodawanie szumu Dirichleta do wcześniejszych prawdopodobieństw działań z węzła głównego (stanu płyty) w wyszukiwaniu drzewa Monte Carlo: Dodatkową eksplorację osiąga się, dodając szum Dirichleta do wcześniejszych prawdopodobieństw w węźle głównym s0s0s_0, konkretnie P.( s , a ) = ( 1 - ε …

5
Prawdopodobieństwa warunkowe - czy są one unikalne dla bayesianizmu?
Zastanawiam się, czy prawdopodobieństwa warunkowe są unikalne dla bayesianizmu, czy też są bardziej ogólną koncepcją podzielaną przez kilka szkół myślenia wśród statystów / osób prawdopodobieństwa. Zakładam, że tak jest, ponieważ zakładam, że nikt nie może jest w pewnym sensie logiczne, więc myślę, że częstokroć przynajmniej teoretycznie by się zgodził, ostrzegając …

3
Dystrybucja
Jako rutynowe ćwiczenie próbuję znaleźć rozkład X2)+Y2)-------√X2)+Y2)\sqrt{X^2+Y^2} gdzie XXX i YYY są niezależne U( 0 , 1 )U(0,1) U(0,1) zmienne losowe. Łączna gęstość wynosząca ( X, Y)(X,Y)(X,Y) jest faX, Y( x , y) =10 &lt; x , y&lt; 1faX,Y(x,y)=10&lt;x,y&lt;1f_{X,Y}(x,y)=\mathbf 1_{0\cos^{-1}\left(\frac{1}{z}\right), tak jak cosθcos⁡θ\cos\theta zmniejsza się na θ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right]; izsinθ&lt;1⟹θ&lt;sin−1(1z)zsin⁡θ&lt;1⟹θ&lt;sin−1⁡(1z)z\sin\theta<1\implies\theta<\sin^{-1}\left(\frac{1}{z}\right), tak jak …

2
KL Strata z jednostką Gaussa
Wdrażam VAE i zauważyłem w Internecie dwie różne implementacje uproszczonej rozbieżności Gaussa KL dla jednej zmiennej. Oryginalna rozbieżność, jak tutaj, jest K.L.l o s s= log(σ2)σ1) +σ2)1+ (μ1-μ2))2)2)σ2)2)-12)K.L.loss=log⁡(σ2)σ1)+σ12)+(μ1-μ2))2)2)σ2)2)-12) KL_{loss}=\log(\frac{\sigma_2}{\sigma_1})+\frac{\sigma_1^2+(\mu_1-\mu_2)^2}{2\sigma^2_2}-\frac{1}{2} Jeśli założymy, że nasz przeor jest jednostką gaussowską tj μ2)= 0μ2)=0\mu_2=0 i σ2)= 1σ2)=1\sigma_2=1, upraszcza to do K.L.l o s s= …

1
Dodanie predyktora regresji liniowej zmniejsza R do kwadratu
Mój zestaw danych (N.≈ 10 , 000N.≈10,000N \approx 10,000) ma zmienną zależną (DV), pięć niezależnych zmiennych „podstawowych” (P1, P2, P3, P4, P5) i jedną niezależną zmienną będącą przedmiotem zainteresowania (Q). Uruchomiłem regresje liniowe OLS dla następujących dwóch modeli: DV ~ 1 + P1 + P2 + P3 + P4 + …

1
Filtr ARIMA vs Kalman - jak są ze sobą powiązane
Kiedy zacząłem czytać o filtrze Kalmana, pomyślałem, że jest to specjalny przypadek modelu ARIMA (a mianowicie ARIMA (0,1,1)). Ale tak naprawdę wydaje się, że sytuacja jest bardziej skomplikowana. Przede wszystkim ARIMA może być używana do przewidywania, a filtr Kalmana służy do filtrowania. Ale czy nie są blisko spokrewnione? Pytanie: Jaki …

3
Hiperplany optymalnie klasyfikują dane, gdy dane wejściowe są warunkowo niezależne - dlaczego?
W artykule zatytułowanym Głębokie uczenie się i zasada wąskiego gardła informacji autorzy stwierdzają w sekcji II A), co następuje: Pojedyncze neurony klasyfikują tylko liniowo separowalne dane wejściowe, ponieważ mogą implementować tylko hiperpłaszczyzny w swojej przestrzeni wejściowej u=wh+bu=wh+bu = wh+b. Hiperplany mogą optymalnie klasyfikować dane, gdy dane wejściowe są warunkowo niezależne. …

1
Dlaczego losowe funkcje Fouriera są nieujemne?
Losowe funkcje Fouriera zapewniają przybliżenia funkcji jądra. Są używane do różnych metod jądra, takich jak SVM i procesy Gaussa. Dzisiaj próbowałem użyć implementacji TensorFlow i uzyskałem wartości ujemne dla połowy moich funkcji. Jak rozumiem, to nie powinno się zdarzyć. Wróciłem więc do oryginalnej pracy , która - tak jak się …

3
Gdyby
Dla ciągłej zmiennej losowej XXX , jeśli E(|X|)E(|X|)E(|X|) jest skończone, to czy limn→∞nP(|X|&gt;n)=0limn→∞nP(|X|&gt;n)=0\lim_{n\to\infty}n P(|X|>n)=0 ? Jest to problem, który znalazłem w Internecie, ale nie jestem pewien, czy się utrzymuje. Wiem, że nP(|X|&gt;n)&lt;E(|X|)nP(|X|&gt;n)&lt;E(|X|)n P(|X|>n)


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.