Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak działa negatywne próbkowanie w word2vec?
Starałem się zrozumieć pojęcie negatywnego próbkowania w kontekście word2vec. Nie jestem w stanie przetrawić idei próbkowania [negatywnego]. Na przykład w pracach Mikołowa sformułowano, że negatywne oczekiwania dotyczące próbkowania są sformułowane jako logσ( ⟨ Wagowych , c ⟩ ) + K ⋅ EdoN.∼ P.re[ logσ( - ⟨ wagowych , cN.⟩ ) …

2
Wielopłaszczyznowe wskaźniki klasyfikacji w programie scikit
Usiłuję zbudować klasyfikator z wieloma etykietami, aby przypisywać tematy do istniejących dokumentów za pomocą programu scikit Ja przetwarzanie moich dokumentów przepuszczanie ich przez TfidfVectorizeretykiet poprzez podjęcie działań MultiLabelBinarizeri stworzył OneVsRestClassifierze związkiem SGDClassifierjako estymatora. Jednak podczas testowania mojego klasyfikatora otrzymuję tylko wyniki do 0,29, które z tego, co przeczytałem, są dość …

3
Jak jest , współrzędna biegunowa, rozkładana, gdy i kiedy ?
Niech wybrane zostaną współrzędne kartezjańskie losowego punktu st .x,yx,yx,y(x,y)∼U(−10,10)×U(−10,10)(x,y)∼U(−10,10)×U(−10,10)(x,y) \sim U(-10,10) \times U(-10,10) Tak więc, promień , a nie jest rozmieszczone równomiernie jak sugeruje \ Rho jest PDF . ρρ=x2+y2−−−−−−√ρ=x2+y2\rho = \sqrt{x^2 + y^2}ρρ\rho Niemniej jednak oczekiwałbym, że θ=arctanyxθ=arctan⁡yx\theta = \arctan{\frac{y}{x}} będzie prawie jednolity, z wyłączeniem artefaktów z powodu 4 …

3
Czy kikut decyzji jest modelem liniowym?
Kikut decyzyjny jest drzewem decyzyjnym z tylko jednym podziałem. Można go również zapisać jako funkcję fragmentaryczną. Załóżmy na przykład, że jest wektorem, a jest pierwszym składnikiem , w ustawieniach regresji, niektóre kikuty decyzyjne mogą byćxxx xx1x1x_1xxx f(x)={35x1≤2x1>2f(x)={3x1≤25x1>2f(x)= \begin{cases} 3& x_1\leq 2 \\ 5 & x_1 > 2 \\ \end{cases} Ale …

5
Kiedy centralne twierdzenie graniczne i prawo wielkich liczb nie zgadzają się
Jest to zasadniczo replika pytania, które znalazłem na stronie math.se , na które nie uzyskałem odpowiedzi, na które liczyłem. Niech {Xi}i∈N{Xi}i∈N\{ X_i \}_{i \in \mathbb{N}} będzie ciągiem niezależnych, identycznie rozmieszczonych zmiennych losowych, z i .E[Xi]=1E[Xi]=1\mathbb{E}[X_i] = 1V[Xi]=1V[Xi]=1\mathbb{V}[X_i] = 1 Rozważ ocenę limn→∞P(1n−−√∑i=1nXi≤n−−√)limn→∞P(1n∑i=1nXi≤n) \lim_{n \to \infty} \mathbb{P}\left(\frac{1}{\sqrt{n}} \sum_{i=1}^n X_i \leq \sqrt{n}\right) …

1
Antonim wariancji
Czy istnieje słowo, które oznacza „odwrotność wariancji”? To znaczy, jeśli ma dużą wariancję, to ma niskie ? Nie jesteś zainteresowany bliskim antonimem (jak „zgoda” lub „podobieństwo”), ale konkretnie oznacza ?X … 1 / σ 2XXXXXX……\dots1 / σ2)1/σ21/\sigma^2

5
Co w nazwie: hiperparametry
Zatem w rozkładzie normalnym mamy dwa parametry: średnią i wariancję . W książce Rozpoznawanie wzorców i uczenie maszynowe nagle pojawia się hiperparametr w terminach regularyzacji funkcji błędu.σ 2 λμμ\muσ2σ2\sigma^2λλ\lambda Co to są hiperparametry? Dlaczego są tak nazwani? W jaki sposób intuicyjnie różnią się one od parametrów w ogóle?

3
Czego należy najpierw nauczyć: prawdopodobieństwo czy statystyka?
Niedawno dołączyłem jako członek wydziału w dziale matematyki. renomowanej instytucji. Będę prowadził kurs Prawdopodobieństwo i statystyka na poziomie licencjackim. Instytucja ma już program nauczania tego kursu, z którego nie jestem bardzo zadowolony. W tym programie najpierw uwzględniono statystyki, brakuje również części dotyczącej szacowania. Zawsze uważałem, że należy nauczyć podstaw prawdopodobieństwa …
19 teaching 

2
Czy regularyzacja może być pomocna, jeśli interesuje nas tylko modelowanie, a nie prognozowanie?
Czy regularyzacja może być pomocna, jeśli jesteśmy zainteresowani jedynie szacunkiem (i interpretacją) parametrów modelu, a nie prognozowaniem lub prognozowaniem? Widzę, jak regularyzacja / walidacja krzyżowa jest niezwykle przydatna, jeśli Twoim celem jest dobre prognozowanie nowych danych. Ale co, jeśli robisz tradycyjną ekonomię, a wszystko, na czym ci zależy, to szacowanie …


5
Jakie są dobre zestawy danych do nauki podstawowych algorytmów uczenia maszynowego i dlaczego?
Jestem nowy w uczeniu maszynowym i szukam niektórych zestawów danych, za pomocą których mogę porównywać i kontrastować różnice między różnymi algorytmami uczenia maszynowego (drzewa decyzyjne, przyspieszenie, SVM i sieci neuronowe) Gdzie mogę znaleźć takie zbiory danych? Czego powinienem szukać podczas rozważania zestawu danych? Byłoby wspaniale, gdybyś mógł wskazać kilka dobrych …


2
Dlaczego szacowanie maksymalnego prawdopodobieństwa jest uważane za technikę częstokroć
Częstotliwościowe statystyki są dla mnie równoznaczne z podejmowaniem decyzji, które są dobre dla wszystkich możliwych próbek. Tj częstościowym reguła decyzyjna zawsze powinien starać się zminimalizować ryzyko częstościowym, która zależy na funkcji strata L i prawdziwego stanu natury θ 0 :δδ\deltaL.L.Lθ0θ0\theta_0 Rfar e q= Eθ0( L ( θ0, δ( Y) )Rfarmiq=miθ0(L.(θ0,δ(Y))R_\mathrm{freq}=\mathbb{E}_{\theta_0}(L(\theta_0,\delta(Y)) …

2
Zwiększenie: dlaczego współczynnik uczenia się nazywa się parametrem regularyzacji?
Szybkość uczenia się parametr ( ) gradientu Zwiększenie kurczy wkładu każdego nowego modelu podstawowego -typically zawiera drzewo płytka, że dodaje się w serii. Wykazano, że radykalnie zwiększa dokładność zestawu testowego, co jest zrozumiałe, ponieważ przy mniejszych krokach minimum funkcji straty można uzyskać bardziej precyzyjnie. ν∈ [ 0 , 1 ]ν∈[0,1]\nu …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.