Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Czy w przypadku klasyfikatorów liniowych większe współczynniki implikują ważniejsze cechy?
Jestem inżynierem oprogramowania zajmującym się uczeniem maszynowym. Z mojego zrozumienia, regresja liniowa (taka jak OLS) i klasyfikacja liniowa (taka jak regresja logistyczna i SVM) przewidują na podstawie iloczynu wewnętrznego między wyuczonymi współczynnikami a zmiennymi funkcji :w⃗ w→\vec{w}x⃗ x→\vec{x} y^=f(w⃗ ⋅x⃗ )=f(∑iwixi)y^=f(w→⋅x→)=f(∑iwixi) \hat{y} = f(\vec{w} \cdot \vec{x}) = f(\sum_{i} w_i x_i) …

1
Suma czy średnia gradientów w (mini) gradiencie serii przyzwoitym?
Kiedy zaimplementowałem przyzwoity gradient mini partii, po prostu uśredniłem gradienty wszystkich przykładów w partii treningowej. Zauważyłem jednak, że teraz optymalna szybkość uczenia się jest znacznie wyższa niż w przypadku przyzwoitego gradientu online. Moją intuicją jest to, że uśredniony gradient jest mniej hałaśliwy i dlatego można go śledzić szybciej. Może więc …

2
Duża różnorodność weryfikacji krzyżowej z pominięciem jednego z nich
Czytałem w kółko, że walidacja krzyżowa „Leave-one-out-out” ma dużą wariancję ze względu na duże nakładanie się fałdów treningowych. Nie rozumiem jednak, dlaczego tak jest: czy wydajność walidacji krzyżowej nie powinna być bardzo stabilna (niska wariancja) właśnie dlatego, że zestawy treningowe są prawie identyczne? Czy też źle rozumiem pojęcie „wariancji”? Nie …

2
Zrozumienie obliczeń korelacji odległości
O ile rozumiem, korelacja odległości jest solidnym i uniwersalnym sposobem sprawdzenia, czy istnieje związek między dwiema zmiennymi numerycznymi. Na przykład, jeśli mamy zestaw par liczb: (x1, y1) (x2, y2) ... (xn, yn) możemy użyć korelacji odległości, aby sprawdzić, czy istnieje jakaś (niekoniecznie liniowa) zależność między dwiema zmiennymi ( xi y). …

2
Jaki jest związek między łańcuchem Markov a łańcuchem Markov monte carlo
Próbuję zrozumieć łańcuchy Markowa za pomocą SAS. Rozumiem, że proces Markowa to taki, w którym przyszły stan zależy tylko od stanu bieżącego, a nie od stanu przeszłego, i istnieje matryca przejścia, która wychwytuje prawdopodobieństwo przejścia z jednego stanu do drugiego. Ale potem natrafiłem na ten termin: Markov Chain Monte Carlo. …

3
Czy model danych nieujemnych z grupowaniem zer (GLM Tweedie, GLM z zerowym napełnieniem itp.) Może przewidywać dokładne zera?
Rozkład Tweediego może modelować skośne dane z masą punktową równą zero, gdy parametr ppp (wykładnik w relacji średnia-wariancja) wynosi od 1 do 2. Podobnie model z napompowaniem zera (inaczej ciągły lub dyskretny) może mieć dużą liczbę zer. Mam problem ze zrozumieniem, dlaczego jest tak, że kiedy przewiduję lub obliczam dopasowane …

5
Jądro SVM: Chcę intuicyjnego zrozumienia mapowania do przestrzennej przestrzeni cech i tego, jak to umożliwia separację liniową
Próbuję zrozumieć intuicję stojącą za SVM jądra. Teraz rozumiem, jak działa liniowy SVM, dzięki czemu tworzona jest linia decyzyjna, która najlepiej dzieli dane. Rozumiem również zasadę przenoszenia danych do przestrzeni o większych wymiarach oraz sposób, w jaki może to ułatwić znalezienie liniowej linii decyzyjnej w tej nowej przestrzeni. Nie rozumiem, …

1
istotność różnicy między dwiema liczbami
Czy istnieje sposób ustalenia, czy różnica między liczbą wypadków drogowych w czasie 1 znacznie różni się od liczby wypadków w czasie 2? Znalazłem różne metody określania różnicy między grupami obserwacji w różnych momentach (np. Porównywanie średnich Poissona), ale nie do porównywania tylko dwóch zliczeń. A może próba wręcz jest nieprawidłowa? …

1
Mam linię najlepszego dopasowania. Potrzebuję punktów danych, które nie zmienią mojej linii najlepszego dopasowania
Prowadzę prezentację na temat dopasowania linii. Mam prostą funkcję liniową, . Próbuję uzyskać rozproszone punkty danych, które mogę umieścić na wykresie rozrzutu, który utrzyma moją linię najlepszego dopasowania na tym samym równaniu.y=1x+by=1x+by=1x+b Chciałbym nauczyć się tej techniki w R lub Excel - w zależności od tego, co jest łatwiejsze.


1
Co jeśli wysoka dokładność walidacji, ale niska dokładność testu w badaniach?
Mam konkretne pytanie dotyczące walidacji w badaniach nad uczeniem maszynowym. Jak wiemy, system uczenia maszynowego prosi badaczy o szkolenie modeli na temat danych szkoleniowych, wybranie spośród modeli kandydujących według zestawu walidacyjnego i podanie dokładności zestawu testowego. W bardzo rygorystycznych badaniach zestaw testowy może być użyty tylko raz. Jednak nigdy nie …

3
Splajny vs regresja procesu Gaussa
Wiem, że regresja procesu Gaussa (GPR) jest alternatywą dla używania splajnów do dopasowania elastycznych modeli nieliniowych. Chciałbym wiedzieć, w jakich sytuacjach jedna byłaby bardziej odpowiednia niż druga, szczególnie w ramach regresji bayesowskiej. Już spojrzałem na Jakie są zalety / wady używania splajnów, wygładzonych splajnów i emulatorów procesu gaussowskiego? ale w …


1
Czy istnieje jakakolwiek wymagana wariancja zarejestrowana przez PCA w celu przeprowadzenia późniejszych analiz?
Mam zestaw danych z 11 zmiennymi i PCA (ortogonalny) został zrobiony w celu zmniejszenia danych. Zdecydowanie o liczbie składników, które miałyby je zachować, było dla mnie oczywiste z mojej wiedzy na ten temat i wykresu piargowego (patrz poniżej), że dwa główne składniki (komputery osobiste) wystarczały do ​​wyjaśnienia danych, a pozostałe …
15 variance  pca 

1
W jaki sposób CNN unikają problemu znikającego gradientu
Dużo czytałem o splotowych sieciach neuronowych i zastanawiałem się, w jaki sposób unikają problemu znikającego gradientu. Wiem, że sieci głębokiego przekonania stosują auto-kodery jednopoziomowe lub inne wstępnie wyszkolone płytkie sieci, dzięki czemu mogę uniknąć tego problemu, ale nie wiem, jak można go uniknąć w sieciach CNN. Według Wikipedii : „pomimo …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.