Jestem inżynierem oprogramowania zajmującym się uczeniem maszynowym. Z mojego zrozumienia, regresja liniowa (taka jak OLS) i klasyfikacja liniowa (taka jak regresja logistyczna i SVM) przewidują na podstawie iloczynu wewnętrznego między wyuczonymi współczynnikami a zmiennymi funkcji :w⃗ w→\vec{w}x⃗ x→\vec{x} y^=f(w⃗ ⋅x⃗ )=f(∑iwixi)y^=f(w→⋅x→)=f(∑iwixi) \hat{y} = f(\vec{w} \cdot \vec{x}) = f(\sum_{i} w_i x_i) …
Kiedy zaimplementowałem przyzwoity gradient mini partii, po prostu uśredniłem gradienty wszystkich przykładów w partii treningowej. Zauważyłem jednak, że teraz optymalna szybkość uczenia się jest znacznie wyższa niż w przypadku przyzwoitego gradientu online. Moją intuicją jest to, że uśredniony gradient jest mniej hałaśliwy i dlatego można go śledzić szybciej. Może więc …
Czytałem w kółko, że walidacja krzyżowa „Leave-one-out-out” ma dużą wariancję ze względu na duże nakładanie się fałdów treningowych. Nie rozumiem jednak, dlaczego tak jest: czy wydajność walidacji krzyżowej nie powinna być bardzo stabilna (niska wariancja) właśnie dlatego, że zestawy treningowe są prawie identyczne? Czy też źle rozumiem pojęcie „wariancji”? Nie …
O ile rozumiem, korelacja odległości jest solidnym i uniwersalnym sposobem sprawdzenia, czy istnieje związek między dwiema zmiennymi numerycznymi. Na przykład, jeśli mamy zestaw par liczb: (x1, y1) (x2, y2) ... (xn, yn) możemy użyć korelacji odległości, aby sprawdzić, czy istnieje jakaś (niekoniecznie liniowa) zależność między dwiema zmiennymi ( xi y). …
Próbuję zrozumieć łańcuchy Markowa za pomocą SAS. Rozumiem, że proces Markowa to taki, w którym przyszły stan zależy tylko od stanu bieżącego, a nie od stanu przeszłego, i istnieje matryca przejścia, która wychwytuje prawdopodobieństwo przejścia z jednego stanu do drugiego. Ale potem natrafiłem na ten termin: Markov Chain Monte Carlo. …
Rozkład Tweediego może modelować skośne dane z masą punktową równą zero, gdy parametr ppp (wykładnik w relacji średnia-wariancja) wynosi od 1 do 2. Podobnie model z napompowaniem zera (inaczej ciągły lub dyskretny) może mieć dużą liczbę zer. Mam problem ze zrozumieniem, dlaczego jest tak, że kiedy przewiduję lub obliczam dopasowane …
Próbuję zrozumieć intuicję stojącą za SVM jądra. Teraz rozumiem, jak działa liniowy SVM, dzięki czemu tworzona jest linia decyzyjna, która najlepiej dzieli dane. Rozumiem również zasadę przenoszenia danych do przestrzeni o większych wymiarach oraz sposób, w jaki może to ułatwić znalezienie liniowej linii decyzyjnej w tej nowej przestrzeni. Nie rozumiem, …
Czy istnieje sposób ustalenia, czy różnica między liczbą wypadków drogowych w czasie 1 znacznie różni się od liczby wypadków w czasie 2? Znalazłem różne metody określania różnicy między grupami obserwacji w różnych momentach (np. Porównywanie średnich Poissona), ale nie do porównywania tylko dwóch zliczeń. A może próba wręcz jest nieprawidłowa? …
Prowadzę prezentację na temat dopasowania linii. Mam prostą funkcję liniową, . Próbuję uzyskać rozproszone punkty danych, które mogę umieścić na wykresie rozrzutu, który utrzyma moją linię najlepszego dopasowania na tym samym równaniu.y=1x+by=1x+by=1x+b Chciałbym nauczyć się tej techniki w R lub Excel - w zależności od tego, co jest łatwiejsze.
W teorii prawdopodobieństwa nieujemna zmienna losowa XXX jest nazywana siatką, jeśli istnieje tak że .d≥0d≥0d \geq 0∑∞n=0P(X=nd)=1∑n=0∞P(X=nd)=1\sum_{n=0}^{\infty}P(X=nd) = 1 Czy istnieje geometryczna interpretacja, dlaczego ta definicja nazywa się kratą?
Mam konkretne pytanie dotyczące walidacji w badaniach nad uczeniem maszynowym. Jak wiemy, system uczenia maszynowego prosi badaczy o szkolenie modeli na temat danych szkoleniowych, wybranie spośród modeli kandydujących według zestawu walidacyjnego i podanie dokładności zestawu testowego. W bardzo rygorystycznych badaniach zestaw testowy może być użyty tylko raz. Jednak nigdy nie …
Wiem, że regresja procesu Gaussa (GPR) jest alternatywą dla używania splajnów do dopasowania elastycznych modeli nieliniowych. Chciałbym wiedzieć, w jakich sytuacjach jedna byłaby bardziej odpowiednia niż druga, szczególnie w ramach regresji bayesowskiej. Już spojrzałem na Jakie są zalety / wady używania splajnów, wygładzonych splajnów i emulatorów procesu gaussowskiego? ale w …
Mam zestaw danych z 11 zmiennymi i PCA (ortogonalny) został zrobiony w celu zmniejszenia danych. Zdecydowanie o liczbie składników, które miałyby je zachować, było dla mnie oczywiste z mojej wiedzy na ten temat i wykresu piargowego (patrz poniżej), że dwa główne składniki (komputery osobiste) wystarczały do wyjaśnienia danych, a pozostałe …
Dużo czytałem o splotowych sieciach neuronowych i zastanawiałem się, w jaki sposób unikają problemu znikającego gradientu. Wiem, że sieci głębokiego przekonania stosują auto-kodery jednopoziomowe lub inne wstępnie wyszkolone płytkie sieci, dzięki czemu mogę uniknąć tego problemu, ale nie wiem, jak można go uniknąć w sieciach CNN. Według Wikipedii : „pomimo …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.