Czy są jakieś prace / książki / pomysły na temat związku między liczbą cech a liczbą obserwacji, które należy przeprowadzić, aby wyszkolić „solidnego” klasyfikatora? Załóżmy na przykład, że mam 1000 cech i 10 obserwacji z dwóch klas jako zestaw treningowy i 10 innych obserwacji jako zestaw testowy. Trenuję jakiś klasyfikator …
Odbyła się już doskonała dyskusja na temat tego, w jaki sposób maszyny wektorów nośnych radzą sobie z klasyfikacją, ale jestem bardzo zdezorientowany, w jaki sposób maszyny wektorów nośnych uogólniają się na regresję. Czy ktoś chce mnie oświecić?
W wielokrotnej regresji liniowej rozumiem, że korelacje między resztą a predyktorami wynoszą zero, ale jaka jest oczekiwana korelacja między resztą a zmienną kryterium? Czy powinno być zerowe czy wysoce skorelowane? Jakie jest tego znaczenie?
Interesuje mnie regresja z sieciami neuronowymi. Sieci neuronowe z zerowymi ukrytymi węzłami + połączenia warstwy pomijanej są modelami liniowymi. Co z tymi samymi sieciami neuronowymi, ale z ukrytymi węzłami? Zastanawiam się, jaka byłaby rola połączeń pominięcia warstwy? Intuicyjnie powiedziałbym, że jeśli uwzględnisz połączenia pominięcia warstwy, wówczas model końcowy będzie sumą …
Niedawno uznałem za konieczne wyprowadzenie pdf dla kwadratu normalnej zmiennej losowej ze średnią 0. Z jakiegokolwiek powodu postanowiłem nie normalizować wcześniej wariancji. Jeśli zrobiłem to poprawnie, ten plik pdf wygląda następująco: N2(x;σ2)=1σ2π−−√x−−√e−x2σ2N2(x;σ2)=1σ2πxe−x2σ2 N^2(x; \sigma^2) = \frac{1}{\sigma \sqrt{2 \pi} \sqrt{x}} e^{\frac{-x}{2\sigma^2}} Zauważyłem, że w rzeczywistości była to tylko parametryzacja rozkładu gamma: …
Zainspirowany przemową Petera Donnelly'ego na TED , w której omawia on, jak długo zajmie pojawienie się określonego wzoru w serii rzutów monetą, stworzyłem następujący skrypt w R. Biorąc pod uwagę dwa wzory „hth” i „htt”, to oblicza, ile czasu zajmuje średnio (tj. ile rzutów monetą), zanim trafisz jeden z tych …
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 6 lat temu . Chciałbym przeprowadzić kolumnową normalizację macierzy w R. Biorąc pod uwagę macierz m, chcę znormalizować każdą kolumnę dzieląc każdy element przez sumę …
W Internecie wiele znalazłem na temat interpretacji efektów losowych i stałych. Jednak nie udało mi się uzyskać źródła określającego: Jaka jest matematyczna różnica między efektami losowymi i stałymi? Rozumiem przez to matematyczne sformułowanie modelu i sposób szacowania parametrów.
Wcześniej używałem prognozy pro do prognozowania szeregów czasowych na jednym szeregu, ale zmieniam przepływ pracy na R. Pakiet prognozy dla R zawiera wiele przydatnych funkcji, ale jedna rzecz nie robi to jakiejkolwiek transformacji danych przed uruchomieniem auto .arima (). W niektórych przypadkach prognozy pro decydują się na rejestrowanie danych transformacji …
w prawie wszystkich przykładach kodu, które widziałem w VAE, funkcje utraty są zdefiniowane w następujący sposób (jest to kod tensorflow, ale widziałem podobne dla theano, latarki itp. To także dla konwektu, ale to też nie jest zbyt istotne , wpływa tylko na osie, w których sumy są przejmowane): # latent …
Mam bardzo niezrównoważony zestaw danych. Staram się postępować zgodnie ze wskazówkami dotyczącymi tuningu i używać go, scale_pos_weightale nie jestem pewien, jak go dostroić. Widzę, że RegLossObj.GetGradient: if (info.labels[i] == 1.0f) w *= param_.scale_pos_weight więc gradient próbki dodatniej byłby bardziej wpływowy. Jednak zgodnie z artykułem xgboost statystyka gradientów jest zawsze używana …
Załóżmy, że model ma 100% dokładności danych treningowych, ale 70% dokładności danych testowych. Czy następujący argument dotyczy tego modelu? Oczywiste jest, że jest to model przebudowany. Dokładność testu można zwiększyć, zmniejszając nadmierne dopasowanie. Ale ten model może nadal być użytecznym modelem, ponieważ ma akceptowalną dokładność dla danych testowych.
Pamiętam, że jakiś czas temu przeczytałem, że w starych książkach (w czasach przedkomputerowych) ostatnie cyfry teoretycznych kwantyli pokazane w dodatkach były niedokładne, aby zniechęcić do plagiatu (pomysł byłby taki, gdyby inna książka miała tabelę w dodatek, w którym ostatnie cyfry są identyczne z cyframi znajdującymi się w twoim, to autor …
Czy to prawda, że metody bayesowskie nie pasują do siebie? (Widziałem kilka artykułów i samouczków przedstawiających to twierdzenie) Na przykład, jeśli zastosujemy Proces Gaussa do MNIST (odręczna klasyfikacja cyfr), ale pokażemy tylko jedną próbkę, czy powróci on do wcześniejszego rozkładu dla jakichkolwiek danych wejściowych innych niż ta pojedyncza próbka, jakkolwiek …
Ludzie często mówią, że jakieś wydarzenie ma 50-60% szansy na wydarzenie. Czasami nawet widzę, jak ludzie podają wyraźne słupki błędów przy przypisywaniu prawdopodobieństwa. Czy te stwierdzenia mają jakieś znaczenie, czy są jedynie dziwactwem językowym, wybierając konkretną liczbę dla czegoś, co z natury jest niepoznawalne?
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.