Patrzyłem na częściowo nadzorowane metody uczenia się i natknąłem się na koncepcję „pseudo-etykietowania”. Jak rozumiem, dzięki pseudo-etykietowaniu masz zestaw danych oznaczonych etykietą, a także zestaw danych nieznakowanych. Najpierw trenujesz model tylko na danych z etykietami. Następnie wykorzystujesz te początkowe dane do klasyfikowania (dołączania tymczasowych etykiet) do nieoznaczonych danych. Następnie przekazujesz …
Czy istnieje matematyczna lub algorytmiczna definicja nadmiernego dopasowania? Często podawanymi definicjami są klasyczny dwuwymiarowy wykres punktów z linią przechodzącą przez każdy punkt, a krzywa utraty walidacji nagle rośnie. Ale czy istnieje matematycznie rygorystyczna definicja?
Do regresji wykorzystywane są losowe lasy. Jednak z tego, co rozumiem, przypisują średnią wartość docelową na każdym liściu. Ponieważ w każdym drzewie jest tylko ograniczona liczba liści, istnieją tylko określone wartości, które cel może uzyskać z naszego modelu regresji. Czy zatem nie jest to regresja „dyskretna” (jak funkcja krokowa), a …
Próbuję zrozumieć, czym jest łańcuch Markov Monte Carlo (MCMC) ze strony francuskiej Wikipedii. Mówią, że „metody Monte Carlo w łańcuchu Markowa polegają na generowaniu wektora xjaxjax_ {i} tylko z danych wektorowych xi - 1xja-1x_ {i-1} , dlatego jest to proces„ bez pamięci ”” Les méthodes de Monte-Carlo par chaînes de …
Kiedy słowo „uprzedzenie” ukuto w znaczeniu „ ?E [ θ^- θ ]E[θ^−θ]\mathbb{E}[\hat{\theta}-\theta] Powodem, dla którego teraz o tym myślę, jest to, że przypominam Jaynesa w tekście teorii prawdopodobieństwa , krytykując użycie słowa „stronniczość” użytego do opisania tej formuły i sugerując alternatywę. Z teorii prawdopodobieństwa Jaynesa , sekcja 17.2 „Bezstronni estymatorzy:” …
Krokowe algorytmiczne metody selekcji zmiennych mają tendencję do wybierania dla modeli, które mniej lub bardziej uwzględniają każde oszacowanie w modelach regresji ( ββ\beta i ich SE, wartości p , statystyki F itp.) I prawdopodobnie wykluczą prawdziwe predyktory, takie jak obejmują fałszywe predyktory zgodnie z dość dojrzałą literaturą symulacyjną. Czy LASSO …
Mam zmienną wyniku binarnego {0,1} i zmienną predykcyjną {0,1}. Uważam, że logistyka nie ma sensu, chyba że dołączę inne zmienne i obliczę iloraz szans. Czy z jednym predyktorem binarnym wystarczające byłoby obliczenie prawdopodobieństwa vs iloraz szans?
Najpopularniejsze splotowe sieci neuronowe zawierają pule warstw, aby zmniejszyć wymiary elementów wyjściowych. Dlaczego nie mogłem osiągnąć tego samego, po prostu zwiększając tempo warstwy splotowej? Co sprawia, że warstwa puli jest konieczna?
We wzorze Bayesa: P(x|a)=P(a|x)P(x)P(a)P(x|a)=P(a|x)P(x)P(a)P(x|a) = \frac{P(a|x) P(x)}{P(a)} czy prawdopodobieństwo tylne może przekraczać 1?P(x|a)P(x|a)P(x|a) Myślę, że jest to możliwe, jeśli na przykład przyjmujemy, że i oraz . Ale nie jestem tego pewien, bo co to znaczy, że prawdopodobieństwo jest większe niż jeden?P ( a ) < P ( x ) < …
Mam 10 klasę i zamierzam symulować dane dla projektu targów nauki maszynowego. Ostateczny model zostanie zastosowany do danych pacjenta i będzie przewidywał korelację między niektórymi porami tygodnia i wpływ, jaki ma to na przyleganie leku w danych jednego pacjenta. Wartości przylegania będą binarne (0 oznacza, że nie zażyli leku, 1 …
Czy rozkład normalny zbiega się z określonym rozkładem, jeśli odchylenie standardowe rośnie bez ograniczeń? wydaje mi się, że pdf zaczyna wyglądać jak jednolity rozkład z granicami podanymi przez [−2σ,2σ][−2σ,2σ][-2 \sigma, 2 \sigma] . Czy to prawda?
Pracuję nad projektem Machine Learning z danymi, które są już (w dużym stopniu) stronnicze w wyniku selekcji danych. Załóżmy, że masz zestaw zakodowanych reguł. Jak zbudować model uczenia maszynowego, aby go zastąpić, skoro wszystkie dane, których może użyć, to dane, które zostały już odfiltrowane według tych reguł? Aby to wyjaśnić, …
Czy istnieje jedno angielskie słowo oznaczające „liczbę kolumn” matrycy? Na przykład, „wymiarowości” o matrycy . Potrzebuję terminu na w tym przykładzie. Oczywiście zawsze mogę po prostu powiedzieć „liczbę kolumn”, ale czy mogę podać jedno słowo?2 × 3 32×32)×3)2\times 32×32)×3)2\times 33)3)3
W artykule Wikipedii na temat ANOVA jest napisane W najprostszej postaci ANOVA zapewnia statystyczny test, czy średnie kilku grup są równe, a zatem uogólnia test t na więcej niż dwie grupy. Rozumiem to, że ANOVA jest taka sama jak test t, jeśli chodzi o porównanie dwóch grup. Jednak w moim …
Moi profesorowie fizyki w szkole gradowej, a także szlachetny laureat Feynman, zawsze prezentowali tak zwane modele zabawek, aby zilustrować podstawowe pojęcia i metody w fizyce, takie jak oscylator harmoniczny, wahadło, bączek i czarna skrzynka. Jakie modele zabawek służą do zilustrowania podstawowych pojęć i metod leżących u podstaw zastosowania sieci neuronowych? …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.