W Bishop's Pattern Recognition and Machine Learning przeczytałem, co następuje, zaraz po wprowadzeniu gęstości prawdopodobieństwa :
Przy nieliniowej zmianie zmiennej gęstość prawdopodobieństwa przekształca się inaczej niż prosta funkcja, ze względu na czynnik jakobowski. Na przykład, jeśli weźmiemy pod uwagę zmianę zmiennych , wówczas funkcja staje się . Rozważmy teraz gęstość prawdopodobieństwa która odpowiada gęstości w odniesieniu do nowej zmiennej , gdzie wystarczające są oznaczenia faktu, że i mają różne gęstości. Obserwacje mieszczące się w zakresie , dla małych wartości , zostaną przekształcone w zakres ) gdzie , a zatem .
Co to jest czynnik jakobowski i co dokładnie oznacza wszystko (może jakościowo)? Bishop mówi, że konsekwencją tej właściwości jest to, że pojęcie maksymalnej gęstości prawdopodobieństwa zależy od wyboru zmiennej. Co to znaczy?
Dla mnie to wszystko jest trochę niespodziewane (biorąc pod uwagę, że jest to rozdział wprowadzający). Byłbym wdzięczny za wskazówki, dzięki!