Bayesowska książka Kruschkego mówi o zastosowaniu dystrybucji beta do rzutu monetą, Na przykład, jeśli nie mamy wcześniejszej wiedzy innej niż wiedza, że moneta ma stronę głowy i stronę ogona, jest to równoznaczne z wcześniejszym zaobserwowaniem jednej głowy i jednego ogona, co odpowiada a = 1 i b = 1. Dlaczego …
W tym poście możesz przeczytać oświadczenie: Modele są zwykle reprezentowane przez punkty na kolektorze o skończonych wymiarach.θθ\theta W geometrii różnicowej i statystyce Michaela K Murraya i Johna W. Rice'a pojęcia te są wyjaśnione czytelną prozą, nawet ignorując wyrażenia matematyczne. Niestety jest bardzo mało ilustracji. To samo dotyczy tego postu na …
W uczeniu maszynowym (w przypadku problemów z regresją) często widzę błąd średniej kwadratowej (MSE) lub średni błąd bezwzględny (MAE) jako funkcję błędu w celu zminimalizowania (plus termin regularyzacji). Zastanawiam się, czy istnieją sytuacje, w których zastosowanie współczynnika korelacji byłoby bardziej odpowiednie? jeżeli taka sytuacja istnieje, to: W jakich sytuacjach współczynnik …
Wykonuję binarne zadanie klasyfikacyjne, w którym prawdopodobieństwo wyniku jest dość niskie (około 3%). Próbuję zdecydować, czy przeprowadzić optymalizację na podstawie AUC, czy utraty logów. O ile rozumiem, AUC maksymalizuje zdolność modelu do rozróżnienia między klasami, podczas gdy utrata logiczna karze rozbieżność między rzeczywistymi a szacowanymi prawdopodobieństwami. W moim zadaniu niezwykle …
Czytam tutaj artykuł z Wikipedii na temat modeli statystycznych i jestem nieco zaniepokojony znaczeniem „nieparametrycznych modeli statystycznych”, a konkretnie: Model statystyczny jest nieparametryczny, jeśli zestaw parametrów ma nieskończony wymiar. Model statystyczny jest semiparametryczny, jeśli ma zarówno parametry skończone, jak i nieskończenie wymiarowe. Formalnie, jeśli jest wymiarem a jest liczbą próbek, …
Obecnie pracuję nad budowaniem modelu predykcyjnego dla wyniku binarnego na zbiorze danych z ~ 300 zmiennymi i 800 obserwacjami. Dużo przeczytałem na tej stronie o problemach związanych z regresją krokową i dlaczego jej nie używać. Czytałem o regresji LASSO i jej możliwościach wyboru funkcji i udało mi się ją wdrożyć …
Zacząłem uczyć się o sieciach neuronowych w samouczku dotyczącym sieci neuronowych i programowania. W szczególności w trzecim rozdziale znajduje się sekcja o funkcji entropii krzyżowej i definiuje utratę entropii krzyżowej jako: C=−1n∑x∑j(yjlnaLj+(1−yj)ln(1−aLj))C=−1n∑x∑j(yjlnajL+(1−yj)ln(1−ajL))C = -\frac{1}{n} \sum\limits_x \sum\limits_j (y_j \ln a^L_j + (1-y_j) \ln (1 - a^L_j)) Jednak, czytając wprowadzenie Tensorflow , …
Załóżmy, że ma macierzy kowariancji i . Które z tych opcji są zatem również macierzami kowariancji?XXXYYY X+YX+YX+Y X2X2X^2 XYXYXY Mam trochę problemów ze zrozumieniem, co dokładnie jest potrzebne, aby coś mogło być matrycą kowariancji. Podejrzewam, że oznacza to na przykład, że jeśli nazwa , a że aby 1 mógł być …
Chcę użyć ładowania początkowego, aby oszacować przedziały ufności dla szacowanych parametrów z zestawu danych panelu z N = 250 firmami i T = 50 miesiącami. Oszacowanie parametrów jest drogie obliczeniowo (kilka dni obliczeń) ze względu na zastosowanie filtrowania Kalmana i złożonej estymacji nieliniowej. Dlatego pobieranie (z zastąpieniem) próbek B (w …
Niedawno odświeżyłem swoją wiedzę na temat prognozowania, pracując nad niektórymi miesięcznymi prognozami w pracy i czytając książkę Roba Hyndmana, ale jedyne miejsce, w którym walczę, to kiedy zastosować model wygładzania wykładniczego w porównaniu z modelem ARIMA. Czy istnieje ogólna zasada, w której należy stosować jedną metodologię zamiast innej? Ponadto, ponieważ …
Zadałbym pytanie związane z tym . Znalazłem przykład pisania niestandardowej funkcji utraty dla xgboost tutaj : loglossobj <- function(preds, dtrain) { # dtrain is the internal format of the training data # We extract the labels from the training data labels <- getinfo(dtrain, "label") # We compute the 1st and …
Czy każda z nich implikuje drugą? Jeśli nie, to czy jedno implikuje drugie? Dlaczego? Dlaczego nie? Ten problem pojawił się w odpowiedzi na komentarz do zamieszczonej tutaj odpowiedzi . Chociaż wyszukiwanie w Google odpowiednich haseł nie dało nic, co wydawałoby się szczególnie przydatne, zauważyłem odpowiedź na temat wymiany stosów matematycznych. …
Zawsze uczono mnie, że CLT działa, gdy powtarzasz próbkowanie, a każda próbka jest wystarczająco duża. Wyobraź sobie na przykład, że mam kraj 1 000 000 obywateli. Rozumiem, że CLT jest taki, że nawet jeśli rozkład ich wysokości nie był normalny, gdybym pobrał 1000 próbek 50 osób (tj. Przeprowadził 1000 ankiet …
Próba obliczenia liczby odwiedzin na podstawie danych demograficznych i usług. Dane są bardzo wypaczone. Histogramy: wykresy qq (po lewej jest log): m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) cityi servicesą zmiennymi czynnikowymi. Otrzymuję niską wartość p *** dla wszystkich zmiennych, ale dostaję także niski r-kwadrat wynoszący 0,05. Co powinienem zrobić? Czy …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.