Znam tutaj kilka powiązanych pytań (np. Hipoteza testująca terminologię otaczającą zero , Czy można udowodnić hipotezę zerową? ), Ale nie znam ostatecznej odpowiedzi na moje pytanie poniżej. Załóżmy test hipotez, w którym chcemy sprawdzić, czy moneta jest uczciwa, czy nie. Mamy dwie hipotezy: H.0: p ( h e a d) …
Załóżmy, że rozważam kilka niezależnych zmiennych w celu ewentualnego włączenia do opracowywanego modelu ARIMAX. Przed dopasowaniem różnych zmiennych chciałbym odfiltrować zmienne wykazujące odwrotną przyczynowość za pomocą testu Grangera (używam granger.testfunkcji z MSBVARpakietu w R, chociaż uważam, że inne wtrącenia działają podobnie). Jak ustalić, ile opóźnień należy przetestować? Funkcja R to:, …
Można zastosować regresję do wykrycia naszych poziomów. Rozumiem, że istnieją sposoby na ulepszenie modelu regresji poprzez usunięcie wartości odstających. Ale głównym celem tutaj nie jest dopasowanie modelu regresji, ale znalezienie lierów za pomocą regresji
Rozwiązanie problemu: minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] jest dobrze znana jako mediana XXX , ale jak wygląda funkcja utraty dla innych percentyli? Np .: 25. percentyl X jest rozwiązaniem: minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] Co to jest LLL w tym przypadku?
Moja sytuacja: mała wielkość próby: 116 binarna zmienna wyniku długa lista zmiennych objaśniających: 44 zmienne objaśniające nie pochodziły z mojej głowy; ich wybór opierał się na literaturze. większość przypadków w próbie i większość zmiennych ma brakujące wartości. Podejdź do wybranego wyboru funkcji: LASSO Pakiet glmnet R nie pozwala mi uruchomić …
Muszę przestudiować metody Markov Chain Monte Carlo, a dokładniej muszę przestudiować algorytm Metropolis Hastings i wszystko w tym stylu, jak kryteria konwergencji. Kto może przepisać mi książkę, artykuł lub stronę internetową, które wyjaśniają ten argument przy użyciu prostych terminów, ale nie są trywialne?
Według niektórych artykułów, które czytam, powszechnie stosuje się odległość Jeffriesa i Matusity. Ale nie mogłem znaleźć wielu informacji na ten temat, z wyjątkiem poniższej formuły JMD (x, y) = ∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} Jest podobny do odległości euklidesowej z wyjątkiem pierwiastka kwadratowego E (x, y) = ∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} Pod względem klasyfikacji odległość JM jest …
Potrafię trenować regresję logistyczną w zakresie Rkorzystania glm(y ~ x, family=binomial(logit))) ale IIUC optymalizuje to pod kątem prawdopodobieństwa dziennika. Czy istnieje sposób wytrenowania modelu za pomocą funkcji straty liniowej ( L.1L1L_1 ) (która w tym przypadku jest taka sama jak całkowita odległość zmienności )? To znaczy, biorąc pod uwagę wektor …
Próbowałem lepiej zrozumieć kowariancję dwóch zmiennych losowych i zrozumieć, jak pierwsza osoba, która o tym pomyślała, doszła do definicji rutynowo stosowanej w statystyce. Poszedłem na wikipedię, aby lepiej to zrozumieć. Z artykułu wynika, że dobra miara kandydata lub ilość dla powinna mieć następujące właściwości:doo v ( X, Y)Cov(X,Y)Cov(X,Y) Powinien mieć …
Miałem kilka pytań dotyczących interpretacji ilorazów szans dla zmiennych ciągłych w regresji logistycznej. Wydaje mi się, że są to podstawowe pytania dotyczące regresji logistycznej (i prawdopodobnie ogólnie regresji) i chociaż wstydzę się nieco, że nie znam odpowiedzi, przełknę dumę i zapytam, aby je poznać przyszłość! Oto moja sytuacja ... Patrzę …
Próbuję dowiedzieć się, który SVR jest odpowiedni dla tego rodzaju danych. Znam 4 typy SVR: epsilon nu najmniejszych kwadratów i liniowy. Rozumiem, że liniowy SVR przypomina mniej więcej lasso z L1 Reg, ale jaka jest różnica między pozostałymi 3 technikami?
Pracuję nad opracowaniem modelu przewidywania ryzyka ubezpieczeniowego. Modele te mają „rzadkie zdarzenia”, takie jak przewidywanie braku linii lotniczych, wykrywanie usterek sprzętowych itp. Przygotowując zestaw danych, próbowałem zastosować klasyfikację, ale nie mogłem uzyskać przydatnych klasyfikatorów z powodu dużej liczby przypadków negatywnych . Nie mam dużego doświadczenia w statystyce i modelowaniu danych …
Mam 100 000 obserwacji (9 zmiennych fikcyjnych) z 1000 pozytywów. Regresja logistyczna powinna w tym przypadku działać dobrze, ale prawdopodobieństwo odcięcia mnie zastanawia. W powszechnej literaturze wybieramy 50% wartości odcięcia, aby przewidzieć 1 i 0. Nie mogę tego zrobić, ponieważ mój model daje maksymalną wartość ~ 1%. Więc próg może …
Przez ostatnie dwa lata studiowałem statystyki. Prawie wszystko, czego się nauczyłem, dotyczy statystyki parametrycznej. Teraz chciałbym dowiedzieć się więcej o statystyce nieparametrycznej. Czy ktoś może zasugerować zwięzłe (być może również czytelne) wprowadzenie w tę dziedzinę?
Mam dużą (650K wierszy * 62 kolumny) macierz danych binarnych (tylko wpisy 0-1). Matryca jest w większości rzadka: około 8% jest wypełnione. Chciałbym podzielić go na 5 grup - powiedzmy nazwanych od 1 do 5. Próbowałem zgrupować hierarchicznie i nie byłem w stanie obsłużyć rozmiaru. Użyłem również algorytmu grupowania k-średnich …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.