Mam zestaw danych, w którym częstotliwość zdarzeń jest bardzo niska (40 000 z ). Stosuję w tym regresję logistyczną. Rozmawiałem z kimś, gdzie okazało się, że regresja logistyczna nie dałaby dobrej macierzy pomieszania w przypadku tak niskich danych o częstości zdarzeń. Ale z powodu problemu biznesowego i sposobu, w jaki …
Prowadzę eksperyment, w którym równolegle zbieram (niezależne) próbki, obliczam wariancję każdej grupy próbek, a teraz chcę połączyć wszystkie, aby znaleźć całkowitą wariancję wszystkich próbek. Trudno mi znaleźć na to pochodne, ponieważ nie jestem pewien terminologii. Myślę o tym jak o podziale jednego RV. Więc chcę znaleźć Var(X)Var(X)Var(X) z Var(X1)Var(X1)Var(X_1) , …
Jeśli FZFZF_Z jest CDF, wygląda na to, że FZ(z)αFZ(z)αF_Z(z)^\alpha ( α>0α>0\alpha \gt 0 ) również jest CDF. P: Czy to wynik standardowy? P: Czy istnieje dobry sposób na znalezienie funkcji ggg pomocą X≡g(Z)X≡g(Z)X \equiv g(Z) st FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alpha , gdzie x≡g(z)x≡g(z) x \equiv g(z) Zasadniczo mam w ręku inny …
Próbowałem grupować zestaw danych (zestaw znaków) i otrzymałem 2 klastry. Chciałbym to przedstawić graficznie. Trochę zdezorientowany co do reprezentacji, ponieważ nie mam współrzędnych (x, y). Poszukuję również do tego celu MATLAB / Python. EDYTOWAĆ Myślę, że publikowanie danych wyjaśnia pytanie. Mam dwa klastry, które utworzyłem za pomocą klastrowania kmeans w …
Jeden z predyktorów w moim modelu logistycznym został przekształcony w log. Jak interpretujesz szacowany współczynnik predyktora przekształconego logem i jak obliczasz wpływ tego predyktora na iloraz szans?
Grałem z niektórymi jednostkowymi testami root w R i nie jestem do końca pewien, co zrobić z parametrem k lag. Użyłem rozszerzonego testu Dickeya Fullera i testu Philippsa Perrona z pakietu terser . Oczywiście domyślny parametr (dla ) zależy tylko od długości serii. Jeśli wybiorę inne wartości K , otrzymam …
Użyłem terminu „przypadek Heywooda” w sposób nieco nieformalny, aby odnieść się do sytuacji, w których online, „skończona odpowiedź” iteracyjnie zaktualizowana ocena wariancji stała się negatywna z powodu problemów z precyzją liczbową. (Korzystam z wariantu metody Welforda, aby dodawać dane i usuwać starsze dane). Miałem wrażenie, że odnosi się to do …
Moje statystyki są samoukiem, ale wiele przeczytanych przeze mnie materiałów wskazuje na zbiór danych o średniej 0 i standardowym odchyleniu 1. Jeśli tak jest, to: Dlaczego średnia 0 i SD 1 to dobra właściwość? Dlaczego losowa zmienna pobrana z tej próbki wynosi 0,5? Szansa na narysowanie 0,001 jest taka sama …
Mam zestaw danych, który spodziewałbym się podążać za rozkładem Poissona, ale jest on rozproszony około 3-krotnie. Obecnie modeluję tę naddyspersję za pomocą czegoś takiego jak następujący kod w R. ## assuming a median value of 1500 med = 1500 rawdist = rpois(1000000,med) oDdist = rawDist + ((rawDist-med)*3) Wizualnie wydaje się, …
Zdaję sobie sprawę, że może to być potencjalnie szerokie pytanie, ale zastanawiałem się, czy istnieją uogólnione założenia, które wskazują na użycie GAM (Uogólniony model addytywny) w stosunku do GLM (Uogólniony model liniowy)? Ktoś niedawno powiedział mi, że GAM należy używać tylko wtedy, gdy założę, że struktura danych jest „addytywna”, tj. …
Jako kontynuacja Mojej sieci neuronowej nie mogę nawet nauczyć się odległości euklidesowej , uprościłem jeszcze bardziej i próbowałem wyszkolić jedną jednostkę ReLU (o losowej wadze) do jednej jednostki ReLU. Jest to najprostsza z dostępnych sieci, a mimo to w połowie przypadków nie jest ona zbieżna. Jeśli początkowe przypuszczenie jest w …
Zamierzam użyć rozbieżności KL w moim kodzie python i mam ten samouczek . W tym samouczku wdrożenie rozbieżności KL jest dość proste. kl = (model * np.log(model/actual)).sum() Jak rozumiem, rozkład prawdopodobieństwa modeli actualpowinien wynosić <= 1. Moje pytanie brzmi: jaka jest maksymalna związana / maksymalna możliwa wartość k ?. Muszę …
Korzystam z dwumianowej regresji logistycznej, aby określić, czy narażenie has_xlub ma has_ywpływ na prawdopodobieństwo kliknięcia przez użytkownika. Mój model jest następujący: fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) To wynik z mojego modelu: Call: glm(formula = has_clicked ~ has_x + has_y, family = binomial(), …
To jest pytanie do dyskusji na temat skrzyżowania statystyki i innych nauk. Często napotykam ten sam problem: badacze w mojej dziedzinie twierdzą, że nie ma żadnego efektu, gdy wartość p jest nie mniejsza niż poziom istotności. Na początku często odpowiadałem, że nie tak działa testowanie hipotez. Biorąc pod uwagę, jak …
Praktycznie każda baza danych, w której chcemy przewidywać za pomocą algorytmów uczenia maszynowego, znajdzie brakujące wartości niektórych cech. Istnieje kilka podejść do rozwiązania tego problemu, aby wykluczyć linie, w których brakuje wartości, dopóki nie wypełnią się średnimi wartościami cech. Chciałbym zastosować nieco bardziej niezawodne podejście, które zasadniczo uruchomiłoby regresję (lub …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.