Próbuję modelować niektóre dane dotyczące czasu przyjazdu pociągu. Chciałbym użyć dystrybucji, która przechwytuje „im dłużej czekam, tym bardziej prawdopodobne jest, że pociąg się pojawi” . Wydaje się, że taka dystrybucja powinna wyglądać jak CDF, więc P (przyjazd pociągu | czekał 60 minut) jest bliski 1. Jakiej dystrybucji należy tutaj zastosować?
Przeglądałem dokumentację Stana, którą można pobrać stąd . Byłem szczególnie zainteresowany ich wdrożeniem diagnostyki Gelmana-Rubina. Oryginalny artykuł Gelman i Rubin (1992) definiuje potencjalny współczynnik redukcji skali (PSRF) w następujący sposób: Niech Xi,1,…,Xi,NXi,1,…,Xi,NX_{i,1}, \dots , X_{i,N} będą iii -tym łańcuchem Markowa, z którego pobrano próbkę, i niech będzie próbka z całych …
Próbuję przeczytać o badaniach w dziedzinie regresji wielowymiarowej; gdy jest większe niż , to znaczy p >> n . Wydaje się, że termin \ log p / n pojawia się często w odniesieniu do wskaźnika konwergencji dla estymatorów regresji.pppnnnp>>np>>np >> nlogp/nlogp/n\log p/n Na przykład tutaj równanie (17) mówi, że dopasowanie …
To kwestia terminologii. Czasami widzę, że ludzie określają głębokie sieci neuronowe jako „wielowarstwowe perceptrony”, dlaczego tak jest? Nauczono mnie, że perceptron to klasyfikator jednowarstwowy (lub regresor) z wyjściowym progiem binarnym, wykorzystujący określony sposób szkolenia wag (nie z powrotem). Jeśli wynik działania perceptronu nie jest zgodny z wynikiem docelowym, dodajemy lub …
Mam duży zestaw danych o zanieczyszczeniach, które są rejestrowane co 10 minut w ciągu 2 lat, jednak istnieje wiele luk w danych (w tym niektóre, które pojawiają się przez kilka tygodni na raz). Dane wydają się dość sezonowe i istnieje duża zmienność w ciągu dnia w porównaniu do nocy, w …
Jaka jest różnica między łańcuchami Markowa a procesami Markowa? Czytam sprzeczne informacje: czasami definicja jest oparta na tym, czy przestrzeń stanu jest dyskretna, czy ciągła, a czasem na tym, czy czas jest dyskretny ciągłego. Slajd 20 tego dokumentu : Proces Markowa nazywany jest łańcuchem Markowa, jeśli przestrzeń stanu jest dyskretna, …
Moje pytanie brzmi: jaki jest matematyczny związek między rozkładem Beta a współczynnikami modelu regresji logistycznej ? Aby zilustrować: funkcję logistyczną (sigmoid) podano przez f(x)=11+exp(−x)f(x)=11+exp(−x)f(x) = \frac{1}{1+\exp(-x)} i służy do modelowania prawdopodobieństw w modelu regresji logistycznej. Niech AAA będzie wynikiem dychotomicznym (0,1)(0,1)(0,1) a XXX macierzą projektową. Model regresji logistycznej podano przez …
W rozpoznawaniu wzorów książek i uczeniu maszynowym (wzór 1.27) daje py(y)=px(x)∣∣∣dxdy∣∣∣=px(g(y))|g′(y)|py(y)=px(x)|dxdy|=px(g(y))|g′(y)|p_y(y)=p_x(x) \left | \frac{d x}{d y} \right |=p_x(g(y)) | g'(y) | gdziex=g(y)x=g(y)x=g(y),to pdf, który odpowiadaw odniesieniu do zmiany zmiennej.p y ( y )px(x)px(x)p_x(x)py(y)py(y)p_y(y) Książki mówią, że dzieje się tak, ponieważ obserwacje mieszczące się w zakresie (x,x+δx)(x,x+δx)(x, x + \delta x) …
Standardowe zejście gradientu obliczałoby gradient dla całego zestawu danych treningowych. for i in range(nb_epochs): params_grad = evaluate_gradient(loss_function, data, params) params = params - learning_rate * params_grad Dla wstępnie zdefiniowanej liczby epok najpierw obliczamy wektor gradientu wagi_grad funkcji straty dla całego zestawu danych w stosunku do naszych parametrów wektora parametru. Natomiast …
Skonstruowałem krzywą ROC dla systemu diagnostycznego. Pole pod krzywą zostało następnie oszacowane nieparametrycznie na AUC = 0,89. Kiedy próbowałem obliczyć dokładność przy optymalnym ustawieniu progu (punkt najbliższy punktowi (0, 1)), dostałem dokładność układu diagnostycznego na 0,8, czyli mniej niż AUC! Kiedy sprawdziłem dokładność przy innym ustawieniu progu, który jest daleki …
Czy regresja zredukowana rangi i regresja głównych składników to tylko szczególne przypadki częściowych najmniejszych kwadratów? Ten samouczek (strona 6, „Porównanie celów”) stwierdza, że kiedy wykonujemy częściowe najmniejsze kwadraty bez rzutowania X lub Y (tj. „Nie częściowy”), staje się odpowiednio regresją zmniejszoną rangą lub regresją składowych głównych. Podobne oświadczenie znajduje się …
Ryc. 1. Funkcja logistyczna Ryc. 2. Funkcja sigmoidalna czy jest bardziej jak uogólniony rodzaj funkcji sigmoidalnej, w którym można mieć wyższą wartość maksymalną?
Czy istnieje jakieś intuicyjne wyjaśnienie tej terminologii? Dlaczego tak jest, a nie predyktor (y) są regresowane w wyniku? Mam nadzieję, że właściwe wyjaśnienie, dlaczego taka terminologia istnieje, pomoże uczniom zapamiętać ją i powstrzymać przed powiedzeniem jej w niewłaściwy sposób.
Jestem zdezorientowany co do metody maksymalnego prawdopodobieństwa w porównaniu do np. Obliczania średniej arytmetycznej. Kiedy i dlaczego maksymalne prawdopodobieństwo daje „lepsze” oszacowania niż np. Średnia arytmetyczna? Jak to można zweryfikować?
Obecnie próbuję zastosować model liniowy ( family = gaussian) do wskaźnika różnorodności biologicznej, który nie może przyjmować wartości niższych niż zero, jest zawyżony i ciągły. Wartości mieszczą się w zakresie od 0 do nieco ponad 0,25. W rezultacie w resztkach modelu istnieje oczywisty wzorzec, którego nie udało mi się pozbyć: …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.