Szukam alternatywy dla drzew klasyfikacyjnych, które mogłyby zapewnić lepszą moc predykcyjną. Dane, z którymi mam do czynienia, mają czynniki zarówno dla zmiennych objaśniających, jak i wyjaśnianych. Pamiętam, że w tym kontekście natknąłem się na losowe lasy i sieci neuronowe, chociaż nigdy wcześniej ich nie próbowałem, czy jest jeszcze inny dobry …
Pytania: Mam dużą macierz korelacji. Zamiast grupować poszczególne korelacje, chcę grupować zmienne na podstawie ich korelacji ze sobą, tj. Jeśli zmienna A i zmienna B mają podobne korelacje do zmiennych C do Z, to A i B powinny być częścią tego samego klastra. Dobrym przykładem tego są różne klasy aktywów …
Jakie są szerokie metody wykrywania oszustw, anomalii, kruszenia itp. W pracach naukowych wyprodukowanych przez stronę trzecią? (Byłem zmotywowany, aby zapytać o to w ostatnim romansie Marca Hausera ). Zwykle w przypadku oszustw związanych z wyborami i rachunkowością przytaczany jest pewien wariant prawa Benforda . Nie jestem pewien, jak można to …
W dwóch artykułach z 1986 i 1988 r. Connor i Korajczyk zaproponowali podejście do modelowania zwrotów z aktywów. Ponieważ te szeregi czasowe mają zwykle więcej aktywów niż obserwacje okresu, zaproponowano wykonanie PCA w odniesieniu do przekrojowych kowariancji zwrotów aktywów. Nazwali tę metodę Asymptotic Principal Component Analysis (APCA, co jest dość …
Kiedy wolisz używać warunkowego modelu autoregresyjnego zamiast symultanicznego modelu autoregresyjnego podczas modelowania autokorelowanych danych lotniczych z odniesieniem geograficznym?
Niedawno zacząłem pracować w klinice gruźlicy. Spotykamy się okresowo w celu omówienia liczby przypadków gruźlicy, które obecnie leczymy, liczby przeprowadzonych testów itp. Chciałbym zacząć modelować te liczby, aby nie tylko zgadywać, czy coś jest niezwykłe, czy nie. Niestety, miałem niewiele szkoleń w szeregach czasowych i większość mojej ekspozycji dotyczyła modeli …
Jest to kontynuacja pytania Stackoverflow o losowe tasowanie tablicy . Istnieją ustalone algorytmy (takie jak Knuff-Fisher-Yates Shuffle ), których należy używać do tasowania tablicy, zamiast polegać na „naiwnych” implementacjach ad-hoc. Jestem teraz zainteresowany udowodnieniem (lub obaleniem), że mój naiwny algorytm jest uszkodzony (jak w: nie generuje wszystkich możliwych permutacji z …
Definicja parametru min_child_weight w xgboost jest podawana jako: minimalna suma wagi instancji (hessian) potrzebna dziecku. Jeśli krok partycji drzewa spowoduje utworzenie węzła liścia o sumie wagi instancji mniejszej niż min_child_weight, wówczas proces budowania przerwie dalsze partycjonowanie. W trybie regresji liniowej odpowiada to po prostu minimalnej liczbie wystąpień wymaganych w każdym …
Mechanizmy uwagi były wykorzystywane w różnych artykułach Deep Learning w ciągu ostatnich kilku lat. Ilya Sutskever, kierownik badań w Open AI, entuzjastycznie je chwali: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Eugenio Culurciello z Purdue University stwierdził, że RNN i LSTM należy porzucić na rzecz sieci neuronowych opartych wyłącznie na uwadze: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Wydaje się to przesadą, …
Próbuję poznać względne zalety i wady, a także różne domeny zastosowań tych dwóch schematów MCMC. Kiedy skorzystasz z którego i dlaczego? Kiedy jedno może zawieść, a drugie nie (np. Gdzie ma zastosowanie HMC, ale nie SMC i odwrotnie) Czy jeden, bardzo naiwnie przyznany, może nałożyć miarę użyteczności na jedną metodę …
Widziałem dwa rodzaje formuł logistycznych strat. Możemy łatwo pokazać, że są identyczne, jedyną różnicą jest definicja etykiety yyy . Formułowanie / notacja 1, y∈{0,+1}y∈{0,+1}y \in \{0, +1\} : L(y,βTx)=−ylog(p)−(1−y)log(1−p)L(y,βTx)=−ylog(p)−(1−y)log(1−p) L(y,\beta^Tx)=-y\log(p)-(1-y)\log(1-p) gdzie , gdzie funkcja logistyczna odwzorowuje liczbę rzeczywistą na interwał 0,1.p=11+exp(−βTx)p=11+exp(−βTx)p=\frac 1 {1+\exp(-\beta^Tx)}βTxβTx\beta^T x Formulacja / notacja 2, :y∈{−1,+1}y∈{−1,+1}y \in …
To pytanie zostało przeniesione z Przepełnienia stosu, ponieważ można na nie odpowiedzieć w ramach weryfikacji krzyżowej. Migrował 4 lata temu . W statystykach przeprowadzamy regresje liniowe, od samego ich początku. Ogólnie wiemy, że im wyższa tym lepiej, ale czy kiedykolwiek istnieje scenariusz, w którym wysokie byłoby bezużytecznym modelem?R 2R2)R2R^2R2)R2R^2
Przeglądałem literaturę na temat regularyzacji i często widzę akapity, które łączą regulację L2 z przełożeniem Gaussa i L1 z Laplace'em wyśrodkowanym na zero. Wiem, jak wyglądają te priory, ale nie rozumiem, jak to przekłada się na przykład na wagi w modelu liniowym. W L1, jeśli dobrze rozumiem, oczekujemy rzadkich rozwiązań, …
W wnioskowaniu statystycznym wymieniony jest problem 9.6b, „region o największej gęstości (HDR)”. Jednak nie znalazłem definicji tego terminu w książce. Jednym z podobnych terminów jest najwyższa gęstość boczna (HPD). Ale to nie pasuje do tego kontekstu, ponieważ 9.6b nie wspomina nic o wcześniejszym. W sugerowanym rozwiązaniu mówi tylko, że „oczywiście …
Zastanawiałem się, jakie są różne przypadki użycia dla dwóch algorytmów: zejścia współrzędnych i zejścia gradientu . Wiem, że opadanie współrzędnych ma problemy z nie płynnymi funkcjami, ale jest używane w popularnych algorytmach, takich jak SVM i LASSO. Uważam jednak, że zejście gradientowe jest szerzej stosowane, zwłaszcza przy odradzaniu się ANN …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.