Obecnie czytam artykuł Efficient Online and Batch Learning with Forward-Backward Spliting autorstwa John Duchi i Yoram Singer. Jestem bardzo zdezorientowany co do używania terminów „Online” i „Batch”. Pomyślałem, że „Online” oznacza, że aktualizujemy parametry wagi po przetworzeniu jednej jednostki danych treningowych. Następnie wykorzystujemy nowe parametry wagi do przetwarzania następnej jednostki …
Nadal jestem całkiem nowy w uogólnionych modelach liniowych i mam problem z notacją w większości tekstów GLM, które wybrałem. Czy istnieją bardzo popularne książki GLM, które lepiej nadają się do czytelności?
Muszę znaleźć minimum funkcji. Czytając dokumenty na stronie http://docs.scipy.org/doc/scipy/reference/optimize.html Widzę, że istnieje kilka algorytmów, które robią to samo, tzn. Znajdują minimum. Skąd mam wiedzieć, który wybrać? niektóre z wymienionych algorytmów Zminimalizuj funkcję za pomocą algorytmu downhill simplex. Zminimalizuj funkcję za pomocą algorytmu BFGS. Zminimalizuj funkcję za pomocą nieliniowego algorytmu gradientu …
Powiedzmy, że mam regresję wielowymiarową (kilka zmiennych niezależnych), która składa się z 3 zmiennych. Każda z tych zmiennych ma określony współczynnik. Jeśli zdecyduję się wprowadzić czwartą zmienną i ponownie uruchomić regresję, czy zmienią się współczynniki 3 pierwotnych zmiennych? Mówiąc szerzej: czy w regresji wielowymiarowej (wiele zmiennych niezależnych) na współczynnik danej …
Próbuję nauczyć się statystyki, ponieważ uważam, że jest tak powszechna, że zabrania mi uczenia się niektórych rzeczy, jeśli nie rozumiem jej poprawnie. Mam problem ze zrozumieniem tego pojęcia rozkładu próbkowania średnich próbek. Nie rozumiem, w jaki sposób niektóre książki i strony to wyjaśniły. Myślę, że rozumiem, ale nie jestem pewien, …
Jestem pod wrażeniem forecastpakietu R , a także np. zooPakietu dla nieregularnych szeregów czasowych i interpolacji brakujących wartości. Moja aplikacja jest w zakresie prognozowania ruchu w call center, więc danych w weekendy (prawie) zawsze brakuje (prawie), co można ładnie obsłużyć zoo. Ponadto może brakować niektórych dyskretnych punktów, po prostu używam …
Właśnie obejrzałem ponownie wykład z kursu Machine Learning na Coursera. W części, w której profesor omawia PCA do wstępnego przetwarzania danych w nadzorowanych aplikacjach edukacyjnych, mówi, że PCA powinno być wykonywane tylko na danych szkoleniowych, a następnie mapowanie służy do transformacji zestawów walidacji krzyżowej i testów. Zobacz także PCA i …
Często widziałem porady dotyczące sprawdzania, czy dopasowanie modelu Poissona jest nadmiernie rozproszone, polegające na podzieleniu resztkowego odchylenia przez stopnie swobody. Wynikowy stosunek powinien wynosić „około 1”. Pytanie brzmi, o jakim zakresie mówimy dla „przybliżonego” - jaki jest stosunek, który powinien wywoływać alarmy, aby rozważyć alternatywne formy modeli?
Czy ktoś może podsumować dla mnie możliwe przykłady, w jakich sytuacjach zwiększenie danych treningowych poprawia cały system? Kiedy wykrywamy, że dodanie większej ilości danych treningowych może nadmiernie dopasować dane i nie dać dokładności danych testowych? To bardzo niespecyficzne pytanie, ale jeśli chcesz odpowiedzieć na konkretne pytanie w konkretnej sytuacji, zrób …
Jak byś przetestował lub sprawdził, czy próbkowanie jest IID (niezależne i identycznie rozproszone)? Zauważ, że nie mam na myśli Gaussa i dystrybucji identycznej, tylko IID. Pomysł, który przychodzi mi na myśl, to wielokrotne dzielenie próbki na dwie podpróbki o równej wielkości, wykonanie testu Kołmogorowa-Smirnowa i sprawdzenie, czy rozkład wartości p …
De novo symulacja danych z eksperymentalnej ramki danych projektowych. Z naciskiem na R (choć inne rozwiązanie językowe byłoby świetne). Podczas projektowania eksperymentu lub ankiety symulowanie danych i przeprowadzanie analizy tych symulowanych danych może zapewnić świetny wgląd w zalety i wady projektu. Takie podejście może być również niezbędne do zrozumienia i …
Zawsze trudno mi wyjaśnić odbiorcom techniki statystyczne bez tła statystycznego. Gdybym chciał wyjaśnić, czym jest GLM dla takich odbiorców (bez rzucania statystycznego żargonu), jaki byłby najlepszy lub najskuteczniejszy sposób? Zazwyczaj tłumaczę GLM trzema częściami - (1) składową losową, która jest zmienną odpowiedzi, (2) składową systematyczną, która jest predyktorami liniowymi, oraz …
Mam aplikację opartą na serwletach, w której mierzę czas potrzebny na ukończenie każdego żądania do tego serwletu. Już obliczam proste statystyki, takie jak średnia i maksimum; Chciałbym jednak opracować bardziej wyrafinowaną analizę i do tego celu uważam, że muszę odpowiednio modelować czasy reakcji. Z pewnością, powiadam, czasy odpowiedzi są zgodne …
Mam dane zliczania (analiza popytu / oferty z liczbą klientów, w zależności od - być może - wielu czynników). Próbowałem regresji liniowej z normalnymi błędami, ale mój wykres QQ nie jest naprawdę dobry. Próbowałem przekształcić log odpowiedzi: po raz kolejny zły wykres QQ. Więc teraz próbuję regresji za pomocą błędów …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.