Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Regresja liniowa, co mówi nam statystyka F, kwadrat R i resztkowy błąd standardowy?
Jestem naprawdę zdezorientowany co do różnicy znaczenia w kontekście regresji liniowej następujących terminów: Statystyka F. R do kwadratu Błąd resztkowy standardowy Znalazłem tę stronę internetową, która dała mi świetny wgląd w różne terminy związane z regresją liniową, jednak wspomniane wyżej terminy wyglądają całkiem sporo (o ile rozumiem). Przytoczę to, co …



2
Jaka jest formuła skorygowanej wartości p Benjaminiego-Hochberga?
Rozumiem procedurę i to, co kontroluje. Jaki jest zatem wzór skorygowanej wartości p w procedurze BH dla wielokrotnych porównań? Właśnie teraz zdałem sobie sprawę, że pierwotny BH nie wytworzył skorygowanych wartości p, a jedynie dostosował warunek (nie) odrzucenia: https://www.jstor.org/stable/2346101 . Gordon Smyth wprowadził skorygowane wartości p BH w 2002 r., …

2
Jakie jest pochodzenie sieci neuronowych autokodera?
Szukałem w Google, Wikipedii, Google Scholar i innych, ale nie mogłem znaleźć źródła Autoencoderów. Być może jest to jedna z tych koncepcji, które ewoluowały bardzo stopniowo i nie można prześledzić wyraźnego punktu wyjścia, ale nadal chciałbym znaleźć jakieś podsumowanie głównych etapów ich rozwoju. Rozdział o autoencoders w Ian Goodfellow, Yoshua …

4
Interwały prognoz dla algorytmów uczenia maszynowego
Chcę wiedzieć, czy opisany poniżej proces jest prawidłowy / akceptowalny i czy dostępne jest jakiekolwiek uzasadnienie. Pomysł: nadzorowane algorytmy uczenia się nie zakładają podstawowych struktur / dystrybucji danych. Na koniec dnia przedstawiają szacunkowe dane wyjściowe. Mam nadzieję, że jakoś oszacuję niepewność tych szacunków. Teraz proces budowania modelu ML jest z …

2
znaczenie (x) operatora?
Wszędzie widziałem operatora w jakimś przeglądzie literatury na temat przyczynowości (patrz, na przykład, ten wpis na Wikipedii ). Nie mogę jednak znaleźć formalnej i ogólnej definicji tego operatora.do(x)do(x)do(x) Czy ktoś może wskazać mi dobre odniesienie w tej sprawie? Interesuje mnie ogólna definicja, a nie jej interpretacja w konkretnym eksperymencie.



1
Uogólnione biblioteki modeli addytywnych w języku Python
Wiem, że R ma biblioteki gam i mgcv dla uogólnionych modeli addytywnych. Mam jednak trudności ze znalezieniem ich odpowiedników w ekosystemie Python (statsmodels ma tylko prototyp w piaskownicy). Czy ktoś wie o istniejących bibliotekach Python? Kto wie, że może to być dobry projekt do opracowania / przyczynienia się do scikit-learn, …
14 gam 


1
GAM vs LOESS vs splajny
Kontekst : Chcę, aby narysować linię na wykresie rozrzutu, że nie pojawia się parametryczne, dlatego używam geom_smooth()w ggplotw R. Automatycznie zwraca geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ s(x, bs = "cs"). Use 'method = x' to change the smoothing method., …


4
Jakie są metody statystyczne polecania filmów takich jak Netflix?
Chcę wdrożyć model dynamiczny, aby polecić film użytkownikowi. Zalecenia należy aktualizować za każdym razem, gdy użytkownik ogląda film lub ocenia go. Dla uproszczenia myślę o wzięciu pod uwagę dwóch czynników: wcześniejsze oceny innych filmów użytkownika czas, w którym użytkownik obejrzał niektóre poprzednie filmy Jak skonfigurować taki model i co poleca …

3
Czy w GLM prawdopodobieństwo dziennika modelu nasyconego zawsze wynosi zero?
Jako część danych wyjściowych uogólnionego modelu liniowego do oceny modelu wykorzystywane są odchylenie zerowe i rezydualne. Często widzę formuły dla tych wielkości wyrażone jako prawdopodobieństwo dziennika modelu nasyconego, na przykład: /stats//a/113022/22199 , Regresja logistyczna: jak uzyskać model nasycony Model nasycony, o ile rozumiem, jest modelem, który doskonale pasuje do obserwowanej …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.