Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy regresja z regularyzacją L1 jest taka sama jak Lasso, a z regularyzacją L2 jest taka sama jak regresja kalenicy? A jak napisać „Lasso”?
Jestem inżynierem oprogramowania uczącym się uczenia maszynowego, szczególnie poprzez kursy uczenia maszynowego Andrew Ng . Badając regresję liniową z regularyzacją , znalazłem terminy, które są mylące: Regresja z regularyzacją L1 lub regularyzacją L2 LASSO Regresja kalenicy Więc moje pytania: Czy regresja z regularyzacją L1 jest dokładnie taka sama jak LASSO? …




2
Zrozumienie kształtu i obliczanie pasm ufności w regresji liniowej
Próbuję zrozumieć pochodzenie zakrzywionych kształtów pasm ufności związanych z regresją liniową OLS i sposób, w jaki odnosi się to do przedziałów ufności parametrów regresji (nachylenie i przecięcie), na przykład (przy użyciu R): require(visreg) fit <- lm(Ozone ~ Solar.R,data=airquality) visreg(fit) Wydaje się, że pasmo jest powiązane z granicami linii obliczonymi z …


3
Intuicyjna różnica między ukrytymi modelami Markowa a losowymi polami warunkowymi
Rozumiem, że HMM (ukryte modele Markowa) to modele generatywne, a CRF to modele dyskryminujące. Rozumiem również, w jaki sposób zaprojektowano i zastosowano CRF (warunkowe pola losowe). Nie rozumiem, czym różnią się od HMM? Czytałem, że w przypadku HMM możemy modelować nasz następny stan tylko na poprzednim węźle, bieżącym węźle i …

2
Określanie wielkości próbki niezbędnej dla metody ładowania początkowego / proponowanej metody
Wiem, że jest to dość gorący temat, na który nikt tak naprawdę nie jest w stanie udzielić prostej odpowiedzi. Niemniej jednak zastanawiam się, czy poniższe podejście nie byłoby przydatne. Metoda ładowania początkowego jest użyteczna tylko wtedy, gdy twoja próbka odpowiada mniej więcej (dokładnie odczytać) tej samej dystrybucji, co pierwotna populacja. …


5
Zdobywanie informacji, wzajemne informacje i powiązane środki
Andrew More definiuje zdobywanie informacji jako: jaG ( Y| X) = H( Y) - H( Y| X)jasol(Y|X)=H.(Y)-H.(Y|X)IG(Y|X) = H(Y) - H(Y|X) gdzie jest entropią warunkową . Jednak Wikipedia nazywa powyższą ilość wzajemnymi informacjami .H.( Y| X)H.(Y|X)H(Y|X) Z kolei Wikipedia definiuje pozyskiwanie informacji jako rozbieżność Kullbacka-Leiblera (inaczej rozbieżność informacji lub entropia …



1
Co to są kontrole predykcyjne późniejsze i co czyni je przydatnymi?
Rozumiem, czym jest tylna dystrybucja predykcyjna i czytałem o późniejszych kontrolach predykcyjnych , chociaż dla mnie nie jest jeszcze jasne, co robi. Czym dokładnie jest tylna kontrola predykcyjna? Dlaczego niektórzy autorzy twierdzą, że przeprowadzanie późniejszych kontroli predykcyjnych „wykorzystuje dane dwukrotnie” i nie powinno być nadużywane? (a nawet, że nie jest …

4
Dlaczego tanh prawie zawsze jest lepszy niż sigmoid jako funkcja aktywacyjna?
W Andrzej zNg sieci neuronowe i głęboki learning na Coursera mówi, że przy tanhtanhtanh jest prawie zawsze korzystniejsze sigmoidsigmoidsigmoid . Powodem jest to, że daje on wyjść przy użyciu tanhtanhtanh centrum niż około 0 sigmoidsigmoidsigmoid „a 0,5, a to«sprawia, że uczenie się do następnej warstwy trochę łatwiejsze». Dlaczego centrowanie uczenia …

2
Teoria stojąca za częściową regresją najmniejszych kwadratów
Czy ktoś może polecić dobre przedstawienie teorii stojącej za częściową regresją najmniejszych kwadratów (dostępną online) dla kogoś, kto rozumie SVD i PCA? Przejrzałem wiele źródeł online i nie znalazłem niczego, co miałoby właściwe połączenie rygorystyczności i dostępności. Przyjrzałem się elementom uczenia statystycznego , które zostały zasugerowane w komentarzu do pytania …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.