Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Algorytm wstecznej propagacji
Mam lekką dezorientację na wstecznej propagacji błędów algorytmu stosowanego w perceptronu wielowarstwowego (MLP). Błąd jest regulowana przez funkcję kosztów. W wstecznej propagacji błędów, staramy się dostosować ciężar warstw ukrytych. Błąd wyjściowy, który rozumiem, to znaczy e = d - y[Bez indeksów dolnych]. Pytania są następujące: W jaki sposób można uzyskać …

3
0-1 Objaśnienie funkcji utraty
Próbuję zrozumieć, jaki jest cel funkcji utraty i nie do końca rozumiem. Tak więc, o ile rozumiem, funkcja straty służy wprowadzeniu pewnego rodzaju miernika, za pomocą którego możemy zmierzyć „koszt” niewłaściwej decyzji. Powiedzmy, że mam zestaw danych z 30 obiektami, podzieliłem je na zestawy szkoleniowe / testowe, takie jak 20/10. …




2
Testowanie klasyfikacji danych o nadmiernie próbkowanych zakłóceniach
Pracuję nad bardzo niezrównoważonymi danymi. W literaturze stosuje się kilka metod ponownego równoważenia danych za pomocą ponownego próbkowania (nadmiernego lub niepełnego próbkowania). Dwa dobre podejścia to: SMOTE: TECHnique over-sampling syntetycznej mniejszości ( SMOTE ) ADASYN: Adaptacyjne syntetyczne podejście do próbkowania dla niezrównoważonego uczenia się ( ADASYN ) Wdrożyłem ADASYN, ponieważ …

3
Pełna informacja maksymalne prawdopodobieństwo braku danych w R
Kontekst : regresja hierarchiczna z pewnymi brakującymi danymi. Pytanie : Jak wykorzystać oszacowanie maksymalnego prawdopodobieństwa (FIML) pełnej informacji w celu usunięcia brakujących danych w R? Czy polecasz pakiet i jakie są typowe kroki? Bardzo pomocne byłyby również zasoby i przykłady online. PS : Jestem socjologiem, który niedawno zaczął używać R. …

1
Kalibracja klasyfikatora podwyższonego klasy
Przeczytałem artykuł Alexandru Niculescu-Mizila i Richa Caruany „ Uzyskiwanie skalibrowanych prawdopodobieństw od wzmocnienia ” i dyskusję w tym wątku. Jednak nadal mam problemy ze zrozumieniem i wdrożeniem logistyki lub skalowania Platta, aby skalibrować moc wyjściową mojego wieloklasowego klasyfikatora podwyższającego (łagodne przyspieszanie z kikutami decyzyjnymi). Jestem nieco zaznajomiony z uogólnionymi modelami …

5
Jaka jest różnica między „uczeniem się na zasadzie transferu” a „adaptacją domeny”?
Czy jest jakaś różnica między „uczeniem się przez transfer” a „adaptacją domeny”? Nie wiem o kontekście, ale rozumiem, że mamy jakiś zestaw danych 1 i trenujemy go, po czym mamy inny zestaw danych 2, do którego chcemy dostosować nasz model bez ponownego szkolenia od zera, dla którego „uczenie się przez …

3
Kiedy stosować stałe efekty w porównaniu do używania klastrowych SE?
Załóżmy, że masz jeden przekrój danych, w którym poszczególne osoby znajdują się w grupach (np. Uczniowie w szkołach) i chcesz oszacować model postaci, w Y_i = a + B*X_iktórej Xwektor cech indywidualnych i astałych jest stały. W takim przypadku załóżmy, że nieobserwowana heterogeniczność między grupami wpływa na twoje oszacowania punktowe …

1
Co to jest „przestrzeń funkcji”?
Jaka jest definicja „przestrzeni obiektów”? Na przykład czytając o SVM, czytam o „mapowaniu do przestrzeni funkcji”. Czytając o KOSZYKU, czytam o „partycjonowaniu w przestrzeń funkcji”. Rozumiem, co się dzieje, szczególnie w przypadku CART, ale myślę, że brakuje mi definicji. Czy istnieje ogólna definicja „przestrzeni obiektów”? Czy istnieje definicja, która da …

3
Czy sieci neuronowe uczą się funkcji lub funkcji gęstości prawdopodobieństwa?
Pytanie może brzmieć nieco dziwnie, ponieważ jestem nowy w wnioskowaniu statystycznym i sieciach neuronowych. Kiedy w problemach z klasyfikacją za pomocą sieci neuronowych mówimy, że chcemy nauczyć się funkcji która odwzorowuje przestrzeń wejściową na przestrzeń wyjściową :f∗f∗f^*xxxyyy f∗(x;θ)=yf∗(x;θ)=yf^*(x; \theta) = y Czy dopasowujemy parametry ( ) do modelowania funkcji nieliniowej …

1
Kiedy wybrać SARSA vs. Q Learning
SARSA i Q Learning to algorytmy uczenia wzmacniającego, które działają w podobny sposób. Najbardziej uderzającą różnicą jest to, że SARSA jest na polisie, podczas gdy Q Learning jest na polisie. Reguły aktualizacji są następujące: Q Learning: Q(st,at)←Q(st,at)+α[rt+1+γmaxa′Q(st+1,a′)−Q(st,at)]Q(st,at)←Q(st,at)+α[rt+1+γmaxa′Q(st+1,a′)−Q(st,at)]Q(s_t,a_t)←Q(s_t,a_t)+α[r_{t+1}+γ\max_{a'}Q(s_{t+1},a')−Q(s_t,a_t)] SARSA: Q(st,at)←Q(st,at)+α[rt+1+γQ(st+1,at+1)−Q(st,at)]Q(st,at)←Q(st,at)+α[rt+1+γQ(st+1,at+1)−Q(st,at)]Q(s_t,a_t)←Q(s_t,a_t)+α[r_{t+1}+γQ(s_{t+1},a_{t+1})−Q(s_t,a_t)] gdzie st,atst,ats_t,\,a_t i rtrtr_t są stanem, akcja i nagroda w kroku …

3
W jaki sposób regresja logistyczna wykorzystuje rozkład dwumianowy?
Próbuję zrozumieć, w jaki sposób regresja logistyczna wykorzystuje rozkład dwumianowy. Powiedzmy, że badam sukces gniazda u ptaków. Prawdopodobieństwo sukcesu gniazda wynosi 0,6. Korzystając z rozkładu dwumianowego, mogę obliczyć prawdopodobieństwo sukcesów na podstawie n prób (liczby badanych gniazd). Ale w jaki sposób stosuje się rozkład dwumianowy w kontekście modelowania? Powiedzmy, że …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.