Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Do czego odnosi się termin „rzadkie wcześniejsze” (FBProphet Paper)?
Czytając artykuł „Prognozowanie w skali” (narzędzie prognostyczne FBProphet, patrz https://peerj.com/preprints/3190.pdf ) natknąłem się na termin „rzadkie wcześniejsze”. Autorzy wyjaśniają, że używali takiego „rzadkiego wcześniejszego” do modelowania wektora odchyleń szybkości od pewnego współczynnika skalarnego , który jest parametrem modelu w logistycznym modelu wzrostu.δδ\mathbf{\delta}kkk Gdy stwierdzają, że , czy rozumiem poprawnie, że …


2
Jaka intuicja kryje się za różnicowaniem drugiego rzędu?
Czasami może zaistnieć potrzeba różnicowania serii czasowej, aby stała się stacjonarna. Nie rozumiem jednak, w jaki sposób różnicowanie drugiego rzędu może pomóc uczynić go nieruchomym, gdy różnicowanie pierwszego rzędu nie wystarczy. Czy możesz podać intuicyjne wyjaśnienie różnicowania drugiego rzędu i przypadków, w których jest to potrzebne?

2
Czy wiele filtrów w warstwie splotowej nie nauczyłby się tego samego parametru podczas treningu?
Na podstawie tego, czego się nauczyłem, używamy wielu filtrów w warstwie konwekcyjnej CNN, aby uczyć się różnych detektorów funkcji. Ale skoro filtry te są stosowane w podobny sposób (tzn. Przesuwane i mnożone do obszarów danych wejściowych), czy nie nauczyłyby się po prostu tych samych parametrów podczas treningu? Stąd użycie wielu …

1
Jak obliczyć wyniki ufności w regresji (z losowymi lasami / XGBoost) dla każdej prognozy w R?
Czy istnieje sposób na uzyskanie wyniku ufności (możemy nazwać to również wartością ufności lub prawdopodobieństwa) dla każdej przewidywanej wartości, gdy stosuje się algorytmy takie jak Losowe Lasy lub Ekstremalne Zwiększanie Gradientu (XGBoost)? Powiedzmy, że ten wynik pewności wynosiłby od 0 do 1 i pokazuje, jak jestem pewny co do konkretnej …

3
Problemy z kodowaniem pojedynczym a kodowaniem pozorowanym
Zdaję sobie sprawę z tego, że zmienne kategorialne o poziomach k powinny być kodowane zmiennymi k-1 w kodowaniu fikcyjnym (podobnie w przypadku wielowartościowych zmiennych jakościowych). Zastanawiałem się, w jakim stopniu problem polega na kodowaniu jednorazowym (tj. Zamiast tego przy użyciu zmiennych k) zamiast kodowaniu fikcyjnym dla różnych metod regresji, głównie …


2
Plusy i minusy ładowania początkowego
Właśnie dowiedziałem się o koncepcji bootstrapowania i przyszło mi do głowy naiwne pytanie: jeśli zawsze możemy wygenerować wiele próbek bootstrap naszych danych, po co w ogóle starać się uzyskać więcej „prawdziwych” danych? Wydaje mi się, że mam wyjaśnienie, proszę mi powiedzieć, czy mam rację: myślę, że proces ładowania początkowego zmniejsza …

3
CIFAR-10 Nie można uzyskać dokładności powyżej 60%, Keras z backendem Tensorflow [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte w zeszłym roku . Trening po 15 epokach w zestawie danych CIFAR-10 wydaje się sprawiać, że utrata walidacji nie maleje, pozostając na poziomie około 1,4 …


1
Czy powinienem wybrać regresor lub klasyfikator Random Forest?
Dopasowuję zestaw danych do binarnej klasy docelowej przy losowym lesie. W Pythonie mogę to zrobić przez randomforestclassifier lub randomforestregressor. Mogę uzyskać klasyfikację bezpośrednio z randomforestclassifier lub mogę najpierw uruchomić randomforestregressor i odzyskać zestaw oszacowanych wyników (wartość ciągła). Następnie mogę znaleźć wartość graniczną, aby uzyskać przewidywane klasy z zestawu wyników. Obie …

3
Dlaczego estymator OLS współczynnika AR (1) jest tendencyjny?
Próbuję zrozumieć, dlaczego OLS podaje tendencyjny estymator procesu AR (1). Zastanów się W tym modelu naruszona jest ścisła egzogeniczność, tzn. y_t i \ epsilon_t są skorelowane, ale y_ {t-1} i \ epsilon_t są nieskorelowane. Ale jeśli jest to prawdą, to dlaczego poniższe proste wyprowadzenie nie działa? ytϵt=α+βyt−1+ϵt,∼iidN(0,1).yt=α+βyt−1+ϵt,ϵt∼iidN(0,1). \begin{aligned} y_{t} &= …

4
Czy AUC prawdopodobieństwo prawidłowej klasyfikacji losowo wybranej instancji z każdej klasy?
Przeczytałem ten podpis w gazecie i nigdy nie widziałem AUC opisanego w ten sposób nigdzie indziej. Czy to prawda? Czy istnieje dowód lub prosty sposób, aby to zobaczyć? Ryc. 2 pokazuje dokładność predykcji zmiennych dychotomicznych wyrażonych jako obszar pod krzywą charakterystyczną dla działania odbiornika (AUC), co jest równoważne prawdopodobieństwu prawidłowej …

3
Używać Holt-Winters czy ARIMA?
Moje pytanie dotyczy różnic koncepcyjnych między Holt-Winters a ARIMA. O ile rozumiem, Holt-Winters jest szczególnym przypadkiem ARIMA. Ale kiedy preferowany jest jeden algorytm? Być może Holt-Winters jest inkrementalny i dlatego służy jako wbudowany (szybszy) algorytm? Czekam na wgląd tutaj.

3
Jakie są zalety regresji stopniowej?
W moim podejściu do problemu eksperymentuję z regresją krokową ze względu na różnorodność. Mam więc 2 pytania: Jakie są zalety regresji stopniowej? Jakie są jego szczególne zalety? Co sądzisz o podejściu hybrydowym, w którym używasz regresji krokowej, aby wybierać funkcje, a następnie stosujesz regresję regularną, biorąc wszystkie wybrane funkcje razem?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.