Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Istotność statystyczna (wartość p) dla porównania dwóch klasyfikatorów w odniesieniu do (średniej) AUC ROC, czułości i swoistości
Mam zestaw testowy 100 przypadków i dwa klasyfikatory. Wygenerowałem prognozy i obliczyłem AUC ROC, czułość i swoistość dla obu klasyfikatorów. Pytanie 1: Jak obliczyć wartość p, aby sprawdzić, czy jedna jest znacznie lepsza od drugiej pod względem wszystkich wyników (AOC ROC, czułość, swoistość)? Teraz, dla tego samego zestawu testowego 100 …

1
Różne typy kowariancji modeli mieszanki Gaussa
Próbując tutaj modeli mieszanki Gaussa , znalazłem 4 rodzaje kowariancji. 'full' (each component has its own general covariance matrix), 'tied' (all components share the same general covariance matrix), 'diag' (each component has its own diagonal covariance matrix), 'spherical' (each component has its own single variance). Dużo szukałem w Google, aby …

1
Luka między błędami „pociąg a test” i jej związek z nadmiernym wyposażeniem: pogodzenie sprzecznych porad
Wydaje się, że istnieją sprzeczne porady na temat tego, jak radzić sobie z porównywaniem błędu pociągu z błędem testu, szczególnie gdy istnieje między nimi różnica. Wydaje mi się, że istnieją dwie szkoły myślenia, które wydają mi się sprzeczne. Chcę zrozumieć, jak pogodzić te dwie rzeczy (lub zrozumieć, czego tu brakuje). …

2
Jak wdrażany jest Przestrzenny rezygnacja z 2D?
Odnosi się to do artykułu Efektywna lokalizacja obiektu za pomocą sieci konwergentnych i z tego, co rozumiem, rezygnacja jest realizowana w 2D. Po odczytaniu kodu z Keras o tym, jak zaimplementowano Upadek przestrzenny 2D, w zasadzie implementowana jest losowa binarna maska ​​kształtu [batch_size, 1, 1, num_channels]. Co jednak dokładnie robi …

1
Analiza wrażliwości w głębokich sieciach neuronowych
Po udzieleniu odpowiedzi na pytanie ( Wyodrębnianie znaczenia wagi z jednowarstwowej sieci feed-forward ) szukam wnioskowania na temat znaczenia danych wejściowych w sieciach neuronowych. Biorąc pod uwagę głęboką sieć, w której rekonstrukcja znaczenia wejściowego poprzez przejście wstecz przez warstwy z interesującego węzła wyjściowego może być trudna lub czasochłonna, zastanawiałem się, …


1
Jak znaleźć 95% wiarygodny przedział?
Próbuję obliczyć 95% wiarygodny przedział czasu następującego rozkładu tylnego. Nie mogłem znaleźć dla niej funkcji w R, ale czy poniższe podejście jest prawidłowe? x <- seq(0.4,12,0.4) px <- c(0,0, 0, 0, 0, 0, 0.0002, 0.0037, 0.018, 0.06, 0.22 ,0.43, 0.64,0.7579, 0.7870, 0.72, 0.555, 0.37, 0.24, 0.11, 0.07, 0.02, 0.009, 0.005, …

3
Prosta regresja liniowa, wartości p i AIC
Zdaję sobie sprawę, że ten temat pojawiał się wiele razy wcześniej, np. Tutaj , ale wciąż nie jestem pewien, jak najlepiej zinterpretować moje wyniki regresji. Mam bardzo prosty zestaw danych, składający się z kolumny wartości x i kolumny wartości y , podzielonych na dwie grupy według lokalizacji (loc). Punkty wyglądają …

3
Dlaczego wysoka dodatnia kurtoza jest problematyczna w testach hipotez?
Słyszałem (przepraszam, nie mogę podać linku do tekstu, coś mi powiedziano), że wysoka dodatnia kurtoza reszt może być problematyczna dla dokładnych testów hipotez i przedziałów ufności (a zatem problemów z wnioskowaniem statystycznym). Czy to prawda, a jeśli tak, to dlaczego? Czy wysoka dodatnia kurtoza reszt nie wskazywałaby, że większość reszt …

3
Zastąpienie zmiennych WoE (waga dowodu) w regresji logistycznej
To pytanie dotyczy praktyki lub metody stosowanej przez niektórych moich kolegów. Podczas tworzenia modelu regresji logistycznej widziałem, jak ludzie zastępują zmienne kategoryczne (lub zmienne ciągłe, które są binowane) ich odpowiednią wagą dowodu (WoE). Podobno ma to na celu ustanowienie monotonicznej relacji między regresorem a zmienną zależną. O ile rozumiem, po …


1
Bayesian lasso kontra kolec i płyta
Pytanie: Jakie są zalety / wady korzystania z jednego wcześniejszego do drugiego przy selekcji zmiennych? Załóżmy, że ma prawdopodobieństwo: , w którym można umieścić albo jedną priors: lub: y∼N(Xw,σ2I)y∼N(Xw,σ2I)y\sim\mathcal{N}(Xw,\sigma^2I)wi∼πδ0+(1−π)N(0,100)π=0.9,wi∼πδ0+(1−π)N(0,100)π=0.9, w_i\sim \pi\delta_0+(1-\pi)\mathcal{N}(0,100)\\ \pi=0.9\,, wi∼exp(−λ|wi|)λ∼Γ(1,1).wi∼exp⁡(−λ|wi|)λ∼Γ(1,1). w_i\sim \exp(-\lambda|w_i|)\\ \lambda \sim \Gamma(1,1)\,. Podaję π=0.9π=0.9\pi=0.9 aby podkreślić, że większość wag wynosi zero, a przed gamma …

4
Jaka jest / jest „mechaniczna” różnica między wielokrotną regresją liniową z opóźnieniami i szeregami czasowymi?
Jestem absolwentem biznesu i ekonomii, który obecnie studiuje magister inżynierii danych. Podczas badania regresji liniowej (LR), a następnie analizy szeregów czasowych (TS), przyszło mi do głowy pytanie. Po co tworzyć zupełnie nową metodę, tj. Szeregi czasowe (ARIMA), zamiast stosować wielokrotną regresję liniową i dodawać do niej zmienne opóźnione (z kolejnością …


3
Sieć neuronowa - wejście binarne vs dyskretne / ciągłe
Czy są jakieś dobre powody, aby preferować wartości binarne (0/1) zamiast dyskretnych lub ciągłych wartości znormalizowanych , np. (1; 3), jako dane wejściowe dla sieci sprzężenia zwrotnego dla wszystkich węzłów wejściowych (z propagacją wsteczną lub bez)? Oczywiście mówię tylko o danych wejściowych, które można przekształcić w dowolną formę; np. jeśli …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.