Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Metodologia bootstrap. Po co ponownie próbkować „z zastępstwem” zamiast losowego podpróbkowania?
Metoda bootstrap bardzo się rozpowszechniła w ostatnich latach, ja też jej często używam, zwłaszcza że rozumowanie jest dość intuicyjne. Ale tego nie rozumiem. Dlaczego Efron postanowił wykonać ponowne próbkowanie z zamianą zamiast zwykłego podpróbkowania przez losowe włączanie lub wyłączanie pojedynczych obserwacji? Myślę, że losowe podpróbkowanie ma jedną bardzo dobrą jakość, …

1
OLS vs. Poisson GLM z łączem tożsamości
Moje pytanie ujawnia moje słabe zrozumienie regresji Poissona i ogólnie GLM. Oto kilka fałszywych danych ilustrujących moje pytanie: ### some fake data x=c(1:14) y=c(0, 1, 2, 3, 1, 4, 9, 18, 23, 31, 20, 25, 37, 45) Niektóre niestandardowe funkcje zwracające psuedo-R2: ### functions of pseudo-R2 psuR2 <- function(null.dev, model.dev) …

2
Funkcja kosztu krzyżowego w sieci neuronowej
Patrzę na funkcję kosztu entropii znalezioną w tym samouczku : do= - 1n∑x[ ylna + ( 1 - y) ln( 1 - a ) ]do=-1n∑x[yln⁡za+(1-y)ln⁡(1-za)]C = -\frac{1}{n} \sum_x [y \ln a+(1−y)\ln(1−a)] Co dokładnie sumujemy? Jest to oczywiście ponad , ale i a nie zmieniają się z x . Wszystkie x …


2
Jak symulować dane cenzurowane
Zastanawiam się, jak mogę zasymulować próbkę n okresów życia rozkładu Weibulla, które obejmują obserwacje z cenzurą po prawej stronie typu I. Na przykład niech n = 3, kształt = 3, skala = 1, a szybkość cenzury = 0,15, a czas cenzury = 0,88. Wiem, jak wygenerować próbkę Weibulla, ale nie …

1
Scikit Binomial Deviance Loss Function
Jest to funkcja utraty dwumianowej dewiacji przez GradientBoosting, def __call__(self, y, pred, sample_weight=None): """Compute the deviance (= 2 * negative log-likelihood). """ # logaddexp(0, v) == log(1.0 + exp(v)) pred = pred.ravel() if sample_weight is None: return -2.0 * np.mean((y * pred) - np.logaddexp(0.0, pred)) else: return (-2.0 / sample_weight.sum() …

3
Czy sieć neuronowa może nauczyć się funkcjonalnej i jej funkcjonalnej pochodnej?
Rozumiem, że sieci neuronowe (NN) można uznać za uniwersalne aproksymatory zarówno funkcji, jak i ich pochodnych, pod pewnymi założeniami (zarówno w sieci, jak i funkcji do aproksymacji). W rzeczywistości przeprowadziłem szereg testów prostych, ale nietrywialnych funkcji (np. Wielomianów) i wydaje się, że rzeczywiście potrafię je dobrze przybliżyć i ich pierwsze …


1
Jak interpretować wycięte wykresy pudełkowe
Wykonując EDA postanowiłem użyć wykresu pudełkowego, aby zilustrować różnicę między dwoma poziomami czynnika. Sposób, w jaki ggplot renderował wykres pudełkowy, był zadowalający, ale nieco uproszczony (pierwszy wykres poniżej). Podczas badania właściwości wykresów pudełkowych zacząłem eksperymentować z wycięciami. Rozumiem, że wycięcia wyświetlają CI wokół mediany i że jeśli wycięcia dwóch pól …

3
Łańcuchy Markowa vs. HMM
Łańcuchy Markowa mają dla mnie sens, mogę je wykorzystać do modelowania probabilistycznych zmian stanu w rzeczywistych problemach. Potem jest HMM. Mówi się, że HMM są bardziej odpowiednie do modelowania wielu problemów niż MC. Jednak problemy, o których wspominają ludzie, są nieco skomplikowane do zrozumienia, na przykład przetwarzanie mowy. Więc moje …

2
Dlaczego funkcja STL daje znaczną zmienność sezonową z danymi losowymi
Narysowałem następujący kod z funkcją stl (Seasonal Decomposition of Time Series by Loess): plot(stl(ts(rnorm(144), frequency=12), s.window="periodic")) Pokazuje znaczącą zmienność sezonową z losowymi danymi umieszczonymi powyżej w kodzie (funkcja rnorm). Odmiana sygnalizująca jest widoczna za każdym razem, gdy jest uruchamiana, chociaż wzór jest inny. Dwa takie wzory pokazano poniżej: Jak możemy …

2
Czy wzrosnąć, gdy
Jeśli β∗=argminβ∥y−Xβ∥22+λ∥β∥1β∗=argminβ‖y−Xβ‖22+λ‖β‖1\beta^*=\mathrm{arg\,min}_{\beta} \|y-X\beta\|^2_2+\lambda\|\beta\|_1 , może ∥β∗∥2‖β∗‖2\|\beta^*\|_2 wzrosnąć, gdy λλ\lambda wzrasta? Myślę, że to jest możliwe. Chociaż ∥β∗∥1‖β∗‖1\|\beta^*\|_1 nie rośnie, gdy λλ\lambda rośnie (mój dowód ), ∥β∗∥2‖β∗‖2\|\beta^*\|_2 może wzrosnąć. Poniższy rysunek pokazuje możliwość. Kiedy λλ\lambda rośnie, jeśli β∗β∗\beta^* przemieszcza się (liniowo) od PPP do QQQ , wtedy ∥β∗∥2‖β∗‖2\|\beta^*\|_2 rośnie, podczas gdy …
11 lasso 

1
Czy mogę używać ReLU w autoencoderze jako funkcji aktywacyjnej?
Podczas wdrażania autoencodera z siecią neuronową większość osób użyje sigmoid jako funkcji aktywacyjnej. Czy zamiast tego możemy użyć ReLU? (Ponieważ ReLU nie ma limitu górnej granicy, w zasadzie oznacza to, że obraz wejściowy może mieć piksel większy niż 1, w przeciwieństwie do ograniczonych kryteriów dla autoencodera, gdy używany jest sigmoid).

4
Podziel dane na N równych grup
Mam ramkę danych, która zawiera wartości w 4 kolumnach: Na przykład: ID, price, click count,rating Chciałbym „podzielić” tę ramkę danych na N różnych grup, w których każda grupa będzie miała taką samą liczbę wierszy z takim samym rozkładem ceny, liczby kliknięć i atrybutów ocen. Wszelkie porady są mile widziane, ponieważ …
11 r  distributions 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.