Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Dobre książki do nauki Zastosowane prawdopodobieństwo?
Szukam książki, która zapewnia głębokie, rygorystyczne omówienie teorii prawdopodobieństwa, ale z naciskiem na materiał, który jest najbardziej przydatny poza działem matematyki. Słyszałem, że „Teoria prawdopodobieństwa: eksploracje i zastosowania” jest całkiem dobra, ale chciałem uzyskać inne sugestie. Na przykład książka Achima Klenke jest dla mnie zdecydowanie za duża ... jest zorganizowana …

1
Miara „dewiacji” dla zerowo napompowanego Poissona czy napompowanego zerowo dwumianu?
Skalowane odchylenie, zdefiniowane jako D = 2 * (logarytmiczne prawdopodobieństwo modelu nasyconego minus logarytmiczne prawdopodobieństwo modelu dopasowanego), jest często stosowane jako miara dobroci dopasowania w modelach GLM. Wyjaśnione procentowe odchylenie, zdefiniowane jako [D (model zerowy) - D (model dopasowany)] / D (model zerowy), jest również czasami używane jako analog GLM …

3
Jeszcze jedno centralne pytanie dotyczące limitu
Niech będzie sekwencją niezależnych zmiennych losowych Bernoulliego z Ustaw Pokaż, że zbiega się w rozkładzie do standardowej zmiennej normalnej gdy dąży do nieskończoności.{Xn:n≥1}{Xn:n≥1}\{X_n:n\ge1\}P{Xk=1}=1−P{Xk=0}=1k.P{Xk=1}=1−P{Xk=0}=1k.P\{X_k=1\}=1-P\{X_k=0\}=\frac{1}{k}.Sn=∑k=1n(Xk−1k), B2n=∑k=1nk−1k2Sn=∑k=1n(Xk−1k), Bn2=∑k=1nk−1k2S_n=\sum^{n}_{k=1}\left(X_k-\frac{1}{k}\right), \ B_n^2=\sum^{n}_{k=1}\frac{k-1}{k^2}SnBnSnBn\frac{S_n}{B_n}ZZZnnn Moja próba użycia CLT Lyapunova, dlatego musimy pokazać, że istnieje taka, że δ>0δ>0\delta>0limn→∞1B2+δn∑k=1nE[|Xk−1k|2+δ]=0.limn→∞1Bn2+δ∑k=1nE[|Xk−1k|2+δ]=0.\lim_{n\rightarrow \infty}\frac{1}{B_n^{2+\delta}}\sum_{k=1}^{n}E[|X_k-\frac{1}{k}|^{2+\delta}]=0. Więc ustaw δ=1δ=1\delta=1∑k=1nE∣∣Xk−k−1∣∣3=∑k=1n(1k−3k2+4k3−2k4)∑k=1nE|Xk−k−1|3=∑k=1n(1k−3k2+4k3−2k4) \sum_{k=1}^{n}E\left|X_k-k^{-1}\right|^{3}=\sum_{k=1}^{n} \left(\frac{1}{k}-\frac{3}{k^2}+\frac{4}{k^3}-\frac{2}{k^4}\right) i B3n=(∑k=1n1k−1k2)(∑k=1n1k−1k2)−−−−−−−−−−−−⎷Bn3=(∑k=1n1k−1k2)(∑k=1n1k−1k2) B_n^3=\left( \sum_{k=1}^n …


1
Q-learning z Neural Network jako aproksymacja funkcji
Próbuję użyć sieci neuronowej w celu przybliżenia wartości Q w Q-learningu, tak jak w pytaniach dotyczących Q-Learning z wykorzystaniem sieci neuronowych . Jak zasugerowano w pierwszej odpowiedzi, używam liniowej funkcji aktywacji dla warstwy wyjściowej, podczas gdy nadal używam funkcji aktywacji sigmoidalnej w ukrytych warstwach (2, chociaż mogę to zmienić później). …

3
Optymalizacja stochastycznych modeli komputerowych
Jest to dla mnie trudny temat do wyszukiwania w Google, ponieważ optymalizacja słów i stochastyczna w wyszukiwaniu prawie automatycznie domyślnie wyszukuje optymalizację stochastyczną. Ale tak naprawdę chcę wiedzieć, jakie istnieją metody optymalizacji modeli komputerowych, gdy wyniki modelu komputerowego są stochastyczne, tj. Nie deterministyczne? Na przykład, jeśli weźmiemy pod uwagę model …

1
Czym różni się regresja wektora wsparcia od SVM?
Znam podstawy SVM i SVR, ale wciąż nie rozumiem, jak problem znalezienia hiperpłaszczyzny, która maksymalizuje margines, pasuje do SVR. Po drugie, przeczytałem coś o używanym jako margines tolerancji w SVR. Co to znaczy?ϵϵ\epsilon Po trzecie, czy jest jakaś różnica między parametrami funkcji decyzyjnej stosowanymi w SVM i SVR?

3
W jaki sposób model pomijania gramów Word2Vec generuje wektory wyjściowe?
Mam problemy ze zrozumieniem modelu pominięcia gramów algorytmu Word2Vec. W ciągłym pakiecie słów łatwo jest zobaczyć, jak słowa kontekstowe mogą się „zmieścić” w sieci neuronowej, ponieważ w zasadzie uśrednia się je po pomnożeniu każdej z reprezentacji kodowania jednokrotnego z macierzą wejściową W. Jednak w przypadku pominięcia gram, wektor słowa wejściowego …

3
Jakiej funkcji utraty należy użyć, aby uzyskać binarny klasyfikator o wysokiej precyzji lub o wysokim przywołaniu?
Próbuję stworzyć detektor obiektów, które występują bardzo rzadko (na zdjęciach), planując użyć binarnego klasyfikatora CNN stosowanego w przesuwanym / zmienianym oknie. Skonstruowałem zbalansowane zestawy treningów i testów dodatnich i ujemnych 1: 1 (czy w takim przypadku dobrze jest to zrobić btw?), A klasyfikator ma się dobrze na zestawie testowym pod …

2
Drzewa decyzyjne i regresja - czy przewidywane wartości mogą znajdować się poza zakresem danych treningowych?
Czy w przypadku drzew decyzyjnych przewidywana wartość może leżeć poza zakresem danych szkoleniowych? Na przykład, jeśli zakres zestawu danych treningowych zmiennej docelowej wynosi 0-100, to kiedy generuję mój model i stosuję go do czegoś innego, czy moje wartości mogą wynosić -5? lub 150? Biorąc pod uwagę, że rozumiem regresję drzewa …

2
Dlaczego klasyfikator Bayesa jest idealnym klasyfikatorem?
Jest uważany za idealny przypadek, w którym struktura prawdopodobieństwa leżąca u podstaw kategorii jest doskonale znana. Dlaczego dzięki klasyfikatorowi Bayes osiągamy najlepszą wydajność, jaką można osiągnąć? Jaki jest na to formalny dowód / wyjaśnienie? Jak zawsze używamy klasyfikatora Bayesa jako punktu odniesienia do porównywania wydajności wszystkich innych klasyfikatorów.

1
Algorytm: Wyszukiwanie binarne, gdy wartości są niepewne
Potrzebuję algorytmu do wyszukiwania binarnego, gdy test na każdym kroku może dać zły wynik. Tło: Muszę umieścić uczniów na najbardziej odpowiednim z 12 poziomów trudności. Obecne podejście jest brutalne i zadaje 60 pytań wielokrotnego wyboru o 4 odpowiedziach o rosnącym stopniu trudności, zatrzymujących się po trzech błędach i umieszczających ucznia …
11 algorithms 


2
„Najsilniejsze hasło”
Mam aplikację, która jest chroniona czterocyfrowym kodem PIN, a użytkownik otrzymał pięć prób zalogowania się przed zablokowaniem konta. Teraz jeden z moich klientów chce „wzmocnić” bezpieczeństwo i opowiedzieć się za innym rozwiązaniem: sześciocyfrowy kod PIN NIE „ta sama cyfra obok siebie”: np .: 11 3945 lub 39 55 94 NIE …

3
Wizualizuj dwuwymiarowy rozkład dwumianowy
Pytanie: jak wygląda dwumianowy rozkład dwumianowy w przestrzeni trójwymiarowej? Poniżej znajduje się konkretna funkcja, którą chciałbym wizualizować dla różnych wartości parametrów; mianowicie , p 1 i p 2 .nnnp1p1p_{1}p2p2p_{2} f(x1,x2) = n !x1! x2)!px11px2)2),x1+ x2)= n ,p1+ p2)= 1f(x1,x2)=n!x1!x2!p1x1p2x2,x1+x2=n,p1+p2=1.f(x_{1},x_{2}) = \frac{n!}{x_{1}!x_{2}!}p_{1}^{x_{1}}p_{2}^{x_{2}}, \qquad x_{1}+x_{2}=n, \quad p_{1}+p_{2}=1. Zauważ, że istnieją dwa ograniczenia; …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.