Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
1D Konwolucja w sieciach neuronowych
Rozumiem, jak działa splot, ale nie rozumiem, w jaki sposób splot 1D jest stosowany do danych 2D. W tym przykładzie widać splot 2D w danych 2D. Ale jak by to było, gdyby był splot 1D? Tylko jądro 1D przesuwa się w ten sam sposób? A jeśli krok miał 2? Dziękuję …

1
Przykłady z życia nieefektywnego generatora liczb losowych
Wszyscy wiemy, że generatory liczb losowych w komputerach nie generują prawdziwych liczb losowych, ale generują liczby pseudolosowe. Ponadto niektóre RNG są lepsze od innych, a niektóre są wdrażane lepiej niż inne. Jakie są przykłady użycia złego RNG lub RNG źle wdrożonego i wykorzystanego? Przykłady, które znalazłem to Ron Harris zdradza …


2
Dlaczego kryterium informacyjne (nieskorygowane
W modelach szeregów czasowych, takich jak ARMA-GARCH, do wyboru odpowiedniego opóźnienia lub kolejności modelu stosowane są różne kryteria informacyjne, takie jak AIC, BIC, SIC itp. Moje pytanie jest bardzo proste, dlaczego nie używamy skorygowanego aby wybrać odpowiedni model? Możemy wybrać model, który prowadzi do wyższej wartości skorygowanego . Ponieważ zarówno …

2
Wyprowadzając gradient jednowarstwowej sieci neuronowej z jej danych wejściowych, jaki jest operator reguły łańcucha?
Rzecz w tym: Oblicz gradient w odniesieniu do warstwy wejściowej dla sieci neuronowej z jedną ukrytą warstwą, używając sigmoid dla wejścia -> ukryty, softmax dla ukrytego -> wyjścia, z utratą entropii krzyżowej. Mogę przejść przez większość pochodnych za pomocą reguły łańcucha, ale nie jestem pewien, jak właściwie „połączyć” je razem. …


1
Przestrzeń danych, przestrzeń zmiennych, przestrzeń obserwacji, przestrzeń modelu (np. W regresji liniowej)
Załóżmy, że mamy macierz danych XX\mathbf{X}, który jest nnn-przez-pppi wektor etykiety YYY, który jest nnn-do-jednego. Tutaj każdy wiersz macierzy jest obserwacją, a każda kolumna odpowiada wymiarowi / zmiennej. (założyćn > pn>pn>p) Więc co data space, variable space, observation space, model spaceoznaczają? Czy przestrzeń jest rozpięta przez wektor kolumny, a (zdegenerowana) …

1
Losowe nakładające się interwały
Jak znaleźć wyrażenie analityczne w następującym problemie?D ( n , l , L )D(n,l,L)D(n,l,L) Losowo upuszczam „słupków” o długości do przedziału . „Słupki” mogą się nakładać. Chciałbym znaleźć średnią całkowitą długość przedziału zajmowanego przez co najmniej jeden „słupek”.nnnlll[ 0 , L ][0,L][0,L]reDD[ 0 , L ][0,L][0,L] W granicy „niskiej gęstości” …

1
Normalizacja wejściowa dla neuronów ReLU
Według „Efficient Backprop” LeCun i wsp. (1998) dobrą praktyką jest znormalizowanie wszystkich danych wejściowych, tak aby były one wyśrodkowane wokół 0 i mieściły się w zakresie maksymalnej drugiej pochodnej. Na przykład użylibyśmy [-0,5,0,5] dla funkcji „Tanh”. Ma to pomóc w postępie wstecznej propagacji, gdy Hesjan staje się bardziej stabilny. Nie …

1
Jak sformalizować wcześniejszy rozkład prawdopodobieństwa? Czy istnieją zasady praktyczne lub wskazówki, których należy używać?
Chociaż lubię myśleć, że dobrze rozumiem pojęcie wcześniejszych informacji w bayesowskiej analizie statystycznej i podejmowaniu decyzji, często mam problem z otuleniem się o jej zastosowanie. Mam na myśli kilka sytuacji, które są przykładami moich zmagań i uważam, że nie zostały one właściwie omówione w bayesowskich podręcznikach statystycznych, które do tej …

4
Interpretacja wartości AIC
Typowe wartości AIC, które widziałem dla modeli logistycznych, są w tysiącach, a przynajmniej setkach. np. na http://www.r-bloggers.com/how-to-perform-a-logistic-regression-in-r/ AIC to 727,39 Chociaż zawsze mówi się, że AIC należy używać wyłącznie do porównywania modeli, chciałem zrozumieć, co oznacza konkretna wartość AIC. Zgodnie ze wzorem A jado= - 2 log( L ) + …

1
Topologie, dla których zestaw rozkładów prawdopodobieństwa jest kompletny
Bardzo trudno mi było pogodzić moje intuicyjne rozumienie rozkładów prawdopodobieństwa z dziwnymi właściwościami, które posiadają prawie wszystkie topologie rozkładów prawdopodobieństwa. Na przykład rozważmy losową zmienną : wybierz Gaussa wyśrodkowany na 0 z wariancją 1 i z prawdopodobieństwem , dodaj do wyniku. Sekwencja takich losowych zmiennych zbiegnie się (słabo i w …


2
Wąskie gardło stosowania głębokiego uczenia się w praktyce
Po przeczytaniu wielu artykułów do głębokiego uczenia się, rodzajem szorstkiego odczucia jest to, że istnieje wiele sztuczek w szkoleniu sieci, aby uzyskać lepszą niż zwykle wydajność. Z punktu widzenia aplikacji branżowych bardzo trudno jest opracować tego rodzaju sztuczki, z wyjątkiem elitarnych grup badawczych w dużych firmach technologicznych, np. Google lub …

2
Przekształcanie statystyk zamówień
Załóżmy, że zmienne losowe i są niezależne i przez . Pokaż, że ma \ dystrybucja tekstu {Exp} (1) .X1,...,XnX1,...,XnX_1, ... , X_nY1,...,YnY1,...,YnY_1, ..., Y_nU(0,a)U(0,a)U(0,a)Zn=nlogmax(Y(n),X(n))min(Y(n),X(n))Zn=nlog⁡max(Y(n),X(n))min(Y(n),X(n))Z_n= n\log\frac{\max(Y_{(n)},X_{(n)})}{\min(Y_{(n)},X_{(n)})}Exp(1)Exp(1)\text{Exp}(1) Zacząłem ten problem, ustawiając {X1,...,Xn,Y1,...Yn}={Z1,...,Zn}{X1,...,Xn,Y1,...Yn}={Z1,...,Zn}\{X_1,...,X_n,Y_1,...Y_n\} = \{Z_1,...,Z_n\} Następnie max(Yn,Xn)=Z(2n)max(Yn,Xn)=Z(2n)\max(Y_n,X_n)= Z_{(2n)} będzie rozpowszechniany jako (za)2n(za)2n(\frac{z}{a})^{2n} a min(Yn,Xn)=Z(1)min(Yn,Xn)=Z(1)\min(Y_n,X_n)= Z_{(1)} będzie dystrybuowany jako 1−(1−za)2n1−(1−za)2n1 - (1 - \frac{z}{a})^{2n} …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.