Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Czy to możliwe, że dwie Zmienne Losowe z tej samej rodziny dystrybucji mają takie same oczekiwania i wariancje, ale różne wyższe momenty?
Myślałem o znaczeniu rodziny o skali lokalizacji. Mi się, że dla każdego XXX członek lokalizacji skalę rodziny z parametrami położenie i b skalę, to dystrybucja Z = ( X - ) / b nie zależy od jakichkolwiek parametrów i jest taka sama dla każdego X należącego do rodzina.aaabbbZ=(X−a)/bZ=(X−a)/bZ =(X-a)/bXXX Moje …

2
Czy można (teoretycznie) trenować sieć neuronową z mniejszą liczbą próbek treningowych niż wag?
Przede wszystkim: wiem, że do wyszkolenia sieci neuronowej nie jest wymagana ogólna liczba próbek. Zależy to od zbyt wielu czynników, takich jak złożoność zadania, szum danych i tak dalej. Im więcej próbek treningowych mam, tym lepsza będzie moja sieć. Zastanawiałem się jednak: czy teoretycznie jest możliwe trenowanie sieci neuronowej z …

3
Jakie algorytmy wymagają jednorazowego kodowania?
Nigdy nie jestem pewien, kiedy zastosować kodowanie „na gorąco” w przypadku niez uporządkowanych zmiennych kategorialnych, a kiedy nie. Używam go, ilekroć algorytm używa metryki odległości do obliczenia podobieństwa. Czy ktokolwiek może podać ogólną ogólną zasadę, jakie typy algorytmów wymagają, aby niez uporządkowane funkcje kategorialne były zakodowane na gorąco, a które …

1
Wnioskowanie wariacyjne, rozbieżność KL wymaga prawdziwej
Aby mój (bardzo skromny) zrozumieć wnioskowanie wariacyjne, próbuje się przybliżyć przybliżenie nieznanego rozkładu , znajdując rozkład który optymalizuje:pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Ilekroć inwestuję czas w zrozumienie wnioskowania wariacyjnego, ciągle uderzam w tę formułę i nie mogę się powstrzymać, ale czuję, że nie rozumiem tego. Wydaje się, …


2
W jaki sposób opadanie gradientu minibatch aktualizuje wagi dla każdego przykładu w partii?
Jeśli przetwarzamy powiedzmy 10 przykładów w partii, rozumiem, że możemy zsumować stratę dla każdego przykładu, ale jak działa propagacja wsteczna w odniesieniu do aktualizacji wag dla każdego przykładu? Na przykład: Przykład 1 -> strata = 2 Przykład 2 -> strata = -2 Powoduje to średnią stratę 0 (E = 0), …

3
Motywowanie esicy jednostki wyjściowe w sieciach neuronowych zaczynające nieznormalizowanych prawdopodobieństw dziennika liniowy i
Tło: Studiuję rozdział 6 głębokiego uczenia się autorstwa Iana Goodfellowa, Yoshui Bengio i Aarona Courville'a. W sekcji 6.2.2.2 (strony 182 z 183, które można obejrzeć tutaj ) zastosowanie sigmoid do wyjścia jest uzasadnione.P(y=1|x)P(y=1|x)P(y=1|x) Podsumowując, niektóre materiały pozwalają, by był neuronem wyjściowym przed zastosowaniem aktywacji, gdzie jest wyjściem poprzedniej ukrytej warstwy, …

3
Czy istnieje poważny problem z pomijaniem obserwacji z brakującymi wartościami podczas obliczania macierzy korelacji?
Mam ten ogromny zestaw danych z około 2500 zmiennymi i podobnymi 142 obserwacjami. Chcę uruchomić korelację między zmienną X a resztą zmiennych. Ale w wielu kolumnach brakuje wpisów. Próbowałem to zrobić w R za pomocą argumentu „pairwise-complete” ( use=pairwise.complete.obs) i uzyskałem wiązkę korelacji. Ale potem ktoś na StackOverflow opublikował link …


2
Matematyczna intuicja równania odchylenia wstępnego
I ostatnio zadawane pytanie mającą matematycznego interpretacji / intuicji za elementarnej równanie dotyczące próbki średniej i wariancji: , geometryczny lub inne.mi[ X2)] = Va r ( X) + ( E[ X] )2)E[X2]=Var(X)+(E[X])2 E[X^2] = Var(X) +(E[X])^2 Ale teraz ciekawi mnie powierzchownie podobne równanie kompromisu wariancji odchylenia. MSE ( θ^) = …
12 variance  bias 


4
Czy w CNN upsampling i transpozycja splotu są takie same?
Zarówno terminy „upsampling”, jak i „transponowanie splotu” są używane, gdy wykonujesz „dekonwolucję” (<- niezbyt dobry termin, ale pozwólcie, że użyję go tutaj). Początkowo myślałem, że oznaczają to samo, ale wydaje mi się, że różnią się po przeczytaniu tych artykułów. czy ktoś może wyjaśnić? Transponuj splot : wygląda na to, że …

3
Jak zaimplementować model mieszany za pomocą funkcji betareg w R?
Mam zestaw danych składający się z proporcji, które mierzą „poziom aktywności” poszczególnych kijanek, dzięki czemu wartości są powiązane od 0 do 1. Dane te zostały zebrane przez zliczenie liczby ruchów danej osoby w określonym przedziale czasu (1 dla ruchu, 0 za brak ruchu), a następnie uśrednia się, aby utworzyć jedną …

1
Czym dokładnie jest blok Residual Learning w kontekście Deep Residual Networks w Deep Learning?
Czytałem artykuł Deep Residual Learning for Image Recognition i miałem trudności ze zrozumieniem ze 100% pewnością, co pociąga za sobą blok obliczeniowy. Czytając gazetę mają rysunek 2: co ilustruje, jaki powinien być blok rezydualny. Czy obliczenie bloku resztkowego jest po prostu takie samo jak: y=σ(W2σ(W1x+b1)+b2+x)y=σ(W2σ(W1x+b1)+b2+x) \mathbf{y} = \sigma( W_2 \sigma( …

1
Różnica między implementacjami PCA i TruncatedSVD w scikit-learn
Rozumiem związek między analizą głównych składników a rozkładem wartości osobliwych na poziomie algebraicznym / dokładnym. Moje pytanie dotyczy implementacji scikit-learn . Dokumentacja mówi: „ [TruncatedSVD] jest bardzo podobny do PCA, ale działa bezpośrednio na przykładowe wektory, zamiast na macierz kowariancji. ”, Co odzwierciedlałoby różnicę algebraiczną między obydwoma podejściami. Jednak później …
12 pca  scikit-learn  svd  scipy 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.