Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Kiedy nie powinienem używać klasyfikatora zespołów?
Ogólnie rzecz biorąc, w przypadku problemu z klasyfikacją, w którym celem jest dokładne przewidywanie członkostwa w klasie poza próbą, kiedy nie powinienem używać klasyfikatora grupowego? To pytanie jest ściśle związane z Dlaczego nie zawsze korzystać z nauki zespołowej? . To pytanie pyta, dlaczego nie używamy zespołów cały czas. Chcę wiedzieć, …

2
Dlaczego CDF próbki jest równomiernie rozmieszczony
Czytałem tutaj , że biorąc próbkę z ciągłego rozkładu z ED M X próbkę odpowiadającą U I = C X ( X I ) następujące standardowe rozkładu równomiernego.X1,X2,...,XnX1,X2,...,Xn X_1,X_2,...,X_n FXFX F_X Ui=FX(Xi)Ui=FX(Xi) U_i = F_X(X_i) Zweryfikowałem to za pomocą symulacji jakościowych w Pythonie i łatwo mogłem zweryfikować związek. import matplotlib.pyplot …
17 pdf  uniform  cdf  intuition 

2
Różnica między analizą regresji a dopasowaniem krzywej
Czy ktoś może mi wyjaśnić prawdziwą różnicę między analizą regresji a dopasowaniem krzywej (liniową i nieliniową), podając przykład, jeśli to możliwe? Wydaje się, że obie próbują znaleźć związek między dwiema zmiennymi (zależne vs niezależne), a następnie określić parametr (lub współczynnik) związany z proponowanymi modelami. Na przykład, jeśli mam zestaw danych, …



1
Jakie są teoretyczne gwarancje workowania
(W przybliżeniu) słyszałem, że: workowanie jest techniką zmniejszania wariancji predyktora / estymatora / algorytmu uczenia się. Jednak nigdy nie widziałem formalnego matematycznego dowodu tego stwierdzenia. Czy ktoś wie, dlaczego jest to prawdą matematyczną? Wydaje się, że jest to tak powszechnie akceptowany / znany fakt, że spodziewałbym się bezpośredniego odniesienia do …

1
Jak obliczyć przedziały prognoz dla LOESS?
Mam dane, które dopasowałem za pomocą modelu LOESS w R, co daje mi to: Dane mają jeden predyktor i jedną odpowiedź i są heteroscedastyczne. Dodałem również przedziały ufności. Problem polega na tym, że przedziały są przedziałami ufności dla linii, podczas gdy mnie interesują przedziały prognozowania. Na przykład dolny panel jest …

2
Jakie jest intuicyjne wyjaśnienie Echo State Networks?
Jestem nowy w Recurrent Neural Networks (RNN) i wciąż uczę się pojęć. Rozumiem na poziomie abstrakcyjnym, że Echo State Network (ESN) jest w stanie (ponownie) wytwarzać sekwencję sygnałów wejściowych, tj. Sygnał, nawet po ich usunięciu. Jednak artykuł Scholarpedia był dla mnie zbyt trudny do zrozumienia i zrozumienia. Czy ktoś może …

2
Przykład przeora, który w przeciwieństwie do Jeffreysa, prowadzi do tylnej części ciała, która nie jest niezmienna
Odpowiadam „odpowiedź” na pytanie, które zadałem dwa tygodnie temu: Dlaczego wcześniejsza Jeffreys była przydatna? To było naprawdę pytanie (i nie miałem wtedy prawa do komentowania), więc mam nadzieję, że to będzie w porządku: W powyższym linku omówiono, że interesującą cechą wcześniejszego Jeffreysa jest to, że podczas ponownej parametryzacji modelu wynikowy …


2
Dla jakich (symetrycznych) rozkładów próbka oznacza bardziej wydajny estymator niż mediana próby?
Pracowałem w przekonaniu, że mediana próbki jest bardziej niezawodną miarą tendencji centralnej niż średnia próbki, ponieważ ignoruje wartości odstające. Byłem zatem zaskoczony, gdy dowiedziałem się (w odpowiedzi na inne pytanie ), że dla próbek pobranych z rozkładu normalnego wariancja średniej próbki jest mniejsza niż wariancja mediany próbki (przynajmniej dla dużej …


3
Dlaczego dzielimy się przez odchylenie standardowe, a nie jakiś inny czynnik standaryzujący przed wykonaniem PCA?
Czytałem następujące uzasadnienie (z notatek kursowych cs229), dlaczego dzielimy surowe dane przez standardowe odchylenie: chociaż rozumiem, co mówi to wyjaśnienie, nie jest dla mnie jasne, dlaczego podzielenie przez odchylenie standardowe osiągnęłoby taki cel. Mówi się, że wszyscy są bardziej na tej samej „skali”. Jednak nie do końca jasne jest, dlaczego …

2
Stosunek atramentu do danych i tła wydruku
Zauważyłem, że wiele „supernowoczesnych” pakietów i motywów do kreślenia oraz wielu wybitnych ludzi z danych używa do swoich wykresów szarego tła. Oto kilka przykładów: ggplot2: Fivethirtyeight.com Nate'a Silvera: Podczas gdy w pierwszym powyższym przykładzie (ggplot2) można argumentować, że użycie szarego tła zmniejsza tusz potrzebny do linii siatki, z pewnością nie …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.