Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Ostrożnie o szeregach czasowych z R.
Jeśli cofniesz się wstecz, do momentu, kiedy zacząłeś od analizy szeregów czasowych. O jakich narzędziach, pakietach R i zasobach internetowych chciałbyś wiedzieć? Chciałem zapytać, od czego zacząć? W szczególności, czy istnieją jakieś zasoby dla R, które naprawdę sprowadzają go do tego, kto jest „nowy” w analizie szeregów czasowych z R.
28 r  time-series 



4
Dostosowanie odległości Kullback-Leibler?
Spójrz na ten obrazek: Jeśli wyciągniemy próbkę z gęstości czerwonej, wówczas oczekuje się, że niektóre wartości będą mniejsze niż 0,25, podczas gdy niemożliwe jest wygenerowanie takiej próbki z rozkładu niebieskiego. W konsekwencji odległość Kullbacka-Leiblera od gęstości czerwonej do gęstości niebieskiej jest nieskończonością. Jednak dwie krzywe nie są tak wyraźne, w …

6
Statystyki / Filmy prawdopodobieństwa dla początkujących
Pojawiła się już prośba o filmy ze statystykami matematycznymi , ale ludzie wyraźnie o to poprosili filmy, które zapewniają ścisłą matematyczną prezentację statystyk. tzn. filmy wideo, które mogą towarzyszyć kursowi z wykorzystaniem podręcznika wspomnianego w tej dyskusji na temat ... Jednocześnie zastanawiam się, jakie masz zalecenia dotyczące kursów stat / …
28 references 

8
Jak reprezentować niezwiązaną zmienną jako liczbę między 0 a 1
Chcę reprezentować zmienną jako liczbę z przedziału od 0 do 1. Zmienna jest nieujemną liczbą całkowitą bez nieodłącznego wiązania. Odwzorowuję 0 na 0, ale co mogę odwzorować na 1 lub liczby od 0 do 1? Mógłbym użyć historii tej zmiennej, aby podać limity. Oznaczałoby to, że muszę powtórzyć stare statystyki, …

6
Jakie są alternatywy dla złamanych osi?
Użytkownicy często mają pokusę, aby przełamać wartości osi w celu prezentacji danych o różnych rzędach wielkości na tym samym wykresie (patrz tutaj ). Chociaż może to być wygodne, nie zawsze jest to preferowany sposób wyświetlania danych (w najlepszym przypadku może być mylący). Jakie są alternatywne sposoby wyświetlania danych, które różnią …

26
Jakie pakiety R są najbardziej przydatne w codziennej pracy?
Duplikat wątku: Właśnie zainstalowałem najnowszą wersję R. Jakie pakiety powinienem uzyskać? Jakie są pakiety R , których nie wyobrażasz sobie w codziennej pracy z danymi? Proszę wymienić zarówno ogólne, jak i szczegółowe narzędzia. AKTUALIZACJA: Jak na 24.10.10 ggplot2wydaje się być zwycięzcą z 7 głosami. Inne wymienione pakiety więcej niż jeden …
28 r 

2
Dlaczego średni błąd kwadratowy jest entropią krzyżową między rozkładem empirycznym a modelem Gaussa?
W 5.5, Deep Learning (autor: Ian Goodfellow, Yoshua Bengio i Aaron Courville) stwierdza, że Każda strata polegająca na ujemnym logarytmicznym prawdopodobieństwie jest entropią krzyżową między rozkładem empirycznym określonym przez zestaw szkoleniowy a rozkładem prawdopodobieństwa określonym przez model. Na przykład średni błąd kwadratu jest entropią krzyżową między rozkładem empirycznym a modelem …

6
Dlaczego potrzebujemy regresji wielowymiarowej (w przeciwieństwie do szeregu regresji jednowymiarowych)?
Właśnie przejrzałem tę cudowną książkę: Zastosowana wielowymiarowa analiza statystyczna autorstwa Johnsona i Wichern . Ironią jest to, że wciąż nie jestem w stanie zrozumieć motywacji do korzystania z modeli wielowymiarowych (regresyjnych) zamiast osobnych modeli jednowymiarowych (regresyjnych). Przeszedłem przez stats.statexchange posty 1 i 2, które wyjaśniają (a) różnicę między regresją wielowymiarową …

4
Dlaczego warto używać Colormap viridis w trybie Jet?
Jak ogłoszono w https://www.youtube.com/watch?v=xAoljeRJ3lU , Matplotlib zmienia domyślną mapę kolorów z jet na viridis. Jednak nie rozumiem tego całkiem dobrze. Może dlatego, że jestem ślepy na kolory? Oryginalny jet colormap wygląda bardzo mocno, wyczuwam kontrast: Podczas gdy w nowym colormap viridis brakuje tego kontrastu: Czy ktoś może mi wyjaśnić to …

6
W kategoriach laika jaka jest różnica między modelem a dystrybucją?
Odpowiedzi (definicje) zdefiniowane na Wikipedii są prawdopodobnie nieco tajemnicze dla osób niezaznajomionych z wyższą matematyką / statystyką. W kategoriach matematycznych model statystyczny jest zwykle uważany za parę ( ), gdzie jest zbiorem możliwych obserwacji, tj. Przestrzenią próbki, a jest zbiorem rozkładów prawdopodobieństwa o . S P SS,PS,PS, \mathcal{P}SSSPP\mathcal{P}SSS W prawdopodobieństwie …

5
Dlaczego rośnie wariancja chodzenia losowego?
Losowo w odległości , która jest określona jako gdzie jest szum biały. Oznacza, że ​​bieżąca pozycja jest sumą poprzedniej pozycji + nieprzewidziany termin.Yt=Yt−1+etYt=Yt−1+etY_{t} = Y_{t-1} + e_tetete_t Możesz udowodnić, że średnia funkcja , ponieważμt=0μt=0\mu_t = 0 E(Yt)=E(e1+e2+...+et)=E(e1)+E(e2)+...+E(et)=0+0+...+0E(Yt)=E(e1+e2+...+et)=E(e1)+E(e2)+...+E(et)=0+0+...+0E(Y_{t}) = E(e_1+ e_2+ ... +e_t) = E(e_1) + E(e_2) +... +E(e_t) = 0 …

1
Pięknie napisane prace
Z książki Davida Salsburga Herbata degustacyjna : Chociaż czytelnik może w to nie wierzyć, styl literacki odgrywa ważną rolę w badaniach matematycznych. Niektórzy pisarze matematyczni wydają się nie być w stanie tworzyć artykułów, które są łatwe do zrozumienia. Inni wydają się czerpać przewrotną przyjemność z generowania wielu linii symbolicznej notacji …

8
Obfitość wartości P przy braku hipotezy
Interesuję się epidemiologią. Nie jestem statystykiem, ale sam próbuję przeprowadzać analizy, chociaż często napotykam trudności. Pierwszą analizę wykonałem 2 lata temu. Wartości P zostały uwzględnione wszędzie w moich analizach (po prostu zrobiłem to, co robili inni badacze), od tabel opisowych po analizy regresji. Stopniowo statystycy pracujący w moim mieszkaniu przekonywali …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.