Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Jak przeprowadzasz ładowanie z danymi szeregów czasowych?
Ostatnio dowiedziałem się o stosowaniu technik ładowania początkowego do obliczania standardowych błędów i przedziałów ufności dla estymatorów. Nauczyłem się, że jeśli dane są IID, możesz traktować dane przykładowe jako populację i wykonywać próbkowanie z wymianą, co pozwoli ci uzyskać wiele symulacji statystyki testowej. W przypadku szeregów czasowych wyraźnie nie możesz …


10
Dlaczego suma dwóch zmiennych losowych jest splotem?
Przez długi czas nie rozumieć, dlaczego „suma” dwóch zmiennych losowych jest ich uwypuklony , natomiast suma funkcji gęstości mieszaniny f(x)f(x)f(x) i g(x)g(x)g(x) jest pf(x)+(1−p)g(x)pf(x)+(1−p)g(x)p\,f(x)+(1-p)g(x); suma arytmetyczna, a nie ich splot. Dokładna fraza „suma dwóch zmiennych losowych” pojawia się w Google 146 000 razy i jest eliptyczna w następujący sposób. Jeśli …


1
Jeśli wygeneruję losową macierz symetryczną, jaka jest szansa, że ​​jest ona dodatnia?
Mam dziwne pytanie, kiedy eksperymentowałem z wypukłymi optymalizacjami. Pytanie brzmi: Załóżmy, że losowo (powiedzmy standardowy rozkład normalny) generuję macierz symetryczną (na przykład generuję górną macierz trójkątną i wypełniam dolną połowę, aby upewnić się, że jest symetryczna), jaka jest szansa, że ​​jest to wartość dodatnia określona matryca? Czy w ogóle można …


2
Czy Jürgen Schmidhuber wprowadził generatywne sieci przeciwników?
Czytam na https://en.wikipedia.org/wiki/Generative_adversarial_networks : [Generatywne sieci przeciwników] zostały wprowadzone przez Iana Goodfellow i in. W 2014 r. ale Jurgen Schmidhuber twierdzi, że wcześniej wykonał podobną pracę w tym kierunku (np. podczas NIPS 2016 odbyła się debata podczas samouczka generatywnych sieci przeciwników: https://channel9.msdn.com/Events/Neural-Information-Processing-Systems- Konferencja / Neural-Information-Processing-Systems-Conference-NIPS-2016 / Generative-Adversarial-Networks patrz 1h03min). Czy …

3
Dlaczego znajdowanie małych efektów w dużych badaniach wskazuje na stronniczość publikacji?
Kilka prac metodologicznych (np. Egger i in. 1997a, 1997b) omawia stronniczość publikacji ujawnioną w metaanalizach, wykorzystując wykresy lejkowe, takie jak ta poniżej. Artykuł z 1997b mówi dalej, że „jeśli obecne jest stronniczość publikacji, oczekuje się, że spośród opublikowanych badań największe z nich wykażą najmniejsze efekty”. Ale dlaczego tak jest? Wydaje …


8
Czy powinienem najpierw uczyć statystyki bayesowskiej czy częstokrzyskiej?
Pomagam moim chłopcom, obecnie w szkole średniej, w zrozumieniu statystyk i zastanawiam się nad kilkoma prostymi przykładami, nie zapominając o przebłyskach teorii. Moim celem byłoby zaproponowanie im najbardziej intuicyjnego, ale instrumentalnie konstruktywnego podejścia do nauki statystyk od zera, aby wzbudzić ich zainteresowanie dalszą nauką statystyki i nauką ilościową. Zanim jednak …

2
Co mówi nam entropia?
Czytam o entropii i trudno mi zrozumieć, co to znaczy w ciągłym przypadku. Strona wiki zawiera następujące informacje: Rozkład prawdopodobieństwa zdarzeń w połączeniu z ilością informacji każdego zdarzenia tworzy zmienną losową, której oczekiwaną wartością jest średnia ilość informacji lub entropia wygenerowana przez ten rozkład. Więc jeśli obliczę entropię związaną z …
32 entropy 

6
Czy istnieją przykłady, w których nie obowiązuje twierdzenie o limicie centralnym?
Wikipedia mówi - W teorii prawdopodobieństwa centralne twierdzenie graniczne (CLT) ustala, że w większości sytuacji , gdy dodaje się niezależne zmienne losowe, ich odpowiednio znormalizowana suma zmierza w kierunku rozkładu normalnego (nieformalnie „krzywej dzwonowej”), nawet jeśli same zmienne pierwotne nie są normalnie dystrybuowane ... Kiedy mówi „w większości sytuacji”, w …

4
Po co stosować regularyzację w regresji wielomianowej zamiast obniżać stopień?
Na przykład podczas regresji, dwoma hiperparametrami do wyboru są często pojemność funkcji (np. Największy wykładnik wielomianu) i ilość regularyzacji. Jestem zdezorientowany, dlaczego nie po prostu wybrać funkcję niskiej pojemności, a następnie zignorować jakąkolwiek regularyzację? W ten sposób nie będzie pasował. Jeśli mam funkcję dużej pojemności wraz z regularyzacją, czy to …

2
Czy wysoce skorelowane zmienne w losowym lesie nie zniekształcają dokładności i wyboru cech?
W moim rozumieniu wysoce skorelowane zmienne nie spowodują problemów z wieloma kolinearnością w losowym modelu lasu (proszę mnie poprawić, jeśli się mylę). Jednak z drugiej strony, jeśli mam zbyt wiele zmiennych zawierających podobne informacje, czy model będzie ważył za dużo na tym zestawie, a nie na innych? Na przykład istnieją …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.