Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Czy drzewa decyzyjne są prawie zawsze drzewami binarnymi?
Niemal każdy przykład drzewa decyzyjnego, z którym się zetknąłem, jest drzewem binarnym. Czy to jest dość uniwersalne? Czy większość standardowych algorytmów (C4.5, CART itp.) Obsługuje tylko drzewa binarne? Z tego, co zbieram, CHAID nie ogranicza się do drzew binarnych, ale wydaje się, że jest to wyjątek. Dwukierunkowy podział, po którym …

5
Przykład silnego współczynnika korelacji o wysokiej wartości p
Zastanawiałem się, czy można mieć bardzo silny współczynnik korelacji (powiedzmy .9 lub wyższy), z wysoką wartością p (powiedzmy .25 lub wyższy)? Oto przykład niskiego współczynnika korelacji o wysokiej wartości p: set.seed(10) y <- rnorm(100) x <- rnorm(100)+.1*y cor.test(x,y) cor = 0,03908927, p = 0,6994 Wysoki współczynnik korelacji, niska wartość p: …

1
Rozkład krańcowy przekątnej odwróconej macierzy rozproszonej Wishart
Załóżmy, że . Interesuje mnie rozkład krańcowy elementów ukośnych . Istnieje kilka prostych wyników dotyczących dystrybucji submatrices of (przynajmniej niektóre wymienione na Wikipedii). Z tego mogę wywnioskować, że krańcowy rozkład dowolnego pojedynczego elementu na przekątnej jest odwrotną gamma. Ale nie byłem w stanie wydedukować wspólnej dystrybucji.diag ( X ) = …

3
Auto.arima z danymi dziennymi: jak uchwycić sezonowość / okresowość?
Dopasowuję model ARIMA do codziennych szeregów czasowych. Dane są gromadzone codziennie od 02-01-2010 do 30-07-2011 i dotyczą sprzedaży gazet. Ponieważ można znaleźć tygodniowy wzorzec sprzedaży (średnia dzienna liczba sprzedanych egzemplarzy jest zwykle taka sama od poniedziałku do piątku, a następnie wzrasta w sobotę i niedzielę), staram się uchwycić tę „sezonowość”. …

5
Jak zacząć korzystać z teorii odpowiedzi na pytania i jakiego oprogramowania użyć?
Kontekst Czytałem o teorii odpowiedzi na przedmioty i uważam ją za fascynującą. Myślę, że rozumiem podstawy, ale zastanawiam się, jak zastosować techniki statystyczne związane z tym obszarem. Poniżej znajdują się dwa artykuły podobne do obszaru, w którym chciałbym zastosować ITR: http://www.jstor.org/stable/4640738?seq=7 http://www.ncbi.nlm.nih.gov/pubmed/21744971 Drugi to ten, który naprawdę chciałbym przedłużyć w …

4
W jakim stopniu rozróżnienie między korelacją a związkiem przyczynowym ma znaczenie dla Google?
Kontekst Popularnym pytaniem na tej stronie jest „ Jakie są typowe grzechy statystyczne? ”. Jednym z grzechów wspomniano przy założeniu, że „korelacja implikuje przyczynowości ...” Link Następnie w komentarzach z 5 pozytywnymi opiniami sugeruje się, że: „Google zarabia 65 mld USD rocznie, nie dbając o różnicę”. Ryzykując nadmierną analizę lekkiego …


3
Regresja Poissona vs. regresja najmniejszych kwadratów?
Regresja Poissona jest GLM z funkcją log-link. Alternatywnym sposobem modelowania danych liczbowych o rozkładzie innym niż normalny jest przetwarzanie wstępne, biorąc dziennik (a raczej dziennik (1 + liczba) do obsługi zer). Jeśli wykonasz regresję metodą najmniejszych kwadratów w odpowiedziach na logarytm, czy jest to związane z regresją Poissona? Czy poradzi …

2
Trudność testowania liniowości w regresji
W Modelowaniu statystycznym: The Two Cultures pisze Leo Breiman Obecnie stosowaną praktyką jest sprawdzanie dopasowania modelu danych za pomocą testów dopasowania i analizy resztkowej. W pewnym momencie, kilka lat temu, stworzyłem symulowany problem regresji w siedmiu wymiarach z kontrolowaną nieliniowością. Standardowe testy dobroci dopasowania nie odrzucały liniowości, dopóki nieliniowość nie …


2
Jak używać wag w funkcji lm w R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Czy ktoś mógłby zaoferować jakieś wskazówki, jak używać weightsargumentu w lmfunkcji R. Powiedzmy, na przykład, że próbujesz dopasować model do danych o ruchu drogowym i …
21 r  regression 

2
Cross Validation (generalizacja błędów) po wyborze modelu
Uwaga: przypadek to n >> p Czytam Elementy uczenia statystycznego i jest wiele wzmianek o „właściwym” sposobie przeprowadzania walidacji krzyżowej (np. Strona 60, strona 245). W szczególności moje pytanie brzmi: jak ocenić ostateczny model (bez osobnego zestawu testowego) za pomocą k-fold CV lub bootstrapowania, gdy przeprowadzono wyszukiwanie modelu? Wydaje się, …



3
Porównanie MaxEnt, ML, Bayesa i innych metod wnioskowania statystycznego
Nie jestem w żaden sposób statystykiem (miałem kurs statystyki matematycznej, ale nic więcej), a ostatnio, studiując teorię informacji i mechanikę statystyczną, spotkałem to, co nazywa się „miarą niepewności” / „entropią”. Odczytałem jej pochodzenie Khinchina jako miarę niepewności i miało to dla mnie sens. Kolejną rzeczą, która miała sens, był opis …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.