Niemal każdy przykład drzewa decyzyjnego, z którym się zetknąłem, jest drzewem binarnym. Czy to jest dość uniwersalne? Czy większość standardowych algorytmów (C4.5, CART itp.) Obsługuje tylko drzewa binarne? Z tego, co zbieram, CHAID nie ogranicza się do drzew binarnych, ale wydaje się, że jest to wyjątek. Dwukierunkowy podział, po którym …
Zastanawiałem się, czy można mieć bardzo silny współczynnik korelacji (powiedzmy .9 lub wyższy), z wysoką wartością p (powiedzmy .25 lub wyższy)? Oto przykład niskiego współczynnika korelacji o wysokiej wartości p: set.seed(10) y <- rnorm(100) x <- rnorm(100)+.1*y cor.test(x,y) cor = 0,03908927, p = 0,6994 Wysoki współczynnik korelacji, niska wartość p: …
Załóżmy, że . Interesuje mnie rozkład krańcowy elementów ukośnych . Istnieje kilka prostych wyników dotyczących dystrybucji submatrices of (przynajmniej niektóre wymienione na Wikipedii). Z tego mogę wywnioskować, że krańcowy rozkład dowolnego pojedynczego elementu na przekątnej jest odwrotną gamma. Ale nie byłem w stanie wydedukować wspólnej dystrybucji.diag ( X ) = …
Dopasowuję model ARIMA do codziennych szeregów czasowych. Dane są gromadzone codziennie od 02-01-2010 do 30-07-2011 i dotyczą sprzedaży gazet. Ponieważ można znaleźć tygodniowy wzorzec sprzedaży (średnia dzienna liczba sprzedanych egzemplarzy jest zwykle taka sama od poniedziałku do piątku, a następnie wzrasta w sobotę i niedzielę), staram się uchwycić tę „sezonowość”. …
Kontekst Czytałem o teorii odpowiedzi na przedmioty i uważam ją za fascynującą. Myślę, że rozumiem podstawy, ale zastanawiam się, jak zastosować techniki statystyczne związane z tym obszarem. Poniżej znajdują się dwa artykuły podobne do obszaru, w którym chciałbym zastosować ITR: http://www.jstor.org/stable/4640738?seq=7 http://www.ncbi.nlm.nih.gov/pubmed/21744971 Drugi to ten, który naprawdę chciałbym przedłużyć w …
Kontekst Popularnym pytaniem na tej stronie jest „ Jakie są typowe grzechy statystyczne? ”. Jednym z grzechów wspomniano przy założeniu, że „korelacja implikuje przyczynowości ...” Link Następnie w komentarzach z 5 pozytywnymi opiniami sugeruje się, że: „Google zarabia 65 mld USD rocznie, nie dbając o różnicę”. Ryzykując nadmierną analizę lekkiego …
Usiłuję uchwycić pojęcie uprzedzeń w kontekście analizy regresji liniowej. Jaka jest matematyczna definicja błędu? Co dokładnie jest stronnicze i dlaczego / jak? Obrazowy przykład?
Regresja Poissona jest GLM z funkcją log-link. Alternatywnym sposobem modelowania danych liczbowych o rozkładzie innym niż normalny jest przetwarzanie wstępne, biorąc dziennik (a raczej dziennik (1 + liczba) do obsługi zer). Jeśli wykonasz regresję metodą najmniejszych kwadratów w odpowiedziach na logarytm, czy jest to związane z regresją Poissona? Czy poradzi …
W Modelowaniu statystycznym: The Two Cultures pisze Leo Breiman Obecnie stosowaną praktyką jest sprawdzanie dopasowania modelu danych za pomocą testów dopasowania i analizy resztkowej. W pewnym momencie, kilka lat temu, stworzyłem symulowany problem regresji w siedmiu wymiarach z kontrolowaną nieliniowością. Standardowe testy dobroci dopasowania nie odrzucały liniowości, dopóki nieliniowość nie …
SPSS zapewnia wyjściowy „przedział ufności średnich różnic”. Czytałem w niektórych miejscach, że oznacza to „95 razy na 100, nasza średnia różnica w próbce będzie między tymi granicami”. Nie jest to dla mnie jasne. Czy ktoś może zasugerować jaśniejsze sformułowania, aby wyjaśnić „przedział ufności różnicy średnich”? Ten wynik pojawia się w …
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Czy ktoś mógłby zaoferować jakieś wskazówki, jak używać weightsargumentu w lmfunkcji R. Powiedzmy, na przykład, że próbujesz dopasować model do danych o ruchu drogowym i …
Uwaga: przypadek to n >> p Czytam Elementy uczenia statystycznego i jest wiele wzmianek o „właściwym” sposobie przeprowadzania walidacji krzyżowej (np. Strona 60, strona 245). W szczególności moje pytanie brzmi: jak ocenić ostateczny model (bez osobnego zestawu testowego) za pomocą k-fold CV lub bootstrapowania, gdy przeprowadzono wyszukiwanie modelu? Wydaje się, …
Używam logarytmicznych rozkładów jako poprzednich rozkładów dla parametrów skali (dla rozkładów normalnych, rozkładów t itp.), Gdy mam ogólne pojęcie o tym, jaka powinna być skala, ale chcę się pomylić, mówiąc, że nie wiem dużo o tym. Używam tego, ponieważ to użycie ma dla mnie intuicyjny sens, ale nie widziałem, żeby …
Nie jestem w żaden sposób statystykiem (miałem kurs statystyki matematycznej, ale nic więcej), a ostatnio, studiując teorię informacji i mechanikę statystyczną, spotkałem to, co nazywa się „miarą niepewności” / „entropią”. Odczytałem jej pochodzenie Khinchina jako miarę niepewności i miało to dla mnie sens. Kolejną rzeczą, która miała sens, był opis …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.