Czy istnieje przypadkowa implementacja lasu R, która działa dobrze z bardzo rzadkimi danymi? Mam tysiące lub miliony boolowskich zmiennych wejściowych, ale tylko setki będą PRAWDĄ dla każdego podanego przykładu. Jestem stosunkowo nowy w R i zauważyłem, że istnieje pakiet „Matrix” do radzenia sobie z rzadkimi danymi, ale wydaje się, że …
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Muszę obliczyć funkcję skumulowanego rozkładu próbki danych. Czy istnieje coś podobnego do hist () w R, które mierzy funkcję gęstości skumulowanej? Próbuję ecdf (), ale …
Dziś rano obudziłem się zastanawiając (może to wynikać z faktu, że ostatniej nocy nie spałem dużo): skoro walidacja krzyżowa wydaje się być kamieniem węgielnym właściwego prognozowania szeregów czasowych, jakie modele powinienem „normalnie” „weryfikacja krzyżowa względem? Wymyśliłem kilka (łatwych), ale wkrótce zdałem sobie sprawę, że wszystkie były wyjątkowymi przypadkami modeli ARIMA. …
Załóżmy, że mam model predykcyjny, który generuje dla każdej instancji prawdopodobieństwo dla każdej klasy. Teraz zdaję sobie sprawę, że istnieje wiele sposobów oceny takiego modelu, jeśli chcę wykorzystać te prawdopodobieństwa do klasyfikacji (precyzja, przywołanie itp.). Rozumiem również, że krzywa ROC i obszar pod nią mogą być użyte do określenia, jak …
Używam JMP do badania różnic w pokryciu wegetacyjnym w grupach form wzrostu (drzewa, krzewy, zioła itp.) Przed i po trzech zabiegach kontrolnych. Rozmiar mojej próbki jest niewielki (n = 5) i większość moich rozkładów zwykle nie jest dystrybuowana. W przypadku rozkładów normalnych użyłem ANOVA do analizy różnic (zmiana procentowa) między …
Zastanawiam się, czy zawsze istnieje maksymalizator dla jakiegokolwiek problemu z oszacowaniem maksymalnego (log-) prawdopodobieństwa? Innymi słowy, czy istnieje jakiś rozkład i niektóre jego parametry, dla których problem MLE nie ma maksymalizatora? Moje pytanie pochodzi od twierdzenia inżyniera, że funkcja kosztu (prawdopodobieństwo lub logarytmiczne prawdopodobieństwo, nie jestem pewien, który był zamierzony) …
Jeśli mam wielowymiarową normalną próbkę iid i zdefiniuję (który jest rodzajem odległości Mahalanobisa [kwadrat] od punktu próbki do wektora przy użyciu macierzy do ważenia), jaki jest rozkład (odległość Mahalanobisa do średnia próbki przy użyciu przykładowej macierzy kowariancji )?d 2 i ( b , A ) = ( X i - …
Mam macierz z dwiema kolumnami, które mają wiele cen (750). Na poniższym obrazku narysowałem resztki następującej regresji liniowej: lm(prices[,1] ~ prices[,2]) Patrząc na obraz, wydaje się być bardzo silną autokorelacją reszt. Jak mogę jednak sprawdzić, czy autokorelacja tych reszt jest silna? Jakiej metody powinienem użyć? Dziękuję Ci!
Ponieważ nauka musi być odtwarzalna, z definicji coraz częściej uznaje się, że dane i kod są zasadniczym składnikiem odtwarzalności, o czym dyskutuje Okrągły Stół Yale do udostępniania danych i kodów . Czy przeglądając manuskrypt czasopisma, który nie wymaga udostępniania danych i kodu, mogę poprosić o udostępnienie danych i kodu do …
Biorę udział w konkursach modelowania predykcyjnego w Kaggle , TunedIt i CrowdAnalytix . Uważam, że te strony są dobrym sposobem na „wypracowanie” statystyk / uczenia maszynowego. Czy są jeszcze jakieś strony, o których powinienem wiedzieć? Co sądzisz o konkursach, w których gospodarz zamierza czerpać zyski z zgłoszeń konkurencji? / edycja: …
Przeprowadzam analizy wielu regresji i nie jestem pewien, czy wartości odstające w moich danych powinny zostać usunięte. Dane, które mnie niepokoją, pojawiają się jako „koła” na wykresach pudełkowych SPSS, jednak nie ma gwiazdek (co sprawia, że uważam, że nie są „takie złe”). Sprawy, o które się martwię, pojawiają się w …
Chcę wygenerować dwie zmienne. Jedna to zmienna wyniku binarnego (powiedzmy sukces / porażka), a druga to wiek w latach. Chcę, aby wiek był pozytywnie skorelowany z sukcesem. Na przykład powinno być więcej sukcesów w wyższych segmentach wiekowych niż w niższych. Idealnie powinienem być w stanie kontrolować stopień korelacji. W jaki …
Podczas przeprowadzania badań szeregów czasowych w R stwierdziłem, że arima zapewnia tylko wartości współczynników i ich standardowe błędy dopasowanego modelu. Jednak chcę również uzyskać wartość p współczynników. Nie znalazłem żadnej funkcji, która zapewnia znaczenie cefry. Więc chcę to obliczyć sam, ale nie znam stopnia swobody w rozkładzie współczynników t lub …
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte w zeszłym roku . Szukam informacji na temat sposobu, w jaki inni organizują swój kod R i dane wyjściowe. Moja obecna praktyka polega na pisaniu …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.