Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


4
Jak obliczyć skumulowany rozkład w R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Muszę obliczyć funkcję skumulowanego rozkładu próbki danych. Czy istnieje coś podobnego do hist () w R, które mierzy funkcję gęstości skumulowanej? Próbuję ecdf (), ale …
23 r  distributions  cdf 

3
Jakie wspólne modele prognostyczne można postrzegać jako specjalne przypadki modeli ARIMA?
Dziś rano obudziłem się zastanawiając (może to wynikać z faktu, że ostatniej nocy nie spałem dużo): skoro walidacja krzyżowa wydaje się być kamieniem węgielnym właściwego prognozowania szeregów czasowych, jakie modele powinienem „normalnie” „weryfikacja krzyżowa względem? Wymyśliłem kilka (łatwych), ale wkrótce zdałem sobie sprawę, że wszystkie były wyjątkowymi przypadkami modeli ARIMA. …

3
Wizualizacja kalibracji przewidywanego prawdopodobieństwa modelu
Załóżmy, że mam model predykcyjny, który generuje dla każdej instancji prawdopodobieństwo dla każdej klasy. Teraz zdaję sobie sprawę, że istnieje wiele sposobów oceny takiego modelu, jeśli chcę wykorzystać te prawdopodobieństwa do klasyfikacji (precyzja, przywołanie itp.). Rozumiem również, że krzywa ROC i obszar pod nią mogą być użyte do określenia, jak …

4
Czy istnieje nieparametryczny odpowiednik Tukey HSD?
Używam JMP do badania różnic w pokryciu wegetacyjnym w grupach form wzrostu (drzewa, krzewy, zioła itp.) Przed i po trzech zabiegach kontrolnych. Rozmiar mojej próbki jest niewielki (n = 5) i większość moich rozkładów zwykle nie jest dystrybuowana. W przypadku rozkładów normalnych użyłem ANOVA do analizy różnic (zmiana procentowa) między …

4
Czy zawsze istnieje maksymalizator dla jakiegokolwiek problemu MLE?
Zastanawiam się, czy zawsze istnieje maksymalizator dla jakiegokolwiek problemu z oszacowaniem maksymalnego (log-) prawdopodobieństwa? Innymi słowy, czy istnieje jakiś rozkład i niektóre jego parametry, dla których problem MLE nie ma maksymalizatora? Moje pytanie pochodzi od twierdzenia inżyniera, że ​​funkcja kosztu (prawdopodobieństwo lub logarytmiczne prawdopodobieństwo, nie jestem pewien, który był zamierzony) …

2
Rozkład odległości Mahalanobisa na poziomie obserwacji
Jeśli mam wielowymiarową normalną próbkę iid i zdefiniuję (który jest rodzajem odległości Mahalanobisa [kwadrat] od punktu próbki do wektora przy użyciu macierzy do ważenia), jaki jest rozkład (odległość Mahalanobisa do średnia próbki przy użyciu przykładowej macierzy kowariancji )?d 2 i ( b , A ) = ( X i - …

3
Jak przetestować autokorelację reszt?
Mam macierz z dwiema kolumnami, które mają wiele cen (750). Na poniższym obrazku narysowałem resztki następującej regresji liniowej: lm(prices[,1] ~ prices[,2]) Patrząc na obraz, wydaje się być bardzo silną autokorelacją reszt. Jak mogę jednak sprawdzić, czy autokorelacja tych reszt jest silna? Jakiej metody powinienem użyć? Dziękuję Ci!

4
Czy jako recenzent mogę uzasadnić żądanie podania danych i kodu, nawet jeśli czasopismo tego nie robi?
Ponieważ nauka musi być odtwarzalna, z definicji coraz częściej uznaje się, że dane i kod są zasadniczym składnikiem odtwarzalności, o czym dyskutuje Okrągły Stół Yale do udostępniania danych i kodów . Czy przeglądając manuskrypt czasopisma, który nie wymaga udostępniania danych i kodu, mogę poprosić o udostępnienie danych i kodu do …

3
Witryny z konkursami modelowania predykcyjnego
Biorę udział w konkursach modelowania predykcyjnego w Kaggle , TunedIt i CrowdAnalytix . Uważam, że te strony są dobrym sposobem na „wypracowanie” statystyk / uczenia maszynowego. Czy są jeszcze jakieś strony, o których powinienem wiedzieć? Co sądzisz o konkursach, w których gospodarz zamierza czerpać zyski z zgłoszeń konkurencji? / edycja: …

4
Czy usunąć przypadki oznaczone przez oprogramowanie statystyczne jako odstające od siebie podczas wykonywania regresji wielokrotnej?
Przeprowadzam analizy wielu regresji i nie jestem pewien, czy wartości odstające w moich danych powinny zostać usunięte. Dane, które mnie niepokoją, pojawiają się jako „koła” na wykresach pudełkowych SPSS, jednak nie ma gwiazdek (co sprawia, że ​​uważam, że nie są „takie złe”). Sprawy, o które się martwię, pojawiają się w …


3
Jak obliczyć wartość p parametrów dla modelu ARIMA w R?
Podczas przeprowadzania badań szeregów czasowych w R stwierdziłem, że arima zapewnia tylko wartości współczynników i ich standardowe błędy dopasowanego modelu. Jednak chcę również uzyskać wartość p współczynników. Nie znalazłem żadnej funkcji, która zapewnia znaczenie cefry. Więc chcę to obliczyć sam, ale nie znam stopnia swobody w rozkładzie współczynników t lub …



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.