Badam część mojego zestawu danych zawierającą 46840 podwójnych wartości od 1 do 1690 pogrupowanych w dwie grupy. Aby przeanalizować różnice między tymi grupami, zacząłem od zbadania rozkładu wartości w celu wybrania właściwego testu. Po poradniku na temat testowania normalności zrobiłem qqplot, histogram i boxplot. To nie wydaje się być normalnym …
Próbuję napisać własną funkcję do analizy głównych składników, PCA (oczywiście jest już dużo napisanych, ale jestem zainteresowany tylko implementacją różnych rzeczy). Głównym problemem, jaki napotkałem, jest krok weryfikacji krzyżowej i obliczanie przewidywanej sumy kwadratów (PRASA). Nie ma znaczenia, z której walidacji krzyżowej korzystam, chodzi głównie o teorię, ale zastanów się …
Od dwóch lat prowadzę działalność online, więc mam miesięczne dane dotyczące sprzedaży od około dwóch lat. Na mój biznes na każdy miesiąc z pewnością ma wpływ sezonowa huśtawka (działa lepiej w Boże Narodzenie itp.) I prawdopodobnie kilka innych czynników, których nie jestem świadomy. W celu lepszego przewidywania przyszłej sprzedaży oraz …
Jakie są definicje częściowo sprzężonych priorów i warunkowych sprzężonych priorów ? Znalazłem je w analizie danych bayesowskich Gelmana , ale nie mogłem znaleźć ich definicji.
W metodach MCMC wciąż czytam o burn-inczasie lub liczbie próbek "burn". Co to dokładnie jest i dlaczego jest potrzebne? Aktualizacja: Czy po stabilizacji MCMC pozostaje stabilny? W jaki sposób pojęcie burn-inczasu jest powiązane z czasem mieszania?
Chcę utworzyć klaster ogromnego zestawu danych, dla którego mam tylko pary odległości. Wdrożyłem algorytm k-medoidów, ale jego uruchomienie trwa zbyt długo, dlatego chciałbym zacząć od zmniejszenia wymiaru mojego problemu przez zastosowanie PCA. Jednak jedynym sposobem, w jaki znam tę metodę, jest zastosowanie macierzy kowariancji, której nie mam w swojej sytuacji. …
Oceniam dwa (2) czynniki chłodnicze (gazy), które zostały użyte w tym samym systemie chłodniczym. Do oceny mam dane dotyczące nasyconej temperatury ssania ( ), temperatury skraplania ( ) i natężenia prądu ( ). Istnieją dwa (2) zestawy danych; 1. czynnik chłodniczy ( ) i 2. czynnik chłodniczy ( ). Używam …
Moje wykształcenie to informatyka. Jestem całkiem nowy w metodach próbkowania Monte Carlo i chociaż rozumiem matematykę, trudno mi znaleźć intuicyjne przykłady ważnego próbkowania. Dokładniej, czy ktoś mógłby podać przykłady: oryginalny rozkład, z którego nie można próbkować, ale można go oszacować rozkład ważności, z którego można pobrać próbki i odpowiedni dla …
Hadley Wickham napisał w zeszłym roku w JSS gwiezdny artykuł zatytułowany „Tidy Data” ( link ) na temat manipulacji danymi i doprowadzenia danych do stanu „optymalnego” w celu przeprowadzenia analizy. Zastanawiałem się jednak, jakie były najlepsze praktyki w zakresie prezentacji danych tabelarycznych w środowisku pracy? Powiedzmy, że twój współpracownik prosi …
Chciałem lepiej zrozumieć dokładny test Fishera, więc wymyśliłem następujący przykład zabawki, w którym f i m odpowiada płci męskiej i żeńskiej, a n i y odpowiada takiemu „zużyciu sody”: > soda_gender f m n 0 5 y 5 0 Oczywiście jest to drastyczne uproszczenie, ale nie chciałem, aby kontekst przeszkadzał. …
To jest raczej pytanie o historię nauki, ale mam nadzieję, że jest to temat na ten temat. Czytałem, że Thomasowi Bayesowi udało się odkryć twierdzenie Bayesa dotyczące szczególnego przypadku przeora mundurowego, a nawet wtedy najwyraźniej miał z tym problem. Biorąc pod uwagę, jak banalne jest ogólne twierdzenie Bayesa w nowoczesnym …
Używam pakietu karetki do trenowania obiektu randomForest z 10x10CV. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) Następnie testuję randomForest na testSet (nowe dane) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) Macierz pomieszania pokazuje mi, że model nie jest taki zły. confusionMatrix(data=RF.testSet$Prediction, RF.testSet$Defect) Reference …
Tutaj w Wikipedii jest napisane: Dla wystarczająco dużych wartości λλλ (powiedzmy λ>1000λ>1000λ>1000 ) rozkład normalny ze średnią λλλ i wariancją λλλ (odchylenie standardowe λ−−√λ\sqrt{\lambda} ) stanowi doskonałe przybliżenie do rozkładu Poissona. Jeżeli λλλ jest większe niż około 10, to rozkład normalny jest dobrym przybliżeniem, jeśli przeprowadzona jest odpowiednia korekta ciągłości, …
Jest dobrze ustalone, przynajmniej wśród statystyków pewnego wyższego kalibru, że modele z wartościami statystyki AIC mieszczącymi się w pewnym progu wartości minimalnej należy uznać za odpowiednie jako model minimalizujący statystyki AIC. Na przykład w [1, s. 221] znajdujemy Wtedy modele z małym GCV lub AIC będą uważane za najlepsze. Oczywiście …
Czy ktoś ma pojęcie o tym, dlaczego korelacja warunkowa między 2 zmiennymi jest nazywana korelacją „częściową”, a prosta korelacja między nimi (a więc gdy nie jest uwarunkowana żadną inną zmienną) jest nazywana korelacją „marginalną”? Jaka jest intuicja za słowami „częściowy” i „marginalny”? Co robią z „częściami” lub „marginesami”? Dobrze byłoby …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.