Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Różnica w implementacji podziałów binarnych w drzewach decyzyjnych
Jestem ciekawy praktycznej implementacji podziału binarnego w drzewie decyzyjnym - ponieważ dotyczy on poziomów predyktora jakościowego .XjXjX{j} W szczególności często będę używał pewnego rodzaju schematu próbkowania (np. Tworzenie worków, nadpróbkowanie itp.) Podczas budowania modelu predykcyjnego przy użyciu drzewa decyzyjnego - w celu poprawy jego dokładności i stabilności predykcyjnej. Podczas tych …

1
Hosmer-Lemeshow vs AIC dla regresji logistycznej
Jeśli Hosmer-Lemeshow wskazuje na brak dopasowania, ale AIC jest najniższy spośród wszystkich modeli ... czy nadal powinieneś używać tego modelu? Jeśli usunę zmienną, statystyka Hosmera-Lemeshowa nie będzie znacząca (co oznacza, że ​​nie ma rażącego braku dopasowania). Ale AIC wzrasta. Edycja : Ogólnie myślę, że jeśli AIC różnych modeli są sobie …

3
Opcje hostingu dla publicznie dostępnych danych
Postanowiłeś więc poprzeć pomysł na powtarzalne badania i chcesz udostępnić swoje dane online, aby ludzie mogli je zobaczyć i wykorzystać. Pytanie brzmi: gdzie go hostujesz? Moja pierwsza skłonność to oczywiście prywatna przestrzeń internetowa, którą mam na serwerze uniwersyteckim, ale te rzeczy nie są wcale tak trwałe - jeśli odejdę, katalog …

2
SVM z nierównymi wielkościami grup w danych treningowych
Próbuję zbudować maszynę SVM na podstawie danych szkoleniowych, w których jedna grupa jest reprezentowana bardziej niż druga. Grupy będą jednakowo reprezentowane w ostatecznych danych testowych. Dlatego chciałbym użyć class.weightsparametru e1071interfejsu pakietu R, libsvmaby zrównoważyć wpływ dwóch grup na dane treningowe. Ponieważ nie byłem pewien, jak dokładnie określić te wagi, przygotowałem …

2
Przybliżanie całek za pomocą symulacji Monte Carlo w R.
Jak aproksymować następującą całkę za pomocą symulacji MC? ∫1- 1∫1- 1| x-y|d xd y∫-11∫-11|x-y|rexrey \int_{-1}^{1} \int_{-1}^{1} |x-y| \,\mathrm{d}x \,\mathrm{d}y Dzięki! Edycja (jakiś kontekst): Próbuję nauczyć się korzystać z symulacji w celu przybliżenia całek i ćwiczę, gdy napotkałem pewne trudności. Edytuj 2 + 3 : Jakoś się pomyliłem i pomyślałem, że …

9
Jak mogę automatycznie tworzyć ładne wykresy?
Na przykład. takich jak te na tej stronie http://store.steampowered.com/hwsurvey Czy istnieje gotowe oprogramowanie, które może to zrobić? Alternatywnie, jakieś zalecenia dla innego oprogramowania, które robi coś podobnego? Wiem, że tak naprawdę nie jest to pytanie statystyczne, ale bardzo mocno czuję, że dane powinny być przedstawiane w zgrabny i atrakcyjny sposób, …

4
Referencje dla konsultantów statystycznych w celu zaoferowania swoim klientom
To pytanie ilustruje trudność samodzielnego opanowania statystyk i prawdopodobieństwa w obliczu słabo rozwiniętych zasobów, takich jak Wikipedia. Przyszło mi do głowy, że konsultanci statystyczni, a jest ich tu kilku, mogą rutynowo stanąć przed wyzwaniem wyjaśnienia klientowi pewnych koncepcji i metod. To jest druga strona monety pedagogicznej. Kiedy opanujesz tę koncepcję, …


3
Czytanie tylko dwóch z trzech kolumn za pomocą read.csv
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Mam zestaw danych ascii, który składa się z trzech kolumn, ale tylko dwie ostatnie są danymi rzeczywistymi. Teraz chcę utworzyć dotchart danych za pomocą read.csv(file …
12 r 

4
Przykłady kosztownych konsekwencji niewłaściwego użycia narzędzi statystycznych
Podejrzewam, że większość użytkowników narzędzi statystycznych to użytkownicy pomocniczy (ludzie, którzy nie mieli formalnego szkolenia statystycznego). Bardzo kuszące jest, aby badacze i inni profesjonaliści zastosowali metody statystyczne do swoich danych po prostu dlatego, że widzieli to „wcześniej” w recenzowanych artykułach, szarej literaturze, Internecie lub na konferencji. Jednak zrobienie tego bez …

5
Czy mogę użyć PCA do dokonania wyboru zmiennych do analizy skupień?
Muszę zmniejszyć liczbę zmiennych, aby przeprowadzić analizę skupień. Moje zmienne są silnie skorelowane, więc pomyślałem o wykonaniu analizy czynnikowej PCA (analiza głównego składnika). Jeśli jednak użyję uzyskanych wyników, moje klastry nie będą całkiem poprawne (w porównaniu z poprzednimi klasyfikacjami w literaturze). Pytanie: Czy mogę użyć macierzy rotacji, aby wybrać zmienne …

4
Prognozowanie binarnych szeregów czasowych
Mam binarne szeregi czasowe z 1, gdy samochód się nie porusza, i 0, gdy samochód się porusza. Chcę zrobić prognozę dla horyzontu czasowego do 36 godzin do przodu i dla każdej godziny. Moje pierwsze podejście polegało na użyciu Naiwnego Bayesa przy użyciu następujących danych wejściowych: t-24 (codziennie sezonowo), t-48 (tygodniowo …

2
Różnica między testem t a ANOVA w regresji liniowej
Zastanawiam się, jakie są różnice między testem t a ANOVA w regresji liniowej? Czy test t sprawdza, czy którykolwiek z nachyleń i przecięcia ma średnią zero, podczas gdy ANOVA sprawdza, czy wszystkie nachylenia mają średnią zero? Czy to jedyna różnica między nimi? W prostej regresji liniowej, tj. Gdy istnieje tylko …

4
Estymator dla rozkładu dwumianowego
Jak definiujemy estymator dla danych pochodzących z rozkładu dwumianowego? W przypadku bernoulli mogę myśleć o estymatorze szacującym parametr p, ale w przypadku dwumianu nie widzę, jakie parametry należy oszacować, gdy n charakteryzuje rozkład. Aktualizacja: Przez estymator rozumiem funkcję obserwowanych danych. Estymator służy do oszacowania parametrów rozkładu generującego dane.


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.