Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

6
R: oblicz korelację według grup
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. W R mam ramkę danych zawierającą etykietę klasy C (współczynnik) i dwa pomiary, M1 i M2 . Jak obliczyć korelację między M1 i M2 w …
17 r  correlation 

9
Jaka jest różnica między statystyką a biostatystyką?
Przyszło mi do głowy, że chociaż przez lata zebrałem kilka pomysłów na temat różnic między statystykami a biostatystyką, nigdy nie usłyszałem formalnego wyjaśnienia. Jaka jest różnica między tymi dwoma dyscyplinami (obecnie)? I dlaczego to rozróżnienie się zaczęło? EDYCJA: W moim pierwotnym pytaniu nie byłem wystarczająco szczegółowy. Rozumiem, że biostatystyka to …



2
Jeśli zmienne szerokości jądra są często dobre dla regresji jądra, dlaczego na ogół nie są one dobre do oszacowania gęstości jądra?
To pytanie wynika z dyskusji w innym miejscu . Zmienne jądra są często używane w regresji lokalnej. Na przykład, less jest szeroko stosowany i działa dobrze jako wygładzacz regresji, i jest oparty na jądrze o zmiennej szerokości, która dostosowuje się do rzadkości danych. Z drugiej strony zwykle uważa się, że …



4
Solidny test t dla średniej
Próbuję przetestować zerową wartość , względem lokalnej alternatywy E [ X ] > 0 , dla zmiennej losowej X , z zastrzeżeniem łagodnego do średniego pochylenia i kurtozy zmiennej losowej. Zgodnie z sugestiami Wilcoxa w „Wstęp do solidnego szacowania i testowania hipotez” spojrzałem na testy oparte na skróconej średniej, medianie, …

3
Analiza czynnikowa kwestionariuszy złożonych z elementów Likerta
Kiedyś analizowałem przedmioty z psychometrycznego punktu widzenia. Ale teraz próbuję przeanalizować inne rodzaje pytań dotyczących motywacji i innych tematów. Wszystkie te pytania dotyczą skal Likerta. Moją początkową myślą było zastosowanie analizy czynnikowej, ponieważ hipoteza pytań odzwierciedla niektóre podstawowe wymiary. Ale czy analiza czynnikowa jest odpowiednia? Czy konieczne jest sprawdzenie każdego …

12
Najlepsze książki na wprowadzenie do analizy danych statystycznych?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Kupiłem tę książkę: Jak mierzyć cokolwiek: Znajdowanie wartości niematerialnych w biznesie i Pierwsza analiza danych: przewodnik dla uczących się po dużych liczbach, statystykach i dobrych …

5
Regresja Poissona z dużymi danymi: czy zmiana jednostki miary jest błędna?
Ze względu na silnię w rozkładzie Poissona oszacowanie modeli Poissona (na przykład przy użyciu maksymalnego prawdopodobieństwa) staje się niepraktyczne, gdy obserwacje są duże. Na przykład, jeśli próbuję oszacować model wyjaśniający liczbę samobójstw w danym roku (dostępne są tylko dane roczne) i powiedzmy, że są tysiące samobójstw każdego roku, czy błędne …


2
Czy można zautomatyzować prognozowanie szeregów czasowych?
Chciałbym zbudować algorytm, który byłby w stanie analizować dowolne szeregi czasowe i „automatycznie” wybierać najlepszą tradycyjną / statystyczną metodę prognozowania (i jej parametry) dla analizowanych danych szeregów czasowych. Czy można by zrobić coś takiego? Jeśli tak, czy możesz dać mi kilka wskazówek, jak można do tego podejść?

2
Jeśli model automatycznej regresji szeregów czasowych jest nieliniowy, czy nadal wymaga stacjonarności?
Myślenie o wykorzystaniu rekurencyjnych sieci neuronowych do prognozowania szeregów czasowych. Zasadniczo wdrażają rodzaj uogólnionej nieliniowej auto-regresji, w porównaniu do modeli ARMA i ARIMA, które wykorzystują liniową auto-regresję. Jeśli wykonujemy nieliniową autoregresję, czy nadal konieczne jest, aby szeregi czasowe były nieruchome i czy musielibyśmy różnicować sposób działania w modelach ARIMA? Czy …

1
Solidny PCA w porównaniu z solidną odległością Mahalanobisa do wykrywania wartości odstających
Solidna metoda PCA (opracowana przez Candes i in. 2009 lub jeszcze lepiej Netrepalli i in. 2014 ) jest popularną metodą wykrywania zmiennych odstających na wielu odmianach , ale odległość Mahalanobisa można również zastosować do detekcji wartości odstających, biorąc pod uwagę solidną, regularną ocenę macierzy kowariancji . Jestem ciekawy (nie) zalet …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.