Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Najlepszy sposób na wizualizację ścierania za pomocą R?
Na tej stronie niedawno odkryłem diagramy Sankeya, świetny sposób na wizualizację tego, co dzieje się w tradycyjnym schemacie blokowym. Oto dobry przykład diagramu Sankeya autorstwa George'a M. Whitesidesa i George'a W. Crabtree , Source; Nie zapomnij o długoterminowych podstawowych badaniach w dziedzinie energii , nauki 9 lutego 2007 r .: …

4
Testujesz statystycznie istotną różnicę w szeregach czasowych?
Mam szereg czasowy cen dwóch papierów wartościowych, A i B, w tym samym okresie i próbkowanych z tą samą częstotliwością. Chciałbym przetestować, czy istnieje jakakolwiek statystycznie istotna różnica w czasie między dwiema cenami (moja hipoteza zerowa byłaby taka, że ​​różnica jest zerowa). W szczególności używam różnic cen jako wskaźnika wydajności …

2
Jaka jest procedura „walidacji bootstrap” (inaczej „ponownej próbkowania cross-validation”)?
„Walidacja bootstrap” / „ponowna próbkowanie cross-validation” jest dla mnie nowa, ale została omówiona w odpowiedzi na to pytanie . Rozumiem, że dotyczy to 2 rodzajów danych: danych rzeczywistych i danych symulowanych, w których dany zestaw danych symulowanych jest generowany z danych rzeczywistych przez ponowne próbkowanie z wymianą, aż dane symulowane …

2
Jak wybrać pomiędzy różnymi Skorygowane
Mam na myśli skorygowane wzory R-kwadrat zaproponowane przez: Ezekiel (1930), który moim zdaniem jest obecnie używany w SPSS. R2adjusted=1−(N−1)(N−p−1)(1−R2)Radjusted2=1−(N−1)(N−p−1)(1−R2)R^2_{\rm adjusted} = 1 - \frac{(N-1)}{(N-p-1)} (1-R^2) Olkin and Pratt (1958) R2unbiased=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)Runbiased2=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)R^2_{\rm unbiased} = 1 - \frac{(N-3)(1-R^2)}{(N-p-1)} - \frac{2(N-3)(1-R^2)^2}{(N-p-1)(N-p+1)} W jakich okolicznościach (jeśli w ogóle) powinienem preferować „dostosowane” do „obiektywnych” ?R2R2R^2 Bibliografia …

3
Jak rozwinąć ramkę danych w R.
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Mam problem z analizą R. Mam ramkę danych taką jak ta: Name | Group | Count Person 1 | A | 3 Person 2 | …
15 r 

1
Jak uzyskać R-kwadrat dla lepszego dopasowania?
Jak obliczyć statystyki R-kwadrat ( ) w R dla i / lub wyniku funkcji? Na przykład dla tych danych:r2r2r^2loesspredict cars.lo <- loess(dist ~ speed, cars) cars.lp <- predict(cars.lo, data.frame(speed = seq(5, 30, 1)), se = TRUE) cars.lpma dwie tablice fitdla modelu i se.fitstandardowego błędu.
15 r  r-squared  loess 

3
Czy istnieje sposób na wyłączenie funkcji dostrajania parametrów (siatki) w CARET?
CARET automatycznie użyje wcześniej określonej siatki strojenia, aby zbudować różne modele przed wybraniem ostatecznego modelu, a następnie wytrenowaniem ostatecznego modelu na pełnych danych treningowych. Mogę dostarczyć własną siatkę tuningową z tylko jedną kombinacją parametrów. Jednak nawet w tym przypadku CARET „wybiera” najlepszy model spośród parametrów strojenia (nawet jeśli w tym …
15 r  caret 

1
Notacja estymatorów (tylda vs. kapelusz)
1. Czy istnieje jakaś konwencja nazewnictwa dotycząca czapki i symbolu tyldy w statystykach? Znalazłem β jest opisujący prognozy dla p ( Wikipedia ), ale również ~ β jest opisujący prognozy dla P ( Wolfram ). Czy jest jakaś różnica w znaczeniu? W Internecie znalazłem pewną różnicę, ale nie jestem pewien …
15 notation 

5
Czy mogę zignorować współczynniki dla nieistotnych poziomów czynników w modelu liniowym?
Po szukaniu wyjaśnienia na temat współczynników modeli liniowych tutaj mam pytanie uzupełniające dotyczące braku oznakowania (wysoka wartość p) dla współczynników poziomów czynników. Przykład: jeśli mój model liniowy zawiera współczynnik z 10 poziomami, a tylko 3 z tych poziomów mają powiązane z nimi znaczące wartości p, to przy użyciu modelu do …


3
Co to jest praktycznie dobry proces analizy danych?
Chciałbym poznać lub mieć referencje na temat procesu analizy, który większość analityków danych statystycznych przechodzi przez każdy projekt analizy danych. Jeśli utworzę „listę”, aby ukończyć projekt analizy danych, analityk musi: najpierw zbieraj wymagania dla projektu, wcześniej zaplanować / zaprojektować analizę danych w oparciu o te wymagania faktycznie wstępnie przetwarzają dane, …

3
Jak ocenić odchylenie standardowe?
Zebrałem odpowiedzi od 85 osób na temat ich zdolności do podejmowania określonych zadań. Odpowiedzi są w pięciostopniowej skali Likerta: 5 = bardzo dobrze, 4 = dobrze, 3 = średnio, 2 = źle, 1 = bardzo źle, Średnia ocena wynosi 2,8, a odchylenie standardowe wynosi 0,54. Rozumiem, co oznaczają średnie i …

4
Czy eksperci są szkodliwi?
Czytam „Rola szachów w badaniach nad sztuczną inteligencją” ( pdf ) i co ciekawe: Doświadczenie [...] sugeruje, że wkładom ekspertów szachowych, choć ogólnie przydatnymi, nie można całkowicie ufać. Dobrym przykładem tego jest funkcja oceny Głębokiej Myśli. Kilka zmian dokonanych przez zdolnych ludzi-szachistów nie przyniosło znaczących ulepszeń, a czasami nawet wpłynęło …

2
Jakiego języka używać do programowania genetycznego
W ramach zadania będę musiał napisać algorytm programowania genetycznego , który prognozuje poziomy zanieczyszczeń atmosferycznych. Ponieważ nie mam doświadczenia, czy ktoś może mi wskazać propozycje języków programowania, w których pisane będą programy ewoluujące . Wyjaśnienie: Nie pytam, w jakim języku będę pisać sam algorytm genetyczny (ponieważ będę mógł sam podjąć …

4
Klasyfikacja na podstawie danych o wysokiej zawartości tłuszczu
Muszę wyszkolić liniowy klasyfikator na moim laptopie z setkami tysięcy punktów danych i około dziesięcioma tysiącami funkcji. Jakie są moje opcje? Jaki jest obecny stan tego rodzaju problemu? Wygląda na to, że stochastyczny spadek gradientu jest obiecującym kierunkiem i mam wrażenie, że jest to stan techniki: „Pegasos: Primal Estimated sub-GrAdient …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.