Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


4
Poprawa klasyfikacji cukrzycy SVM
Używam SVM do przewidywania cukrzycy. Używam do tego zestawu danych BRFSS . Zestaw danych ma wymiary i jest przekrzywiony. Procent s w zmiennej docelowej wynosi 11 %, podczas gdy s stanowią pozostałe 89 % .432607 × 136432607×136432607 \times 136Y11 %11%11\%N89 %89%89\% Korzystam tylko 15z 136niezależnych zmiennych z zestawu danych. Jednym …

6
Porównaj R-kwadrat z dwóch różnych modeli Lasu Losowego
Używam pakietu randomForest w R do opracowania losowego modelu lasu w celu wyjaśnienia ciągłego wyniku w „szerokim” zestawie danych z większą liczbą predyktorów niż próbek. W szczególności dopasowuję jeden model RF, umożliwiając procedurze wybranie zestawu ~ 75 zmiennych predykcyjnych, które moim zdaniem są ważne. Testuję, jak dobrze ten model przewiduje …


3
Łączenie dwóch szeregów czasowych przez uśrednienie punktów danych
Chciałbym połączyć prognozę i prognozę wsteczną (mianowicie prognozowane wartości przeszłe) zestawu danych szeregów czasowych w jeden szereg czasowy, minimalizując średni błąd przewidywania kwadratu. Powiedzmy, że mam szeregi czasowe z lat 2001–2010 z luką dla roku 2007. Byłem w stanie prognozować 2007 na podstawie danych z lat 2001–2007 (czerwona linia - …

3
Próg współczynnika korelacji wskazujący istotność statystyczną korelacji w macierzy korelacji
Obliczyłem macierz korelacji zbioru danych, który zawiera 455 punktów danych, każdy punkt danych zawiera 14 charakterystyk. Zatem wymiar macierzy korelacji wynosi 14 x 14. Zastanawiałem się, czy istnieje próg wartości współczynnika korelacji, który wskazuje, że istnieje znacząca korelacja między dwiema tymi cechami. Mam wartość w zakresie od -0,2 do 0,85 …

1
Czy istnieje koncepcja „wystarczającej” ilości danych do szkolenia modeli statystycznych?
Pracuję nad dość wieloma modelami statystycznymi, takimi jak Ukryte Modele Markowa i Modele Mieszanki Gaussa. Widzę, że szkolenie dobrych modeli w każdym z tych przypadków wymaga dużej (> 20000 zdań dla HMM) ilości danych, które są pobierane z podobnych środowisk, jak ostateczne użycie. Moje pytanie brzmi: Czy w literaturze istnieje …

2
Czy istnieje statystyka dopasowania modelu (jak AIC lub BIC), która może być używana do bezwzględnych, a nie tylko względnych porównań?
Nie znam się tak dobrze na tej literaturze, więc proszę wybacz mi, jeśli jest to oczywiste pytanie. Ponieważ AIC i BIC zależą od maksymalizacji prawdopodobieństwa, wydaje się, że można ich używać jedynie do względnych porównań między zestawem modeli próbujących dopasować dany zestaw danych. Według mojego zrozumienia nie ma sensu obliczanie …

5
Wizualizacja kombinacji 2 liter
Odpowiedzi na to pytanie dotyczące SO zwróciły zestaw około 125 jedno- lub dwuliterowych nazw: /programming/6979630/what-1-2-letter-object-names-conflict-with-existing -r-objects [1] "Ad" "am" "ar" "as" "bc" "bd" "bp" "br" "BR" "bs" "by" "c" "C" [14] "cc" "cd" "ch" "ci" "CJ" "ck" "Cl" "cm" "cn" "cq" "cs" "Cs" "cv" [27] "d" "D" "dc" "dd" "de" …

1
Jak zamienić funkcję w gęstość prawdopodobieństwa przy jednoczesnym zachowaniu kształtu funkcji?
Mam szereg funkcji, z których każda rzekomo reprezentuje gęstość zmiennej losowej między agentami. Każda funkcja ma również domenę, która opisuje, jakie wartości zmiennej losowej są prawidłowe. Teraz, jeśli dobrze pamiętam klasy statystyk, jeśli wezmę całkę jednej z funkcji w wartościach opisanych przez dziedzinę funkcji, powinienem otrzymać wartość 1,0. Tak się …

2
Warunki zbieżności estymatora M z prawdziwą średnią
Biorąc pod uwagę próbki IID z rozkładem Gaussa i estymator M, μ m = argmin a ∑ ρ ( | X i - a | ) , jakie właściwości na ρ są wystarczające do zagwarantowania prawdopodobieństwa μ m → μ ? Czy ρ jest ściśle wypukłe i ściśle rośnie?X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim …
10 estimation 

4
Dlaczego demografowie podają stawki za 100 000 osób?
Wydaje się uniwersalne, że statystyki demograficzne są podawane w przeliczeniu na 100 000 ludności rocznie. Na przykład wskaźnik samobójstw, wskaźnik zabójstw, rok życia skorygowany o niepełnosprawność, lista jest długa. Dlaczego? Gdybyśmy mówili o chemii, części na milion (ppm) są powszechne. Dlaczego liczenie ludzi jest postrzegane zasadniczo inaczej. Liczba 100 000 …
10 demography  units 

1
Czy w modelach mieszanych można uwzględnić czas jako predyktor?
Zawsze uważałem, że czas nie powinien być wykorzystywany jako predyktor w regresjach (w tym gam), ponieważ wtedy po prostu „opisałby” sam trend. Jeśli celem badań jest znalezienie parametrów środowiskowych, takich jak temperatura itp., Które wyjaśniają wariancję, powiedzmy, aktywności zwierzęcia, to zastanawiam się, w jaki sposób można wykorzystać czas? jako proxy …

4
Wykrywanie wartości odstających online
Chcę przetwarzać automatycznie segmentowane obrazy mikroskopowe w celu wykrycia wadliwych obrazów i / lub wadliwych segmentacji w ramach wysokowydajnego potoku obrazowania. Istnieje wiele parametrów, które można obliczyć dla każdego surowego obrazu i segmentacji, i które stają się „ekstremalne”, gdy obraz jest wadliwy. Na przykład bąbelek na obrazie spowoduje anomalie, takie …
10 outliers  online 

2
Porównanie zbiorów szeregów czasowych
Mam trzy zestawy danych szeregów czasowych, które chcę porównać. Zostały one pobrane na 3 osobne okresy około 12 dni. Są to średnie, maksymalne i minimalne liczby głów zebrane w bibliotece uniwersyteckiej podczas tygodni finałowych. Musiałem podać średnie, maksymalne i minimalne, ponieważ godzinowe zliczanie głowic nie było ciągłe (patrz Regularne luki …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.