Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak korzystać z prostego wygładzania wykładniczego w języku R?
Jestem początkującym w R. Czy możesz wyjaśnić, jak używać ses w pakiecie prognozy R prognozy ? Chciałbym wybrać liczbę początkowych okresów i stałą wygładzania. d <- c(3,4,41,10,9,86,56,20,18,36,24,59,82,51,31,29,13,7,26,19,20,103,141,145,24,99,40,51,72,58,94,78,11,15,17,53,44,34,12,15,32,14,15,26,75,110,56,43,19,17,33,26,40,42,18,24,69,18,18,25,86,106,104,35,43,12,4,20,16,8) Mam 70 okresów, chciałbym użyć 40 okresów dla początkowego i 30 dla poza próbką. ses(d, h=30, level=c(80,95), fan=FALSE,initial=c("simple"), alpha=.1) Czy to jest poprawne?



1
Dyskretne dane i alternatywy dla PCA
Posiadam zestaw danych dyskretnych (porządkowych, meristycznych i nominalnych) zmiennych opisujących morfologiczne charaktery skrzydeł na kilku blisko spokrewnionych gatunkach owadów. Chcę przeprowadzić jakąś analizę, która dałaby mi wizualną reprezentację podobieństwa różnych gatunków w oparciu o cechy morfologiczne. Pierwszą rzeczą, która wpadła mi do głowy, była PCA (jest to rodzaj wizualizacji, którą …

2
Wspólne filtrowanie poprzez faktoryzację macierzy z funkcją straty logistycznej
Rozważ problem z filtrowaniem grupowym. Mamy macierz rozmiaru #users * #items. jeśli użytkownik lubi przedmiot j, jeśli użytkownik nie lubi przedmiot j, ajeśli nie ma danych o parze (i, j). Chcemy przewidzieć dla przyszłego użytkownika, pary elementów.MMMMi,j=1Mi,j=1M_{i,j} = 1Mi,j=0Mi,j=0M_{i,j} = 0Mi,j=?Mi,j=?M_{i,j}=?Mi,jMi,jM_{i,j} Standardowym podejściem do wspólnego filtrowania jest reprezentowanie M jako …


2
Uczenie się na podstawie danych relacyjnych
Ustawienia Wiele algorytmów działa na jednej relacji lub tabeli, podczas gdy wiele rzeczywistych baz danych przechowuje informacje w wielu tabelach (Domingos, 2003). Pytanie Jakie typy algorytmów uczą się dobrze z wielu (relacyjnych) tabel. W szczególności interesują mnie algorytmy, które mają zastosowanie do zadań regresji i klasyfikacji (nie te zorientowane na …

3
Przerzucanie znaków podczas dodawania jeszcze jednej zmiennej w regresji i o znacznie większej wielkości
Podstawowe ustawienia: Model regresji: y=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon gdzie C jest wektorem zmiennych kontrolnych. Interesuję się ββ\beta i oczekuj β1β1\beta_1 i β2)β2\beta_2być negatywnym. W modelu występuje jednak problem wielokoliniowości, współczynnik korelacji podaje: corr (x1x1x_1,x2)) =x2)=x_2)= 0,9345, corr (x1x1x_1,x3)) =x3)=x_3)= 0,1765, corr (x2)x2x_2,x3)) =x3)=x_3)= 0,3019. Więc x1x1x_1 i x2)x2x_2są wysoce …

4
Box Cox Transforms do regresji
Próbuję dopasować model liniowy do niektórych danych za pomocą tylko jednego predyktora (powiedzmy (x, y)). Dane są takie, że dla małych wartości x wartości y ściśle dopasowują się do linii prostej, jednak wraz ze wzrostem wartości x wartości y stają się bardziej zmienne. Oto przykład takich danych (kod R) y …

1
Jak powinienem znormalizować dane z czujnika przyspieszenia?
Pracuję z dużym zestawem danych akcelerometru zebranych z wieloma czujnikami noszonymi przez wielu badanych. Niestety, wydaje się, że nikt tutaj nie zna specyfikacji technicznych urządzeń i nie sądzę, aby kiedykolwiek zostały one ponownie skalibrowane. Nie mam wielu informacji o urządzeniach. Pracuję nad pracą magisterską, akcelerometry zostały zapożyczone z innej uczelni …

1
Parellel między LSA i pLSA
W oryginalnej pracy pLSA autor, Thomas Hoffman, rysuje paralelę między strukturami danych pLSA i LSA, o których chciałbym z tobą porozmawiać. Tło: Czerpiąc inspirację z wyszukiwania informacji, załóżmy, że mamy kolekcję NNN dokumenty D={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbrace i słownictwo MMM warunki Ω={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega = \lbrace \omega_1, \omega_2, …

2
Czy uzasadnione są założenia dotyczące zależności Benjaminiego-Hochberga?
Mam zestaw danych, w którym testuję pod kątem znaczących różnic między trzema populacjami w odniesieniu do około 50 różnych zmiennych. Robię to z jednej strony za pomocą testów Kruskala-Wallisa, az drugiej za pomocą testów współczynnika prawdopodobieństwa zagnieżdżonych modeli GLM (z populacją i bez jako niezależna zmienna). W rezultacie, mam listę …

5
Czy klastrowanie wstępne pomaga zbudować lepszy model predykcyjny?
Do zadania modelowania rezygnacji rozważałem: Oblicz k klastrów dla danych Zbuduj k modeli dla każdego klastra osobno. Uzasadnieniem tego jest to, że nie ma nic do udowodnienia, że ​​populacja subskrybentów jest jednorodna, więc uzasadnione jest założenie, że proces generowania danych może być różny dla różnych „grup” Moje pytanie brzmi, czy …

4
Jak wykreślić 20 lat dziennych danych w szeregach czasowych
Mam następujący zestaw danych: https://dl.dropbox.com/u/22681355/ORACLE.csv i chciałbym zaplanować codzienne zmiany w „Otwarciu” według „Daty”, więc wykonałem następujące czynności: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") i otrzymuję następujące: Teraz nie jest to oczywiście najładniejszy wykres, więc zastanawiam się, jaka jest właściwa metoda, aby użyć takich szczegółowych danych?

2
Zmienne skośne w PCA lub analizie czynnikowej
Chcę przeprowadzić analizę głównych składników (analizę czynnikową) w SPSS w oparciu o 22 zmienne. Jednak niektóre z moich zmiennych są bardzo wypaczone (skośność obliczona na podstawie zakresów SPSS od 2–80!). Oto moje pytania: Czy powinienem zachować zmienne skośne, czy mogę transformować zmienne podczas analizy głównych składników? Jeśli tak, jak interpretowałbym …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.