Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



1
Rysowanie zdarzeń na osi czasu w R.
Czy istnieje biblioteka wykresów dla R, która mogłaby zamienić ramkę danych czasów rozpoczęcia i zatrzymania w wykres osi czasu podobny do następującego: Tylko oś Y oznacza, że ​​kumuluje się ze współbieżnością, ale nie zawsze reprezentuje współbieżność (patrz przerwa pośrodku). Każde szare pole jest zdarzeniem - wierszem z ramki danych. Ramka …

1
Zagadka fryzjera
Moja fryzjerka Stacey zawsze robi radosną minę, ale często stresuje ją zarządzanie czasem. Dzisiaj Stacey była spóźniona na moje spotkanie i bardzo przepraszała. Podczas strzyżenia zastanawiałem się: jak długo powinny trwać jej standardowe spotkania? (jeśli preferencje klienta dotyczące czystych okrągłych numerów można na chwilę zignorować). Należy wziąć pod uwagę pewien …

3
Ile z największych terminów wdodać do połowy całości?
Zastanów się gdzie to iid, a CLT jest wstrzymany. Ile z największych warunków stanowi połowę łącznej kwoty? Na przykład 10 + 9 + 8 (10 + 9 + 8 + 1) / 2: 30% haseł osiąga około połowy sumy.∑Ni=1|Xi|∑i=1N|Xi|\sum_{i=1}^N |X_i|X1,…,XNX1,…,XNX_1, \ldots, X_N≈≈\approx……\dots Zdefiniuj sumbiggest( j;X1…XN)≡sum of the j biggest of …


1
Przyrostowy IDF (odwrotna częstotliwość dokumentów)
W aplikacji do eksploracji tekstu jednym prostym podejściem jest użycie heurystyki do tworzenia wektorów jako zwartych rzadkich reprezentacji dokumentów. Jest to dobre w przypadku ustawień wsadowych, w których cały korpus jest znany z góry, ponieważ wymaga całego korpusui d ftf−idftf−idftf-idfidfidfidf idf(t)=log|D||{d:t∈d}|idf(t)=log⁡|D||{d:t∈d}| \mathrm{idf}(t) = \log \frac{|D|}{|\{d: t \in d\}|} gdzie jest …

1
Średnia i wariancja zerowo napompowanego rozkładu Poissona
Czy ktokolwiek może pokazać, w jaki sposób oczekiwana wartość i wariancja zerowego nadciśnionego Poissona, z funkcją masy prawdopodobieństwa f(y)={π+(1−π)e−λ,(1−π)λye−λy!,if y=0if y=1,2....f(y)={π+(1−π)e−λ,if y=0(1−π)λye−λy!,if y=1,2.... f(y) = \begin{cases} \pi+(1-\pi)e^{-\lambda}, & \text{if }y=0 \\ (1-\pi)\frac{\lambda^{y}e^{-\lambda}}{y!}, & \text{if }y=1,2.... \end{cases} gdzie jest prawdopodobieństwem, że obserwacja wynosi zero w procesie dwumianowym, a jest średnią Poissona?ππ\piλλ\lambda …


1
Co czytać z funkcji autokorelacji szeregu czasowego?
Biorąc pod uwagę szereg czasowy, można oszacować funkcję autokorelacji i wykreślić ją, na przykład jak pokazano poniżej: Co można zatem przeczytać o szeregach czasowych z tej funkcji autokorelacji? Czy można na przykład uzasadnić stacjonarność szeregów czasowych? Edytowane : Tutaj zawarłem ACF z różnej serii z większą liczbą opóźnień

3
Model klasyfikacyjny do przewidywania ocen filmów
Jestem trochę nowy w eksploracji danych i pracuję nad modelem klasyfikacyjnym do przewidywania ocen filmów. Zebrałem zestawy danych z IMDB i planuję użyć drzew decyzyjnych i podejść do najbliższego sąsiada dla mojego modelu. Chciałbym wiedzieć, które swobodnie dostępne narzędzie do eksploracji danych może zapewnić wymaganą funkcjonalność.

1
Jakie są przewidywane wartości zwracane przez funkcję predykcji () w R, gdy używasz oryginalnych danych jako danych wejściowych?
Po uruchomieniu regresji formularza reg <- lm(y ~ x1 + x2, data=example)w zbiorze danych mogę uzyskać przewidywane wartości za pomocą predict(reg, example, interval="prediction", level=0.95) Zastanawiam się, do czego faktycznie odnoszą się przewidywane wartości, gdy używam regresji do przewidywania rzeczywistego zestawu danych. Czy nie powinienem uzyskać oryginalnych wartości?
11 r  regression 

2
Kolinearność między zmiennymi kategorialnymi
Wiele jest o kolinearności w odniesieniu do predyktorów ciągłych, ale nie tak bardzo, że mogę znaleźć na predyktory jakościowe. Mam dane tego typu zilustrowane poniżej. Pierwszy czynnik to zmienna genetyczna (liczba alleli), drugi czynnik to kategoria choroby. Najwyraźniej geny poprzedzają chorobę i są czynnikiem pokazującym objawy, które prowadzą do diagnozy. …

3
Jak zrobić wykresy waflowe w R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Jak wykreślić wykres waflowy jako alternatywę dla używania piecharts w R? help.search("waffle") No help files found with alias or concept or title matching ‘waffle’ using …

2
Właściwe stosowanie i interpretacja modeli nadmuchanych zerowo
Tło: Jestem obecnie biostatystą zmagającym się z zestawem danych dotyczących ekspresji komórkowej. W badaniu narażono wiele peptydów na wiele komórek zebranych w grupach od różnych dawców. Komórki albo wyrażają określone biomarkery w odpowiedzi, albo nie. Wskaźniki odpowiedzi są następnie rejestrowane dla każdej grupy dawcy. Wskaźniki odpowiedzi (wyrażone w procentach) są …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.