Potrzebuję niewielkiej pomocy, aby iść w dobrym kierunku. Minęło dużo czasu, odkąd studiowałem statystyki i wydaje się, że żargon się zmienił. Wyobraź sobie, że mam zestaw danych związanych z samochodem, takich jak Czas podróży z miasta A do miasta B Odległość od miasta A do miasta B. Rozmiar silnika Rozmiar …
Studiuję notatki do wykładu Larry'ego Wassermana na temat statystyki, w których Casella i Berger są głównym tekstem. Pracuję nad jego notatkami z wykładu, zestawem 2 i utknąłem w wyprowadzaniu lematu stosowanego w nierówności Hoeffdinga (s. 2-3). Powtarzam dowód w uwagach poniżej, a po dowodzie wskażę, gdzie utknąłem. Lemat Załóżmy, że …
Czy istnieje biblioteka wykresów dla R, która mogłaby zamienić ramkę danych czasów rozpoczęcia i zatrzymania w wykres osi czasu podobny do następującego: Tylko oś Y oznacza, że kumuluje się ze współbieżnością, ale nie zawsze reprezentuje współbieżność (patrz przerwa pośrodku). Każde szare pole jest zdarzeniem - wierszem z ramki danych. Ramka …
Moja fryzjerka Stacey zawsze robi radosną minę, ale często stresuje ją zarządzanie czasem. Dzisiaj Stacey była spóźniona na moje spotkanie i bardzo przepraszała. Podczas strzyżenia zastanawiałem się: jak długo powinny trwać jej standardowe spotkania? (jeśli preferencje klienta dotyczące czystych okrągłych numerów można na chwilę zignorować). Należy wziąć pod uwagę pewien …
Zastanów się gdzie to iid, a CLT jest wstrzymany. Ile z największych warunków stanowi połowę łącznej kwoty? Na przykład 10 + 9 + 8 (10 + 9 + 8 + 1) / 2: 30% haseł osiąga około połowy sumy.∑Ni=1|Xi|∑i=1N|Xi|\sum_{i=1}^N |X_i|X1,…,XNX1,…,XNX_1, \ldots, X_N≈≈\approx……\dots Zdefiniuj sumbiggest( j;X1…XN)≡sum of the j biggest of …
Interesuje mnie wiedza, czy istnieje konsensus w sprawie optymalnego sposobu analizy danych dotyczących długości pobytu w szpitalu (LOS) z RCT. Jest to zwykle rozkład bardzo skośny, w którym większość pacjentów zostaje wypisana w ciągu kilku dni do tygodnia, ale reszta pacjentów ma dość nieprzewidywalne (a czasem dość długie) pobyty, które …
W aplikacji do eksploracji tekstu jednym prostym podejściem jest użycie heurystyki do tworzenia wektorów jako zwartych rzadkich reprezentacji dokumentów. Jest to dobre w przypadku ustawień wsadowych, w których cały korpus jest znany z góry, ponieważ wymaga całego korpusui d ftf−idftf−idftf-idfidfidfidf idf(t)=log|D||{d:t∈d}|idf(t)=log|D||{d:t∈d}| \mathrm{idf}(t) = \log \frac{|D|}{|\{d: t \in d\}|} gdzie jest …
Czy ktokolwiek może pokazać, w jaki sposób oczekiwana wartość i wariancja zerowego nadciśnionego Poissona, z funkcją masy prawdopodobieństwa f(y)={π+(1−π)e−λ,(1−π)λye−λy!,if y=0if y=1,2....f(y)={π+(1−π)e−λ,if y=0(1−π)λye−λy!,if y=1,2.... f(y) = \begin{cases} \pi+(1-\pi)e^{-\lambda}, & \text{if }y=0 \\ (1-\pi)\frac{\lambda^{y}e^{-\lambda}}{y!}, & \text{if }y=1,2.... \end{cases} gdzie jest prawdopodobieństwem, że obserwacja wynosi zero w procesie dwumianowym, a jest średnią Poissona?ππ\piλλ\lambda …
Zacząłem kopać trochę w funkcję plot.lm , ta funkcja daje sześć wykresów dla lm, są to: wykres reszt w stosunku do dopasowanych wartości wykres Skala-Lokalizacja sqrt (| reszty |) względem dopasowanych wartości normalny wykres QQ, wykres odległości Cooka w porównaniu do etykiet wierszy wykres reszt w stosunku do dźwigni wykres …
Biorąc pod uwagę szereg czasowy, można oszacować funkcję autokorelacji i wykreślić ją, na przykład jak pokazano poniżej: Co można zatem przeczytać o szeregach czasowych z tej funkcji autokorelacji? Czy można na przykład uzasadnić stacjonarność szeregów czasowych? Edytowane : Tutaj zawarłem ACF z różnej serii z większą liczbą opóźnień
Jestem trochę nowy w eksploracji danych i pracuję nad modelem klasyfikacyjnym do przewidywania ocen filmów. Zebrałem zestawy danych z IMDB i planuję użyć drzew decyzyjnych i podejść do najbliższego sąsiada dla mojego modelu. Chciałbym wiedzieć, które swobodnie dostępne narzędzie do eksploracji danych może zapewnić wymaganą funkcjonalność.
Po uruchomieniu regresji formularza reg <- lm(y ~ x1 + x2, data=example)w zbiorze danych mogę uzyskać przewidywane wartości za pomocą predict(reg, example, interval="prediction", level=0.95) Zastanawiam się, do czego faktycznie odnoszą się przewidywane wartości, gdy używam regresji do przewidywania rzeczywistego zestawu danych. Czy nie powinienem uzyskać oryginalnych wartości?
Wiele jest o kolinearności w odniesieniu do predyktorów ciągłych, ale nie tak bardzo, że mogę znaleźć na predyktory jakościowe. Mam dane tego typu zilustrowane poniżej. Pierwszy czynnik to zmienna genetyczna (liczba alleli), drugi czynnik to kategoria choroby. Najwyraźniej geny poprzedzają chorobę i są czynnikiem pokazującym objawy, które prowadzą do diagnozy. …
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Jak wykreślić wykres waflowy jako alternatywę dla używania piecharts w R? help.search("waffle") No help files found with alias or concept or title matching ‘waffle’ using …
Tło: Jestem obecnie biostatystą zmagającym się z zestawem danych dotyczących ekspresji komórkowej. W badaniu narażono wiele peptydów na wiele komórek zebranych w grupach od różnych dawców. Komórki albo wyrażają określone biomarkery w odpowiedzi, albo nie. Wskaźniki odpowiedzi są następnie rejestrowane dla każdej grupy dawcy. Wskaźniki odpowiedzi (wyrażone w procentach) są …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.