Mam zestaw danych, który reprezentuje 1000 dokumentów i wszystkie słowa, które się w nim pojawiają. Tak więc wiersze reprezentują dokumenty, a kolumny - słowa. Na przykład wartość w komórce oznacza czas, w którym słowo występuje w dokumencie . Teraz muszę znaleźć „wagi” słów, używając metody tf / idf, ale tak …
Czy ktoś może zasugerować, gdzie uzyskać wyniki 10 000 rzutów monetą (tj. Wszystkich 10 000 głów i reszek) wykonanych przez Johna Kerricha podczas II wojny światowej?
Codziennie zbieram bardzo duże próbki (> 1 000 000) danych kategorycznych i chcę, aby dane wyglądały „znacząco” różnie między poszczególnymi dniami w celu wykrycia błędów w gromadzeniu danych. Myślałem, że użycie testu dobrego dopasowania (w szczególności testu G) byłoby dobrym dopasowaniem (gra słów). Oczekiwany rozkład wynika z rozkładu z poprzedniego …
Skorelowałem dane i używam modelu mieszanych efektów regresji logistycznej do oszacowania indywidualnego (warunkowego) efektu dla predyktora zainteresowania. Wiem, że w przypadku standardowych modeli brzeżnych wnioskowanie na temat parametrów modelu za pomocą testu Walda jest spójne dla współczynników prawdopodobieństwa i testów punktowych. Zazwyczaj są one w przybliżeniu takie same. Ponieważ Wald …
Jeśli mamy długi szereg czasowy o wysokiej rozdzielczości, z dużym hałasem, często sensowne jest agregowanie danych do niższej rozdzielczości (np. Wartości dzienne do miesięcznych), aby lepiej zrozumieć, co się dzieje, skutecznie usuwając niektóre z hałas. Widziałem co najmniej jeden artykuł, który stosuje pewne statystyki do danych zagregowanych, w tym dla …
Podczas korzystania z naturalnych (tj. Ograniczonych) splajnów sześciennych, tworzone funkcje podstawowe są wysoce współliniowe, a po zastosowaniu w regresji wydają się generować bardzo wysokie statystyki VIF (współczynnik inflacji wariancji), sygnalizując wielokoliniowość. Czy rozważając przypadek modelu do celów prognozowania, jest to problem? Wydaje się, że zawsze tak będzie ze względu na …
Testuję czujniki położenia przepustnicy (TPS), które sprzedaje moja firma i drukuję wykres odpowiedzi napięcia na obrót wału przepustnicy. TPS jest czujnikiem obrotowym o zakresie 90 °, a wyjście jest jak potencjometr z pełnym otwarciem wynoszącym 5 V (lub wartością wejściową czujnika) i początkowym otwarciem o wartości między 0 a 0,5 …
Niech oznacza ryzyko Bayesa estymatora w odniesieniu do wcześniejszego , niech oznacza zbiór wszystkich priorów w przestrzeni parametrów , a niech oznacza zbiór wszystkie (ewentualnie losowe) reguły decyzyjne.δ π Π Θ Δr(π,δ)r(π,δ)r(\pi, \delta)δδ\deltaππ\piΠΠ\PiΘΘ\ThetaΔΔ\Delta Stwierdza to statystyczna interpretacja nierówności minimax Johna von Neumanna supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ),supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ), \sup_{\pi\in\Pi} \inf_{\delta\in\Delta} r(\pi, \delta) \leq \inf_{\delta\in\Delta}\sup_{\pi\in\Pi} r(\pi, …
Mówiąc dokładniej, dlaczego testy współczynnika prawdopodobieństwa mają asymptotycznie jeśli modele są zagnieżdżone, ale nie jest tak już w przypadku modeli nie zagnieżdżonych? Rozumiem, że wynika to z twierdzenia Wilksa, ale niestety nie rozumiem tego dowodu .χ2)χ2\chi^2
Zastanawia mnie następujące zdanie: „Aby zwiększyć standardowe odchylenie zestawu liczb, należy dodać wartość, która jest więcej niż jedno odchylenie standardowe od średniej” Co jest tego dowodem ? Wiem oczywiście, jak definiujemy odchylenie standardowe, ale tę część wydaje mi się jakoś tęsknić. Jakieś komentarze?
Miałem wrażenie, że funkcja lmer()w lme4pakiecie nie generowała wartości p (patrz lmerwartości p i tak dalej ). Używam MCMC wygenerowane wartości p zamiast, jak na to pytanie: znaczący wpływ w lme4modelu mieszanym i to pytanie: nie można odnaleźć wartości p w wyjściu ze lmer()w lm4opakowaniu wR . Ostatnio wypróbowałem pakiet …
Jeśli zakłada się, że testy nieparametryczne mają mniejszą moc niż ich alternatywy parametryczne, czy to oznacza, że jeśli jakikolwiek test parametryczny nie odrzuca wartości zerowej, to jego nieparametryczna alternatywa również nie odrzuca wartości zerowej? Jak to zmienić, jeśli założenia testu parametrycznego nie zostaną spełnione, a test i tak zostanie zastosowany?
Mam trochę kodu i danych wyjściowych i chciałbym zbudować model. Nie wiem, jak zbudować model przy użyciu tego wyjścia: require("splines") x <- c(0.2, 0.23, 0.26, 0.29, 0.33, 0.46, 0.53 ) y <- c(0.211, 0.2026, 0.2034, 0.2167, 0.2177, 0.19225, 0.182) fit <- lm(y ~ ns(x,3)) summary(fit) Zauważ, że ns()generuje macierz bazową …
Opis: Niech domeną problemową będzie klasyfikacja dokumentów tam, gdzie istnieje zestaw wektorów cech, z których każdy należy do jednej lub więcej klas. Na przykład dokument doc_1może należeć do kategorii Sportsi English. Pytanie: Używając sieci neuronowej do klasyfikacji, jaka byłaby etykieta dla wektora cech? czy byłby to wektor składający się ze …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.