Korzystam z ukrytego indeksowania semantycznego, aby znaleźć podobieństwa między dokumentami ( dzięki, JMS! ) Po zmniejszeniu wymiaru próbowałem k-średnich grupowania dokumentów w klastry, co działa bardzo dobrze. Chciałbym jednak pójść nieco dalej i wizualizować dokumenty jako zestaw węzłów, w których odległość między dowolnymi dwoma węzłami jest odwrotnie proporcjonalna do ich …
Użyłem szerokiej gamy testów dla danych mojej pracy magisterskiej, od parametrycznych ANOVA i testów t do nieparametrycznych testów Kruskala-Wallisa i Manna-Whitneysa, a także transformowanych rangą 2-drogowych ANOVA i GzLM z danymi binarnymi, dane Poissona i proporcjonalne. Teraz muszę wszystko zgłosić, pisząc to wszystko w moich wynikach. Zapytałem już tutaj, jak …
Klasyczny test F dla podzbiorów zmiennych w regresji wieloliniowej ma postać gdzieSSE(R)to suma błędów kwadratu w modelu „zredukowanym”, który zagnieżdżony jest w „dużym” modeluB, adfto stopnie swobody obu modeli. Zgodnie z hipotezą zerową, że dodatkowe zmienne w „dużym” modelu nie mają liniowej mocy wyjaśniającej, statystyka jest podzielona jako F ostopniach …
Model „Linear Ballistic Accumulator” (LBA) jest raczej skutecznym modelem ludzkiego zachowania w przyspieszonych prostych decyzjach. Donkin et al (2009, PDF ) zapewniają, że pozwolenia kod szacowania parametrów modelu danego człowieka dane behawioralne, a ja skopiowane ten kod (z pewnymi zmianami formatowania drobnych) na GIST tutaj . Chciałbym jednak wprowadzić pozornie …
Jakie są zalety podania pewnych wartości początkowych prawdopodobieństwom przejścia w Ukrytym Modelu Markowa? W końcu system się ich nauczy, więc po co podawać wartości inne niż losowe? Czy algorytm bazowy robi różnicę, taką jak Baum – Welch? Jeśli bardzo dokładnie znam prawdopodobieństwa przejścia na początku, a moim głównym celem jest …
Chcę wytrenować klasyfikator, powiedzmy SVM, losowy las lub inny klasyfikator. Jedną z cech zestawu danych jest zmienna kategoryczna z 1000 poziomami. Jaki jest najlepszy sposób na zmniejszenie liczby poziomów w tej zmiennej. W R jest funkcja wywoływana combine.levels()w pakiecie Hmisc , która łączy rzadkie poziomy, ale szukałem innych sugestii.
Mam całkowitą liczbę połączeń otrzymywanych co tydzień i narysowałem je na wykresie, cofając się o prawie 3 lata. Na pierwszy rzut oka wydaje się, że w okresie Bożego Narodzenia nastąpił ogromny spadek, który wydaje się, że nie wyzdrowiał, wydaje się, że nastąpiła skokowa zmiana w żądaniach. Czy mogę wykonać test, …
Typową statystyką przetwarzania obrazu jest użycie funkcji tekstur Haralicka , które wynoszą 14. Zastanawiam się nad czternastą z tych cech: Biorąc pod uwagę mapę sąsiedztwa (którą możemy po prostu zobaczyć empiryczny rozkład dwóch liczb całkowitych i , j < 256 ), jest ona zdefiniowana jako: pierwiastek kwadratowy z drugiej wartości …
Zamknięte . To pytanie jest oparte na opiniach . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby można było na nie odpowiedzieć faktami i cytatami, edytując ten post . Zamknięte 7 miesięcy temu . tło O StatProb.com czytam z komentarza na blogu Andrew Gelmana . Według strony …
Powiedzmy, że mam predykcyjny model klasyfikacji oparty na losowym lesie (używając pakietu randomForest w R). Chciałbym to skonfigurować, aby użytkownicy końcowi mogli określić element, dla którego ma zostać wygenerowana prognoza, i wyświetli prawdopodobieństwo klasyfikacji. Jak dotąd nie ma problemu. Byłoby jednak użyteczne / fajne, aby móc wygenerować coś w rodzaju …
Chciałbym wygenerować losową macierz korelacji, tak aby rozkład jej elementów nie przekątnych wyglądał w przybliżeniu normalnie. Jak mogę to zrobić? Motywacja jest taka. Dla zestawu danych szeregów czasowych rozkład korelacji często wygląda dość normalnie. Chciałbym wygenerować wiele „normalnych” macierzy korelacji w celu przedstawienia ogólnej sytuacji i użyć ich do obliczenia …
Kowariancja między dwiema zmiennymi losowymi określa miarę, jak blisko są one liniowo ze sobą powiązane. Ale co, jeśli rozkład stawów jest okrągły? Na pewno jest struktura w dystrybucji. Jak wyodrębnia się tę strukturę?
Moje próby: Nie mogłem uzyskać przedziałów ufności interaction.plot() z drugiej strony plotmeans()z pakietu „gplot” nie wyświetlałby dwóch wykresów. Co więcej, nie mogłem nałożyć dwóch plotmeans()wykresów jeden na drugim, ponieważ domyślnie oś jest inna. Miałem pewne sukcesy, używając plotCI()pakietu gplot i nakładając dwa wykresy, ale dopasowanie osi nie było idealne. Wszelkie …
Co to znaczy, że badanie jest nadmiernie zasilane? Mam wrażenie, że oznacza to, że twoje rozmiary próbek są tak duże, że masz moc wykrycia niewielkich rozmiarów efektów. Te wielkości efektów są być może tak małe, że częściej wynikają z niewielkich tendencyjności w procesie próbkowania niż (niekoniecznie bezpośredniego) związku przyczynowego między …
Wobec braku dobrych wstępnych domysłów na temat liczby komponentów, które należy zamówić w niezależnej analizie komponentów, chcę zautomatyzować proces selekcji. Myślę, że rozsądnym kryterium może być liczba, która minimalizuje globalne dowody korelacji między obliczonymi składnikami. Oto pseudokod tego podejścia: for each candidate number of components, n: run ICA specifying n …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.