Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Wizualizacja danych wielowymiarowych (LSI) w 2D
Korzystam z ukrytego indeksowania semantycznego, aby znaleźć podobieństwa między dokumentami ( dzięki, JMS! ) Po zmniejszeniu wymiaru próbowałem k-średnich grupowania dokumentów w klastry, co działa bardzo dobrze. Chciałbym jednak pójść nieco dalej i wizualizować dokumenty jako zestaw węzłów, w których odległość między dowolnymi dwoma węzłami jest odwrotnie proporcjonalna do ich …

1
Błąd podczas zgłaszania z medianą i reprezentacjami graficznymi?
Użyłem szerokiej gamy testów dla danych mojej pracy magisterskiej, od parametrycznych ANOVA i testów t do nieparametrycznych testów Kruskala-Wallisa i Manna-Whitneysa, a także transformowanych rangą 2-drogowych ANOVA i GzLM z danymi binarnymi, dane Poissona i proporcjonalne. Teraz muszę wszystko zgłosić, pisząc to wszystko w moich wynikach. Zapytałem już tutaj, jak …

2
Jaka jest moc testu F regresji?
Klasyczny test F dla podzbiorów zmiennych w regresji wieloliniowej ma postać gdzieSSE(R)to suma błędów kwadratu w modelu „zredukowanym”, który zagnieżdżony jest w „dużym” modeluB, adfto stopnie swobody obu modeli. Zgodnie z hipotezą zerową, że dodatkowe zmienne w „dużym” modelu nie mają liniowej mocy wyjaśniającej, statystyka jest podzielona jako F ostopniach …

1
Modyfikacja symulacji liniowego akumulatora balistycznego (LBA) w R.
Model „Linear Ballistic Accumulator” (LBA) jest raczej skutecznym modelem ludzkiego zachowania w przyspieszonych prostych decyzjach. Donkin et al (2009, PDF ) zapewniają, że pozwolenia kod szacowania parametrów modelu danego człowieka dane behawioralne, a ja skopiowane ten kod (z pewnymi zmianami formatowania drobnych) na GIST tutaj . Chciałbym jednak wprowadzić pozornie …

2
Znaczenie początkowych probabilitów przejścia w ukrytym modelu Markowa
Jakie są zalety podania pewnych wartości początkowych prawdopodobieństwom przejścia w Ukrytym Modelu Markowa? W końcu system się ich nauczy, więc po co podawać wartości inne niż losowe? Czy algorytm bazowy robi różnicę, taką jak Baum – Welch? Jeśli bardzo dokładnie znam prawdopodobieństwa przejścia na początku, a moim głównym celem jest …

1
Zmniejszenie liczby poziomów nieuporządkowanej jakościowej zmiennej predykcyjnej
Chcę wytrenować klasyfikator, powiedzmy SVM, losowy las lub inny klasyfikator. Jedną z cech zestawu danych jest zmienna kategoryczna z 1000 poziomami. Jaki jest najlepszy sposób na zmniejszenie liczby poziomów w tej zmiennej. W R jest funkcja wywoływana combine.levels()w pakiecie Hmisc , która łączy rzadkie poziomy, ale szukałem innych sugestii.


1
Co to jest ten „maksymalny współczynnik korelacji”?
Typową statystyką przetwarzania obrazu jest użycie funkcji tekstur Haralicka , które wynoszą 14. Zastanawiam się nad czternastą z tych cech: Biorąc pod uwagę mapę sąsiedztwa (którą możemy po prostu zobaczyć empiryczny rozkład dwóch liczb całkowitych i , j < 256 ), jest ona zdefiniowana jako: pierwiastek kwadratowy z drugiej wartości …


2
Czy istnieje sposób na wyjaśnienie prognozy z losowego modelu lasu?
Powiedzmy, że mam predykcyjny model klasyfikacji oparty na losowym lesie (używając pakietu randomForest w R). Chciałbym to skonfigurować, aby użytkownicy końcowi mogli określić element, dla którego ma zostać wygenerowana prognoza, i wyświetli prawdopodobieństwo klasyfikacji. Jak dotąd nie ma problemu. Byłoby jednak użyteczne / fajne, aby móc wygenerować coś w rodzaju …

4
Jak wygenerować macierz losowej korelacji, która ma w przybliżeniu normalnie rozmieszczone wpisy o przekątnej przy danym odchyleniu standardowym?
Chciałbym wygenerować losową macierz korelacji, tak aby rozkład jej elementów nie przekątnych wyglądał w przybliżeniu normalnie. Jak mogę to zrobić? Motywacja jest taka. Dla zestawu danych szeregów czasowych rozkład korelacji często wygląda dość normalnie. Chciałbym wygenerować wiele „normalnych” macierzy korelacji w celu przedstawienia ogólnej sytuacji i użyć ich do obliczenia …

3
Pomiar zależności nieliniowej
Kowariancja między dwiema zmiennymi losowymi określa miarę, jak blisko są one liniowo ze sobą powiązane. Ale co, jeśli rozkład stawów jest okrągły? Na pewno jest struktura w dystrybucji. Jak wyodrębnia się tę strukturę?

2
Jak narysować wykres interakcji z przedziałami ufności?
Moje próby: Nie mogłem uzyskać przedziałów ufności interaction.plot() z drugiej strony plotmeans()z pakietu „gplot” nie wyświetlałby dwóch wykresów. Co więcej, nie mogłem nałożyć dwóch plotmeans()wykresów jeden na drugim, ponieważ domyślnie oś jest inna. Miałem pewne sukcesy, używając plotCI()pakietu gplot i nakładając dwa wykresy, ale dopasowanie osi nie było idealne. Wszelkie …

4
Co to znaczy, że badanie jest nadmiernie zasilane?
Co to znaczy, że badanie jest nadmiernie zasilane? Mam wrażenie, że oznacza to, że twoje rozmiary próbek są tak duże, że masz moc wykrycia niewielkich rozmiarów efektów. Te wielkości efektów są być może tak małe, że częściej wynikają z niewielkich tendencyjności w procesie próbkowania niż (niekoniecznie bezpośredniego) związku przyczynowego między …

2
Jak wybrać liczbę komponentów do analizy niezależnych komponentów?
Wobec braku dobrych wstępnych domysłów na temat liczby komponentów, które należy zamówić w niezależnej analizie komponentów, chcę zautomatyzować proces selekcji. Myślę, że rozsądnym kryterium może być liczba, która minimalizuje globalne dowody korelacji między obliczonymi składnikami. Oto pseudokod tego podejścia: for each candidate number of components, n: run ICA specifying n …
11 ica 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.