Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Jak znaleźć grupy (trajektorie) wśród danych podłużnych?
Kontekst Chcę ustawić scenę, zanim nieco rozwinę pytanie. Mam dane podłużne, pomiary wykonywane na osobach co około 3 miesiące, pierwotny wynik jest liczbowy (jak ciągły do ​​1dp) w zakresie od 5 do 14, a większość (wszystkich punktów danych) wynosi od 7 do 10. Jeśli zrobię wykres spaghetti (z wiekiem na …


1
Jak narysować wykres piargowy w pythonie? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte w zeszłym roku . Używam pojedynczego rozkładu wektora na macierzy i otrzymuję macierze U, S i Vt. W tym momencie próbuję wybrać próg liczby wymiarów …

1
Określenie optymalnej dyskretyzacji danych z ciągłej dystrybucji
Załóżmy, że masz zestaw danych z ciągłego rozkładu o gęstości obsługiwanej na który nie jest znany, ale jest dość duży, więc gęstość jądra (na przykład) szacunek jest dość dokładny. Dla konkretnego zastosowania muszę przekształcić obserwowane dane w skończoną liczbę kategorii, aby uzyskać nowy zestaw danych z implikowaną funkcją masy .Y1,...,YnY1,...,YnY_{1}, …


4
Czy istnieją przypadki, w których nie ma optymalnej wartości k w średnich?
To było w mojej głowie przez co najmniej kilka godzin. Próbowałem znaleźć optymalne k dla danych wyjściowych z algorytmu k-średnich (z metryką podobieństwa kosinusowego ), więc skończyłem na wykreślaniu zniekształcenia w funkcji liczby klastrów. Mój zestaw danych to zbiór 800 dokumentów w 600-wymiarowej przestrzeni. Z tego, co rozumiem, znalezienie punktu …

2
Kolejność statystyk (np. Minimum) nieskończonej kolekcji zmiennych chi-kwadrat?
To jest mój pierwszy raz tutaj, więc proszę dać mi znać, czy mogę wyjaśnić moje pytanie w jakikolwiek sposób (w tym formatowanie, tagi itp.). (Mam nadzieję, że mogę później edytować!) Próbowałem znaleźć referencje i próbowałem rozwiązać siebie za pomocą indukcji, ale nie udało mi się obu. Próbuję uprościć dystrybucję, która …

5
Grupowanie SOM dla zmiennych nominalnych / kołowych
Zastanawiam się tylko, czy ktoś jest zaznajomiony z grupowaniem nominalnych danych wejściowych. Patrzyłem na SOM jako rozwiązanie, ale najwyraźniej działa tylko z funkcjami numerycznymi. Czy są jakieś rozszerzenia dla funkcji jakościowych? W szczególności zastanawiałem się nad „Dniami tygodnia” jako możliwymi funkcjami. Oczywiście możliwe jest przekonwertowanie go na funkcję numeryczną (tj. …

2
Organizujesz drzewo klasyfikacyjne (w części) w zbiór reguł?
Czy istnieje sposób, aby po zbudowaniu złożonego drzewa klasyfikacji za pomocą rpart (w R) zorganizować reguły decyzyjne dla każdej klasy? Więc zamiast uzyskać jedno wielkie drzewo, otrzymujemy zestaw reguł dla każdej z klas? (Jeśli tak to jak?) Oto prosty przykład kodu, który pokazuje przykłady: fit <- rpart(Kyphosis ~ Age + …
11 r  classification  cart  rpart 


1
Dlaczego ładowanie resztek z modelu efektów mieszanych daje antykonserwatywne przedziały ufności?
Zazwyczaj mam do czynienia z danymi, w których każda z wielu osób jest mierzona wiele razy w każdym z 2 lub więcej warunków. Ostatnio bawiłem się modelowaniem efektów mieszanych w celu oceny dowodów na różnice między warunkami, modelowanie individualjako efekt losowy. Aby zwizualizować niepewność dotyczącą prognoz z takiego modelowania, korzystałem …

3
Jak porównać dwa zestawy danych z wykresem QQ za pomocą ggplot2?
Jako zarówno statystyki, jak i początkujący R, miałem naprawdę trudny czas, próbując wygenerować qqploty o współczynniku proporcji 1: 1. ggplot2 wydaje się oferować znacznie większą kontrolę nad wykreślaniem niż domyślne pakiety wydruku R, ale nie widzę, jak zrobić qqplot w ggplot2, aby porównać dwa zestawy danych. Więc moje pytanie, jaki …

3
Czy są dostępne biblioteki dla metod podobnych do CART przy użyciu rzadkich predyktorów i odpowiedzi?
Pracuję z niektórymi dużymi zestawami danych przy użyciu pakietu gbm w R. Zarówno moja macierz predykcyjna, jak i mój wektor odpowiedzi są dość rzadkie (tzn. Większość wpisów ma wartość zero). Miałem nadzieję zbudować drzewa decyzyjne przy użyciu algorytmu, który korzysta z tej rzadkości, jak to tutaj zrobiono ). W tym …

7
Technika redukcji danych w celu identyfikacji typów krajów
Prowadzę wstępny kurs z geografii ekonomicznej. Aby pomóc moim studentom w lepszym zrozumieniu rodzajów krajów obecnych we współczesnej gospodarce światowej i docenieniu technik ograniczania danych, chcę skonstruować zadanie, które stworzy typologię różnych rodzajów krajów (np. wartość dodana MFG długa żywotność; eksporter zasobów naturalnych o wysokich dochodach średni i średni oczekiwany …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.