Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy odległość musi być „metryką”, aby hierarchiczna klastracja była na niej ważna?
Powiedzmy, że definiujemy odległość, która nie jest miarą , między N elementami. Na podstawie tej odległości stosujemy następnie aglomeracyjne hierarchiczne grupowanie . Czy możemy zastosować każdy ze znanych algorytmów (połączenie pojedyncze / maksymalne / średnie itp.), Aby uzyskać znaczące wyniki? Lub inaczej: jaki jest problem z ich użyciem, jeśli odległość …

2
Rozkład odchylenia standardowego
To pytanie dotyczyło rozkładu normalnego, ale zastanawiam się, co wiadomo na temat rozkładu odchylenia standardowego próbki o wielkości n pobranej z rozkładu arbitralnego. W szczególności, jakie jest odchylenie standardowe odchylenia standardowego? Dla rozkładu normalnego sd sd to σ2 n√σ2n\sigma \over{\sqrt{2n}}. Czy jest to w przybliżeniu prawdziwe w przypadku arbitralnej dystrybucji …

3
Boxplot dla kilku dystrybucji?
Muszę narysować 20 rozkładów na jednym wykresie w R i nie wygląda mi to dobrze (zaśmiecone) przy zwykłym wykresie pudełkowym (20 pudełek), nawet przy boxwex = 0,3. Czy mógłbyś mi zasugerować, w jaki sposób mogę wykreślić rodzaj wykresu ramkowego w R dla 20 rozkładów, z kropkami jako medianą i tylko …
9 r  boxplot 

2
Zrozumienie wyników regresji kalenicy
Jestem nowy w regresji grzbietu. Kiedy zastosowałem liniową regresję kalenicy, otrzymałem następujące wyniki: >myridge = lm.ridge(y ~ ma + sa + lka + cb + ltb , temp, lamda = seq(0,0.1,0.001)) > select(myridge) modified HKB estimator is 0.5010689 modified L-W estimator is 0.3718668 smallest value of GCV at 0 Pytania: …

1
Jak wybrać liczbę podziałów w rpart ()?
Użyłem rpart.controldo minsplit=2i dostał następujące wyniki z rpart()funkcji. Czy muszę unikać podziału 3 lub 7, aby uniknąć przeładowania danych? Czy nie powinienem używać splitów 7? Proszę daj mi znać. Zmienne faktycznie używane w konstrukcji drzewa: [1] ct_a ct_b usr_a Root node error: 23205/60 = 386.75 n= 60 CP nsplit rel …
9 r  cart  rpart 


2
W którym ustawieniu spodziewałbyś się, że model znaleziony przez LARS najbardziej różni się od modelu znalezionego przez wyczerpujące wyszukiwanie?
Trochę więcej informacji; Przypuszczam, że wiesz z góry, ile zmiennych wybrać i że ustawiasz karę złożoności w procedurze LARS, tak aby mieć dokładnie tyle zmiennych o współczynnikach innych niż 0, koszty obliczeń nie stanowią problemu (całkowita liczba zmiennych jest mała, powiedzmy 50), że wszystkie zmienne (y, x) są ciągłe. W …

4
Grupowanie z asymetrycznymi pomiarami odległości
Jak grupujesz obiekt za pomocą asymetrycznej miary odległości? Załóżmy na przykład, że grupujesz zbiór danych z dniami tygodnia jako cechą - odległość od poniedziałku do piątku nie jest taka sama jak odległość od piątku do poniedziałku. Jak włączyć to do pomiaru odległości algorytmu klastrowania?

1
Jak zsumować dwie zmienne w różnych skalach?
Jeśli mam dwie zmienne następujące po dwóch różnych rozkładach i mające różne odchylenia standardowe ... Jak muszę przekształcić dwie zmienne, aby przy sumowaniu te dwa wyniki nie były „napędzane” przez zmienną. Na przykład ... Zmienna A jest mniej lotna niż zmienna B (w zakresie od 0 do 3000), a zmienna …

1
Jak obliczyć oszacowanie gęstości tylnej na podstawie wcześniejszego i prawdopodobnego prawdopodobieństwa?
Próbuję zrozumieć, jak użyć twierdzenia Bayesa do obliczenia tylnej, ale utknąłem w podejściu obliczeniowym, np. W następującym przypadku nie jest dla mnie jasne, jak wziąć iloczyn wcześniejszego i prawdopodobieństwa, a następnie obliczyć tylny: W tym przykładzie jestem zainteresowany obliczeniem prawdopodobieństwa a posteriori dla i używam standardowej normalnej przed , ale …


5
Wykrywanie części piosenki
Mam nadzieję, że nie jest to zbyt subiektywne ... Szukam pewnego kierunku w wysiłkach zmierzających do wykrycia różnych „części” piosenki, niezależnie od stylu muzycznego. Nie mam pojęcia, gdzie szukać, ale ufając potędze innych stron StackOverflow, pomyślałem, że ktoś tutaj może pomóc wskazać kierunek. Mówiąc najprościej, można wykryć różne części piosenki, …

1
Propagacja błędu za pomocą serii Taylora drugiego rzędu
Czytam tekst „Statystyka matematyczna i analiza danych” Johna Rice'a. Zależy nam na przybliżeniu oczekiwanej wartości i wariancji zmiennej losowejYYY. Jesteśmy w stanie obliczyć oczekiwaną wartość i wariancję zmiennej losowej i znamy zależność . Tak więc możliwe jest przybliżenie oczekiwanej wartości i wariancji za pomocą rozszerzenia serii Taylora około .XXXY=g(X)Y=g(X)Y = …

1
Wielokrotna imputacja brakujących danych zliczeniowych w szeregach czasowych z badania panelowego
Usiłuję rozwiązać problem, który dotyczy przypisania brakujących danych z badania danych panelowych (Nie jestem pewien, czy prawidłowo używam „badania danych panelowych” - tak jak się dzisiaj nauczyłem). Mam dane dotyczące całkowitej liczby zgonów w latach 2003 do 2009 r., wszystkie miesiące, kobiety i mężczyźni, w 8 różnych dzielnicach i dla …

2
Jak sprawdzić, czy współczynnik regresji jest moderowany przez zmienną grupującą?
Mam regresję przeprowadzoną na dwóch grupach próby na podstawie zmiennej moderującej (powiedzmy płeć). Wykonuję prosty test efektu moderacji, sprawdzając, czy znaczenie regresji jest utracone w jednym zestawie, a pozostaje w drugim. P1: Powyższa metoda jest poprawna, prawda? Q2: Poziom ufności moich badań wynosi 95%. Dla jednej grupy regresja jest znacząca …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.