Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Obliczanie 95. percentyla: porównanie podejść do rozkładu normalnego, R Quantile i Excela
Próbowałem obliczyć 95 percentyl na podstawie następującego zestawu danych. Natknąłem się na kilka internetowych odniesień do robienia tego. Podejście 1: na podstawie danych przykładowych Pierwszy mówi mi, w celu otrzymania TOP 95 Percentzbioru danych, a następnie wybierz MINlub AVGotrzymanego zestawu. Robienie tego dla następującego zestawu danych daje mi: AVG: 29162 …
17 r  dataset  quantiles  sql 

5
Jak należy sklasyfikować przypadkowe lasy w R, jak dostosować się do niezrównoważonych rozmiarów klas?
Badam różne metody klasyfikacji dla projektu, nad którym pracuję i jestem zainteresowany wypróbowaniem Losowych Lasów. Staram się kształcić na bieżąco i byłbym wdzięczny za wszelką pomoc ze strony społeczności CV. Podzieliłem swoje dane na zestawy szkoleniowe / testowe. Po eksperymentach z losowymi lasami w R (przy użyciu pakietu randomForest) miałem …


2
Jak interpretować Exp (B) w regresji Coxa?
Jestem studentem medycyny próbującym zrozumieć statystyki (!) - więc proszę, bądź delikatny! ;) Piszę esej zawierający sporo analizy statystycznej, w tym analizy przeżycia (regresja Kaplana-Meiera, Log-Ranka i regresji Coxa). Przeprowadziłem regresję Coxa na moich danych, próbując dowiedzieć się, czy mogę znaleźć znaczącą różnicę między zgonami pacjentów w dwóch grupach (pacjenci …

5
Jak dodać komponent okresowy do modelu regresji liniowej?
Mam pewne dane o skumulowanej częstotliwości. Linia wygląda tak, jakby bardzo dobrze pasowała do danych, ale w linii występuje cykliczne / okresowe poruszenie. Chciałbym oszacować, kiedy skumulowana częstotliwość osiągnie pewną wartość c . Kiedy wykreślam wartości resztkowe względem dopasowanych, otrzymuję piękne zachowanie sinusoidalne.y=ax+by=ax+by=ax+bccc Teraz, aby dodać kolejną komplikację, zwróć uwagę, …

1
Zastosowanie HMM w finansach ilościowych. Przykłady HMM, który działa w celu wykrycia trendów / punktów zwrotnych?
Odkrywam cudowny świat tzw. „Ukrytych modeli Markowa”, zwanych również „modelami zmiany reżimu”. Chciałbym dostosować HMM w R do wykrywania trendów i punktów zwrotnych. Chciałbym zbudować model tak ogólny, jak to możliwe, aby móc przetestować go na wielu cenach. Czy ktoś może polecić papier? Widziałem (i czytałem) (więcej niż) kilka, ale …

4
Jakie są zalety i wady korzystania z metody logrank vs. Mantel-Haenszel do obliczania współczynnika ryzyka w analizie przeżycia?
Jednym ze sposobów podsumowania porównania dwóch krzywych przeżycia jest obliczenie współczynnika ryzyka (HR). Istnieją (co najmniej) dwie metody obliczenia tej wartości. Metoda logrank. W ramach obliczeń Kaplana-Meiera oblicz liczbę zaobserwowanych zdarzeń (zwykle zgonów) w każdej grupie ( i O b ) oraz liczbę oczekiwanych zdarzeń przy założeniu zerowej hipotezy o …
17 survival  hazard 

2
Zrozumienie testu t dla regresji liniowej
Próbuję wypracować sposób przeprowadzenia testu hipotez regresji liniowej (hipoteza zerowa nie koreluje). Wydaje się, że każdy przewodnik i strona na temat, na które natrafiam, używa testu t-testowego. Ale nie rozumiem, co tak naprawdę oznacza test t dla regresji liniowej. Test t, o ile nie mam całkowicie błędnego zrozumienia lub modelu …

1
Wybieranie między nieinformacyjnymi wersjami beta
Szukam nieinformacyjnych priorytetów dla dystrybucji beta do pracy z procesem dwumianowym (Hit / Miss). Na początku myślałem o użyciu α=1,β=1α=1,β=1\alpha=1, \beta=1 które generują jednolity plik PDF, lub Jeffrey przed α=0.5,β=0.5α=0.5,β=0.5\alpha=0.5, \beta=0.5 . Ale tak naprawdę szukam priorów, które mają minimalny wpływ na późniejsze wyniki, a potem pomyślałem o użyciu niewłaściwego …

2
Dlaczego rozkład T jest wykorzystywany do hipotez testujących współczynnik regresji liniowej?
W praktyce powszechne jest stosowanie standardowego testu T do sprawdzenia znaczenia współczynnika regresji liniowej. Mechanika obliczeń ma dla mnie sens. Dlaczego rozkład T można wykorzystać do modelowania standardowej statystyki testowej stosowanej w testowaniu hipotez regresji liniowej? Standardowa statystyka testu, o której mowa tutaj: T0=βˆ−β0SE(βˆ)T0=β^−β0SE(β^) T_{0} = \frac{\widehat{\beta} - \beta_{0}}{SE(\widehat{\beta})}

2
Dlaczego Lasso lub ElasticNet działają lepiej niż Ridge, gdy funkcje są skorelowane
Mam zestaw 150 funkcji, a wiele z nich jest ze sobą bardzo skorelowanych. Moim celem jest przewidzenie wartości zmiennej dyskretnej, której zakres wynosi 1-8 . Mój rozmiar próbki wynosi 550 i używam 10-krotnej walidacji krzyżowej. AFAIK, wśród metod regularyzacji (Lasso, ElasticNet i Ridge), Ridge jest bardziej rygorystyczny w zakresie korelacji …


3
Aktualizacja bayesowska o nowe dane
Jak przejść do obliczania tylnej z wcześniejszym N ~ (a, b) po zaobserwowaniu n punktów danych? Zakładam, że musimy obliczyć średnią próbki i wariancję punktów danych i wykonać jakieś obliczenia, które łączą tylną z wcześniejszą, ale nie jestem pewien, jak wygląda wzór kombinacji.

5
Miara „wariancji” z macierzy kowariancji?
Jeśli dane mają wartość 1d, wariancja pokazuje stopień, w jakim punkty danych różnią się od siebie. Jeśli dane są wielowymiarowe, otrzymamy macierz kowariancji. Czy istnieje miara, która podaje pojedynczą liczbę różnic między punktami danych w przypadku danych wielowymiarowych? Wydaje mi się, że może już istnieć wiele rozwiązań, ale nie jestem …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.