Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych




2
Czy mogę przetestować ważność wcześniej podanych danych?
Problem Piszę funkcję R, która wykonuje analizę bayesowską w celu oszacowania gęstości tylnej, biorąc pod uwagę świadomy uprzedni i dane. Chciałbym, aby funkcja wysłała ostrzeżenie, jeśli użytkownik będzie musiał ponownie rozważyć wcześniejsze. W tym pytaniu chcę dowiedzieć się, jak oceniać przeor. Poprzednie pytania dotyczyły mechaniki przedstawiania świadomych priorów ( tu …


3
Technika śledzenia losowego
W M. Seeger poznałem następującą losową technikę śledzenia: „Niski poziom aktualizacji rozkładu Choleskiego”, University of California w Berkeley, Tech. Rep, 2007. tr( A ) = E[ xT.A x ]tr⁡(A)=E[xTAx]\operatorname{tr}(\mathbf{A}) = {E[\mathbf{x}^T \mathbf{A} \mathbf{x}]} gdzie .x ∼N( 0 , I )x∼N(0,I)\mathbf{x} \sim N(\mathbf{0},\mathbf{I}) Jako osoba bez głębokiego doświadczenia matematycznego zastanawiam się, …

2
Jak oszacować parametry dla filtra Kalmana
W poprzednim pytaniu zapytałem o dopasowanie rozkładów do niektórych niegaussowskich danych empirycznych. Zasugerowano mi offline, że mogę spróbować założyć, że dane są gaussowskie i najpierw dopasować filtr Kalmana. Następnie, w zależności od błędów, zdecyduj, czy warto opracować coś bardziej wymyślnego. To ma sens. Tak więc, mając ładny zestaw danych szeregów …

3
Jaka jest różnica między ITT a ATE?
Mam problem ze zrozumieniem różnych estymatorów, które można wykorzystać w ocenie skutków. Wiem, że estymator zamiaru leczenia (ITT) porównuje różnice między uprawnionymi osobami bez programu, a uprawnionymi osobami z programem, niezależnie od zgodności. Myślałem jednak, że średni efekt leczenia (ATE) również mierzył to samo. Wydaje się jednak, że ATE bierze …

1
Definicja kwantyla
Biorąc pod uwagę N próbkowanych wartości, co oznacza „p -ty kwantyl próbkowanych wartości”?
10 sampling 

2
Portfel Markowitz oznacza optymalizację wariancji w R.
Mam 5 serii całkowitych zwrotów z rynków wschodzących, dla których prognozuję przyszłe zwroty z jednego okresu (1 rok). Chciałbym zbudować portfel zoptymalizowany pod kątem średnich wariancji Markowitza serii 5, wykorzystując historyczne wariancje i kowariancje (1) oraz własne prognozy oczekiwanych zwrotów. Czy R ma (łatwy) sposób / bibliotekę, aby to zrobić? …
10 r 

2
Uzasadnienie zastosowania AUC?
Zwłaszcza w informatycznej literaturze dotyczącej uczenia maszynowego AUC (obszar pod krzywą charakterystyczną operatora odbiornika) jest popularnym kryterium oceny klasyfikatorów. Jakie są uzasadnienia korzystania z AUC? Np. Czy istnieje konkretna funkcja straty, dla której optymalną decyzją jest klasyfikator o najlepszym AUC?

6
Najlepszy sposób na interakcję z sesją R. działającą w chmurze
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Mam R działającą na Amazon EC2, używając zmodyfikowanej wersji bioprzewodnika AMI . Obecnie używam putty do ssh na moim serwerze, rozpoczynając R z wiersza poleceń, …
10 r 


2
Dane podłużne: szeregi czasowe, powtarzane pomiary czy coś innego?
Mówiąc wprost : mam model regresji wielokrotnej lub model ANOVA, ale zmienna odpowiedzi dla każdej osoby jest krzywoliniową funkcją czasu. Jak stwierdzić, które ze zmiennych po prawej stronie są odpowiedzialne za znaczące różnice w kształtach lub pionowych przesunięciach krzywych? Czy to problem z szeregiem czasowym, problem z powtarzanymi pomiarami, czy …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.