Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak zatem uwzględnić szacunki Bayesa w metaanalizie?
Zainspirowany tym pytaniem, a zwłaszcza „Problemem 3”: Rozkłady tylne są nieco trudniejsze do włączenia do metaanalizy, chyba że podano częsty, parametryczny opis rozkładu. Ostatnio dużo myślałem o włączeniu metaanalizy do modelu bayesowskiego - przede wszystkim jako źródła priorytetów - ale jak to zrobić w drugą stronę? Jeśli analiza bayesowska rzeczywiście …

1
Jak znaleźć korelacje między awariami a środowiskami systemowymi?
W wolnym czasie pracuję nad małym systemem internetowym, który gromadzi raporty o awariach (ale nie inne, niezawierające raportów o błędach) wysyłane z aplikacji Delphi Windows. Przy rozwiązywaniu problemów użytkownicy chcieliby mieć funkcję eksploracji danych, aby znaleźć związki między wersjami sprzętu lub systemu operacyjnego a konkretnym błędem i / lub awarią. …

3
Jak grupować zmienne podłużne?
Mam kilka zmiennych, które zawierają dane podłużne od dnia 0 do dnia 7. Poszukuję odpowiedniego podejścia grupującego, które może grupować te zmienne podłużne (nie przypadki) w różne grupy. Próbowałem analizować ten zestaw danych osobno według czasu, ale wynik był dość trudny do racjonalnego wyjaśnienia. Zbadałem dostępność procedury SAS, PROC SIMILARITYponieważ …
10 clustering 


2
Jak wykonać analizę ROC w R za pomocą modelu Coxa
Stworzyłem kilka modeli regresji Coxa i chciałbym zobaczyć, jak dobrze działają te modele, i pomyślałem, że być może krzywa ROC lub statystyka c mogą być przydatne podobnie jak w przypadku tych artykułów: JN Armitage och JH van der Meulen, „Identyfikacja chorób współistniejących u pacjentów chirurgicznych przy użyciu danych administracyjnych z …
10 r  survival  roc 

8
Jakiego algorytmu można użyć do przewidywania zużycia materiałów eksploatacyjnych na podstawie danych z poprzednich zakupów?
Myśląc o rzekomo prostym, ale interesującym problemie, chciałbym napisać kod do prognozowania materiałów eksploatacyjnych, których będę potrzebować w najbliższej przyszłości, biorąc pod uwagę pełną historię moich poprzednich zakupów. Jestem pewien, że ten rodzaj problemu ma bardziej ogólną i dobrze przestudiowaną definicję (ktoś zasugerował, że jest to związane z niektórymi koncepcjami …

2
Dobra książka z równym naciskiem na teorię i matematykę
W latach szkolnych i na uniwersytecie miałem wystarczająco dużo kursów statystyki. Dobrze rozumiem pojęcia, takie jak CI, wartości p, interpretacja istotności statystycznej, testowanie wielokrotne, korelacja, prosta regresja liniowa (z najmniejszymi kwadratami) (ogólne modele liniowe) i wszystkie testy hipotezy. Poznałem go w większości wcześniejszych czasów głównie matematycznie. I ostatnio, dzięki książce …

2
Testowanie hipotez i całkowity dystans wariancji vs. dywergencja Kullbacka-Leiblera
W moich badaniach natrafiłem na następujący ogólny problem: mam dwie rozkłady i w tej samej domenie i dużą (ale skończoną) liczbę próbek z tych rozkładów. Próbki są niezależnie i identycznie rozmieszczone z jednego z tych dwóch rozkładów (chociaż rozkłady mogą być powiązane: na przykład Q może być mieszaniną P i …

1
Dobre praktyki podczas prognozowania szeregów czasowych
Od miesięcy pracuję nad krótkoterminowym prognozowaniem obciążenia i wykorzystaniem danych klimatycznych / pogodowych w celu zwiększenia dokładności. Mam wykształcenie informatyczne i dlatego staram się nie popełniać dużych błędów i niesprawiedliwych porównań, pracując z narzędziami statystycznymi, takimi jak modele ARIMA. Chciałbym poznać Twoją opinię na temat kilku rzeczy: Używam zarówno modeli …

2
Moc dla testu t dwóch próbek
Próbuję zrozumieć obliczenia mocy dla przypadku dwóch niezależnych próbnych testów t (nie zakładając równych wariancji, więc użyłem Satterthwaite). Oto schemat, który znalazłem, aby pomóc zrozumieć proces: Więc założyłem, że biorąc pod uwagę następujące informacje o dwóch populacjach i biorąc pod uwagę rozmiary próbek: mu1<-5 mu2<-6 sd1<-3 sd2<-2 n1<-20 n2<-20 Mógłbym …



2
Jak porównać dwie lub więcej macierzy korelacji?
Mam macierze korelacji obliczone z zestawami danych danych (zaobserwowanych) za pomocą funkcji MATLAB .P.P.P( n × n )(n×n)(n \times n)P.P.P( m × n )(m×n)(m \times n)corrcoef Jak porównać i przeanalizować te macierze korelacji względem siebie?P.P.P Jakie są testy, metody i / lub punkty kontrolne?



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.