Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Model przeżycia dla prognozowania rezygnacji - predyktory zmieniające się w czasie?
Chcę zbudować model predykcyjny do przewidywania odejścia i chcę zastosować dyskretny model przetrwania dopasowany do zestawu danych szkoleniowych na okres personalny (jeden wiersz dla każdego klienta i dyskretny okres, w którym byli narażeni, ze wskaźnikiem zdarzenia - równym 1 jeśli rezygnacja nastąpiła w tym okresie, w przeciwnym razie 0). Dopasowuję …


3
Analiza głównego składnika „wstecz”: ile wariancji danych wyjaśnia dana liniowa kombinacja zmiennych?
I przeprowadzeniu analizy głównych składowych sześć zmiennych , , , , E i F . Jeśli dobrze rozumiem, niezabezpieczone PC1 mówi mi, jaka liniowa kombinacja tych zmiennych opisuje / wyjaśnia największą wariancję danych, a PC2 mówi mi, jaka liniowa kombinacja tych zmiennych opisuje następną największą wariancję danych i tak dalej. …


1
Jak tworzyć kolorowe stoły za pomocą Sweave i xtable? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Używam Sweave i xtable do generowania raportu. Chciałbym dodać trochę koloru na stole. Ale nie udało mi się znaleźć żadnego sposobu …

2
Czy „każda niebieska osoba w koszulce” jest systematyczną próbą?
Uczę klasę statystyk wprowadzających i przeglądałem rodzaje próbkowania, w tym próbkowanie systematyczne, w którym próbkuje się każdą k-tą osobę lub obiekt. Student zapytał, czy pobieranie próbek od każdej osoby o określonej charakterystyce osiągnęłoby to samo. Na przykład, czy pobieranie próbek od każdej osoby w niebieskiej koszulce byłoby wystarczająco losowe i …
17 sampling 

3
Kiedy warto korzystać z interaktywnej wizualizacji danych?
Przygotowując się do wykładu, który wkrótce przedstawię, niedawno zacząłem zagłębiać się w dwa główne (bezpłatne) narzędzia do interaktywnej wizualizacji danych: GGobi i Mondrian - oba oferują szeroki zakres możliwości (nawet jeśli są nieco wadliwe). Chciałbym prosić o twoją pomoc w artykułowaniu (zarówno dla siebie, jak i dla mojej przyszłej publiczności) …

3
Regresja logistyczna i zestawu danych Struktura
Mam nadzieję, że mogę zadać to pytanie w prawidłowy sposób. Mam dostęp do play-by-play danych, więc jest to większy problem z najlepszym podejściem i konstruowania dane poprawnie. Co szukam zrobić to obliczyć prawdopodobieństwo wygranej jest NHL gra dany wynik i czas pozostały do ​​rozporządzenia. I postać mogę używać regresji logistycznej, …

2
krajobraz statystyczne
Czy ktoś napisał krótką ankietę na temat różnych podejść do statystyki? Do pierwszego przybliżenia masz statystyki częste i bayesowskie. Ale jeśli spojrzeć bliżej masz też inne podejścia jak likelihoodist i empirycznych Bayesa. A potem masz podziały w grupach, takie jak subiektywny Bayes obiektywny Bayes w statystykach Bayesa itp. Wyrób badanie …

7
Czy mediana jest bardziej sprawiedliwa niż średnia?
Niedawno przeczytałem radę, że powinieneś raczej używać mediany, a nie oznaczać eliminacji wartości odstających. Przykład: następujący artykuł http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ ma w tej chwili 16 opinii: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st Qu. Median Mean …
17 mean  median  average 

8
Miara jakości grupowania
Mam algorytm grupowania (nie k-średnich) z parametrem wejściowym (liczba klastrów). Po wykonaniu grupowanie Chciałbym zaczerpnąć ilościową miarą jakości tego grupowania. Algorytm klastrów ma jedną istotną właściwość. Dla , jeśli karmię punktów danych bez istotnej różnicy między nimi do tego algorytmu w wyniku otrzymam jeden klaster zawierający punktów danych i jeden …
17 clustering 

2
Dlaczego warto korzystać z skalowanie Platta?
Aby skalibrować poziom ufności do prawdopodobieństwa w nadzorowanym uczeniu się (powiedzmy, aby odwzorować pewność z SVM lub drzewa decyzyjnego przy użyciu danych z nadpróbkowanych danych) jedną z metod jest zastosowanie skalowania Platta (np. Uzyskiwanie skalibrowanych prawdopodobieństw z wzmocnienia ). Zasadniczo używa się regresji logistycznej do mapowania na . Zmienna zależna …

2
Nieparametryczna analiza bayesowska w R.
Szukam dobrego samouczka na temat grupowania danych przy Rużyciu hierarchicznego procesu dirichleta (HDP) (jednej z najnowszych i popularnych nieparametrycznych metod bayesowskich). Istnieje DPpackage(IMHO, najbardziej wszechstronny ze wszystkich dostępnych) w Rnieparametrycznej analizie bayesowskiej. Ale nie jestem w stanie zrozumieć przykładów podanych w R Newsinstrukcji obsługi pakietu lub wystarczająco dobrze, aby zakodować …

5
Prosty, niezawodny, otwarty i interoperacyjny format zwykłego tekstu do przechowywania danych
W poprzednim pytaniu poprosiłem o narzędzia do edycji plików CSV . Gavin powiązał z komentarzem R Help autorstwa Duncana Murdocha sugerującym, że Data Interchange Format to bardziej niezawodny sposób przechowywania danych niż CSV. W przypadku niektórych aplikacji potrzebny jest dedykowany system zarządzania bazą danych. Jednakże, w przypadku projektów małych analizy …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.