Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Która metoda jądra daje najlepsze wyniki prawdopodobieństwa?
Niedawno użyłem skalowania Platta wyjść SVM do oszacowania prawdopodobieństwa zdarzeń domyślnych. Bardziej bezpośrednimi alternatywami wydają się być „regresja logistyczna jądra” (KLR) i związana z nią „maszyna wektorów importu”. Czy ktoś może powiedzieć, która metoda jądra dająca wyniki prawdopodobieństwa jest obecnie najnowocześniejsza? Czy istnieje R-implementacja KLR? Bardzo ci dziękuje za pomoc!

2
Dobry tekst do ponownego próbkowania?
Czy grupa może polecić dobry tekst / zasób wprowadzający do zastosowanych technik ponownego próbkowania? W szczególności interesują mnie alternatywy dla klasycznych testów parametrycznych (np. Testy t, ANOVA, ANCOVA) do porównywania grup w przypadku wyraźnego naruszenia założeń takich jak normalność. Przykładowy typ problemu, który chciałbym nauczyć się lepszego sposobu rozwiązania, może …

4
Jak mogę oszacować gęstość parametru z napompowaniem zerowym w R?
Mam zestaw danych z dużą ilością zer, który wygląda następująco: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) Chciałbym narysować linię dla jej gęstości, ale density()funkcja wykorzystuje ruchome okno, które oblicza ujemne wartości x. lines(density(x), col = 'grey') Istnieją density(... from, to)argumenty, ale wydają się one jedynie przycinać obliczenia, a nie …
10 r  probability  kde 

3
Oszacowanie modelu wykładniczego
Model wykładniczy to model opisany następującym równaniem: yi^=β0⋅eβ1x1i+…+βkxkiyja^=β0⋅miβ1x1ja+…+βkxkja\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} Najczęstszym podejściem stosowanym do oszacowania takiego modelu jest linearyzacja, którą można łatwo wykonać poprzez obliczenie logarytmów obu stron. Jakie są inne podejścia? Szczególnie interesują mnie te, które potrafią obsłużyć w niektórych spostrzeżeniach.yi=0yja=0y_{i}=0 Aktualizacja 31.01.2011 Jestem świadoma faktu, że ten model nie …

3
Pakiet R do łączenia poziomów czynników do analizy danych?
Zastanawiasz się, czy ktoś natknął się na pakiet / funkcję w R, która połączy poziomy współczynnika, którego proporcja wszystkich poziomów w współczynniku jest mniejsza niż pewien próg? Konkretnie, jednym z pierwszych kroków w przygotowaniu danych, które przeprowadzam, jest zwinięcie razem nielicznych poziomów czynników (powiedzmy na poziomie zwanym „Inne”), które nie …

5
Generuj losowe wartości wielowymiarowe z danych empirycznych
Pracuję nad funkcją Monte Carlo do wyceny kilku aktywów o częściowo skorelowanych zwrotach. Obecnie właśnie generuję macierz kowariancji i przesyłam do rmvnorm()funkcji w R. (Generuje skorelowane wartości losowe). Jednak patrząc na rozkłady zysków danego składnika aktywów, zwykle nie jest on rozkładany. To jest naprawdę dwuczęściowe pytanie: 1) Jak mogę oszacować …
10 mcmc  monte-carlo  pdf 



1
Czy w R „glmnet” pasuje do przechwytywania?
Mam sylwetkę modelu liniowego w R użyciem glmnet. Oryginalny (nieregulowany) model został dopasowany przy użyciu lmi nie miał stałego terminu (tj. Był w formie lm(y~0+x1+x2,data)). glmnetbierze macierz predyktorów i wektor odpowiedzi. Czytam glmnetdokumentację i nie mogę znaleźć wzmianki o tym stałym terminie. Czy istnieje sposób, aby poprosić glmneto wymuszenie dopasowania …
10 r  regression  lasso 

4
Wskazówki i porady dotyczące modelowania statystycznego?
Pracuję w dziedzinie eksploracji danych i miałem bardzo mało formalnego wykształcenia statystycznego. Ostatnio czytam dużo pracy, która koncentruje się na bayesowskich paradygmatach uczenia się i wydobywania, które uważam za bardzo interesujące. Moje pytanie brzmi (w kilku częściach), biorąc pod uwagę problem, czy istnieją ogólne ramy, dzięki którym można zbudować model …

1
Różnica między GLS i SUR
Czytałem trochę o Uogólnionych Najmniejszych Kwadratach (GLS) i próbowałem powiązać je z moim podstawowym tłem ekonometrycznym. Pamiętam, że w szkole podstawowej korzystałem z Regresji Pozornie Niepowiązanej (SUR), która wydaje się nieco podobna do GLS. W jednym artykule natknąłem się nawet na SUR jako „specjalny przypadek” GLS. Ale wciąż nie mogę …

1
Analiza skupień, a następnie Analiza dyskryminacyjna
Jakie jest uzasadnienie, jeśli w ogóle, zastosowania analizy dyskryminacyjnej (DA) w odniesieniu do wyników algorytmu grupowania, takiego jak k-średnie, co widzę od czasu do czasu w literaturze (zasadniczo na temat klinicznego podtypu zaburzeń psychicznych)? Zasadniczo nie zaleca się testowania różnic grupowych w zmiennych, które zostały użyte podczas budowy klastra, ponieważ …

1
Przetłumacz R na C ++ (ewentualnie z Rcpp) [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Chciałbym nauczyć się korzystać z Rcpp . Przejrzałem dokumenty na stronie CRAN pakietu, ale wydaje mi się, że praca nad praktycznym …
10 r  c++ 


3
Jak radzić sobie z niebinarnymi zmiennymi kategorialnymi w regresji logistycznej (SPSS)
Muszę wykonać binarną regresję logistyczną z wieloma niezależnymi zmiennymi. Większość z nich ma charakter binarny, ale kilka zmiennych kategorialnych ma więcej niż dwa poziomy. Jaki jest najlepszy sposób radzenia sobie z takimi zmiennymi? Na przykład, dla zmiennej o trzech możliwych wartościach, przypuszczam, że należy utworzyć dwie zmienne fikcyjne. Następnie, w …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.