Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Scikit poprawny sposób kalibracji klasyfikatorów za pomocą CalibratedClassifierCV
Scikit ma CalibratedClassifierCV , co pozwala nam skalibrować nasze modele na konkretnej parze X, y. Stwierdza to również jasnodata for fitting the classifier and for calibrating it must be disjoint. Jeśli muszą być rozłączne, czy uzasadnione jest przeszkolenie klasyfikatora w następujących kwestiach? model = CalibratedClassifierCV(my_classifier) model.fit(X_train, y_train) Obawiam się, że …

3
W jaki sposób `przewidywana.losowaLeśność` oszacowuje prawdopodobieństwa klasowe?
W jaki sposób randomForestpakiet szacuje prawdopodobieństwa klasowe, kiedy używam predict(model, data, type = "prob")? Użyłem rangerdo szkolenia losowych lasów, używając probability = Targumentu do przewidywania prawdopodobieństw. rangermówi w dokumentacji, że: Wyhoduj las prawdopodobieństwa, jak w Malley i in. (2012). Symulowałem niektóre dane, wypróbowałem oba pakiety i uzyskałem bardzo różne wyniki …

1
Jakiej metody wielokrotnego porównania użyć w modelu Lmer: lsmeans czy glht?
Analizuję zestaw danych przy użyciu modelu efektów mieszanych z jednym ustalonym efektem (warunkiem) i dwoma efektami losowymi (uczestnik ze względu na projekt i parę wewnątrz przedmiotu). Model ten został wygenerowany z lme4pakietu: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). Następnie wykonałem test współczynnika wiarygodności tego modelu względem modelu bez ustalonego efektu (warunku) i mam znaczącą różnicę. …

3
Różnica między statsmodel OLS a regresją liniową scikit
Mam pytanie dotyczące dwóch różnych metod z różnych bibliotek, które wydają się wykonywać tę samą pracę. Próbuję stworzyć model regresji liniowej. Oto kod, który używam biblioteki statsmodel z OLS: X_train, X_test, y_train, y_test = cross_validation.train_test_split(x, y, test_size=0.3, random_state=1) x_train = sm.add_constant(X_train) model = sm.OLS(y_train, x_train) results = model.fit() print "GFT …



2
Dlaczego utrata normy L2 ma unikalne rozwiązanie, a utrata normy L1 ma prawdopodobnie wiele rozwiązań?
http://www.chioka.in/differences-between-l1-and-l2-as-loss-function-and-regularization/ Jeśli spojrzysz na górę tego postu, pisarz wspomina, że ​​norma L2 ma unikalne rozwiązanie, a norma L1 ma prawdopodobnie wiele rozwiązań. Rozumiem to w kategoriach regularyzacji, ale nie w kategoriach użycia normy L1 lub normy L2 w funkcji straty. Jeśli spojrzysz na wykresy funkcji skalarnej x (x ^ 2 …




2
Różnica pomiędzy wybór funkcji oparty na „F” i regresji na podstawie
Czy porównywanie cech przy użyciu F-regressiontego samego, co korelowanie elementów z etykietą indywidualnie i obserwowanie wartości ?R2)R2R^2 Często widziałem, jak moi koledzy używają F regressiondo wyboru funkcji w procesie uczenia maszynowego z sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` Proszę, proszę, powiedz mi - dlaczego daje takie same wyniki, jak skorelowanie go ze zmienną etykieta …




1
RNN: kiedy stosować BPTT i / lub aktualizować wagi?
Próbuję zrozumieć ogólne zastosowanie RNN do znakowania sekwencji za pomocą (między innymi) artykułu Gravesa z 2005 r. Na temat klasyfikacji fonemów. Podsumowując problem: Mamy duży zestaw szkoleniowy składający się z (wejściowych) plików audio z pojedynczych zdań i (wyjściowych) opatrzonych znakiem eksperckim czasów rozpoczęcia, czasów zatrzymania i etykiet dla poszczególnych fonemów …
16 lstm  rnn 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.