Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Losowa prognoza probabilistyczna lasu a głosowanie większościowe
Wydaje się, że scikit uczy się przewidywania probabilistycznego zamiast głosowania większością za techniką agregacji modelu bez wyjaśnienia, dlaczego (1.9.2.1. Losowe lasy). Czy istnieje jasne wyjaśnienie, dlaczego? Czy jest też dobry artykuł lub artykuł przeglądowy na temat różnych technik agregacji modeli, które można zastosować do tworzenia worków w Losowym lesie? Dzięki!

3
Analiza szeregów czasowych a uczenie maszynowe?
To tylko ogólne pytanie. Jeśli masz dane szeregów czasowych, kiedy lepiej jest stosować techniki szeregów czasowych (aka, ARCH, GARCH itp.) Zamiast technik uczenia maszynowego / statystycznego (KNN, regresja)? Jeśli istnieje podobne pytanie dotyczące weryfikacji krzyżowej, proszę skierować mnie do niego - spojrzałem i nie mogłem go znaleźć.

4
Dlaczego nie przekształcić logów wszystkich zmiennych, które nie są głównym przedmiotem zainteresowania?
Książki i dyskusje często stwierdzają, że w obliczu problemów (których jest kilka) za pomocą predyktora, transformacja logów jest możliwa. Rozumiem teraz, że zależy to od rozkładów, a normalność w predyktorach nie jest założeniem regresji; ale transformacja dziennika sprawia, że ​​dane są bardziej jednolite, mniej zależne od wartości odstających i tak …

2
Jak określić przewidywalność szeregów czasowych?
Jedną z ważnych kwestii, przed którymi stoją prognozy, jest to, czy daną serię można prognozować, czy nie? Natknąłem się na artykuł zatytułowany „ Entropia jako wskaźnik Priori przewidywalności ” autorstwa Petera Catta, który wykorzystuje aproksymalną entropię (ApEn) jako miarę względną do określenia danego szeregu czasowego. Artykuł mówi: „Mniejsze wartości ApEn …

2
Regresja z odwrotną zmienną niezależną
Załóżmy, że mam wektor zmiennych zależnych i wektor zmiennej niezależnej. Kiedy jest wykreślane względem , widzę, że istnieje między nimi zależność liniowa (trend wzrostowy). Teraz, to oznacza również, że istnieje liniowa tendencja spadkowa między i .T N X T 1N.NNYYYN.NNXXXYYY YX1X1X\frac{1}{X}YYYXXX Teraz, jeśli uruchomię regresję: i uzyskam dopasowaną wartośćY = …

2
Dane wyjściowe Scikit SVM w klasyfikacji wieloklasowej zawsze dają tę samą etykietę
Obecnie używam Scikit Learn z następującym kodem: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') a następnie dopasuj i przewiduj zestaw danych z 7 różnymi etykietami. Mam dziwny wynik. Bez względu na to, jaką technikę walidacji krzyżowej używam przewidywanej etykiety w zestawie walidacyjnym, zawsze będzie to etykieta 7. Próbuję kilku …

3
Jak wyodrębnić informacje z macierzy rozrzutu, gdy masz duże N, dane dyskretne i wiele zmiennych?
Bawię się zestawem danych dotyczących raka piersi i stworzyłem wykres rozproszenia wszystkich atrybutów, aby dowiedzieć się, które z nich mają największy wpływ na przewidywanie klasy malignant(niebieskiej) benign(czerwonej). Rozumiem, że wiersz reprezentuje oś x, a kolumna reprezentuje oś y, ale nie widzę, jakie spostrzeżenia mogę poczynić na temat danych lub atrybutów …

1
bayesglm (ramię) kontra MCMCpack
Zarówno bayesglm()(w pakiecie ramienia R), jak i różne funkcje w pakiecie MCMCpack mają na celu dokonanie estymacji bayesowskiej uogólnionych modeli liniowych, ale nie jestem pewien, czy obliczają to samo. Funkcje MCMCpack wykorzystują łańcuch Markova Monte Carlo, aby uzyskać (zależną) próbkę ze stawu tylnego dla parametrów modelu. bayesglm()z drugiej strony produkuje. …

1
Spójność 2SLS z binarną zmienną endogenną
Czytałem, że estymator 2SLS jest nadal spójny nawet z binarną zmienną endogenną ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ). W pierwszym etapie zamiast modelu liniowego zostanie uruchomiony model leczenia probitowego. Czy istnieje formalny dowód na to, że 2SLS jest nadal spójny, nawet jeśli 1. etap jest modelem probit lub logit? A co jeśli wynik …

1
Estymator największej wiarygodności dla minimalnych rozkładów wykładniczych
Utknąłem, jak rozwiązać ten problem. Mamy więc dwie sekwencje zmiennych losowych, i dla . Teraz i są niezależnymi rozkładami wykładniczymi o parametrach i . Jednak zamiast obserwacji i , a nie obserwuje i .XiXiX_iYiYiY_ii=1,...,ni=1,...,ni=1,...,nXXXYYYλλ\lambdaμμ\muXXXYYYZZZWWW Z=min(Xi,Yi)Z=min(Xi,Yi)Z=\min(X_i,Y_i) i W=1W=1W=1 jeśli Zi=XiZi=XiZ_i=X_i i 0, jeśli Zi=YiZi=YiZ_i=Y_i . I znaleźć Zamknięty formy dla estymatorów …


1
Mylić z wizualnym wyjaśnieniem wektorów własnych: w jaki sposób wizualnie różne zestawy danych mogą mieć te same wektory własne?
Wiele podręczników statystycznych zapewnia intuicyjną ilustrację tego, czym są wektory własne macierzy kowariancji: Wektory u i z tworzą wektory własne (cóż, osie własne). To ma sens. Ale jedną rzeczą, która mnie myli, jest to, że wydobywamy wektory własne z macierzy korelacji , a nie z surowych danych. Ponadto surowe zestawy …

3
Średnie K dla podobieństw cosinusa vs. odległość euklidesowa (LSA)
Używam ukrytej analizy semantycznej do reprezentowania zbioru dokumentów w przestrzeni o niższych wymiarach. Chcę zgrupować te dokumenty w dwie grupy za pomocą k-średnich. Kilka lat temu zrobiłem to, używając gensim Pythona i pisząc własny algorytm k-średnich. Określiłem centroidy gromadowe na podstawie odległości euklidesowej, ale następnie zgrupowałem każdy dokument na podstawie …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.