Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Optymalne binowanie w odniesieniu do danej zmiennej odpowiedzi
Szukam optymalnej metody binowania (dyskretyzacji) zmiennej ciągłej w odniesieniu do danej zmiennej binarnej odpowiedzi (celu) i maksymalnej liczby interwałów jako parametru. przykład: mam zestaw obserwacji ludzi ze zmiennymi „wzrost” (ciągłe cyfry) i „has_back_pains” (binarne). Chcę dyskretyzować wzrost na 3 przedziały (grupy) co najwyżej z różnym odsetkiem osób z bólami pleców, …

1
Dlaczego nie solidna regresja za każdym razem?
Przykłady tej strony pokazują, że na regresję wyraźnie wpływają wartości odstające i można temu zaradzić za pomocą technik solidnej regresji: http://www.alastairsanderson.com/R/tutorials/robust-regression-in-R/ . Wierzę, że lmrob i ltsReg to inne solidne techniki regresji. Dlaczego nie należy za każdym razem wykonywać solidnej regresji (np. Rlm lub rq) zamiast prostej regresji (lm)? Czy …

1
Jak zmniejszyć liczbę fałszywych trafień?
Próbuję rozwiązać zadanie zwane wykrywaniem pieszych i trenuję binarny clasifer na dwóch kategoriach pozytywnych - ludzie, negatywne - tło. Mam zestaw danych: liczba wyników dodatnich = 3752 liczba ujemna = 3800 Używam train \ test split 80 \ 20% i RandomForestClassifier z scikit-learn z parametrami: RandomForestClassifier(n_estimators=100, max_depth=50, n_jobs= -1) Otrzymuję …


2
Wymiar VC modeli regresji
W serii wykładów Uczenie się z danych profesor wspomina, że ​​wymiar VC mierzy złożoność modelu na podstawie tego, ile punktów dany model może rozbić. Działa to więc doskonale w przypadku modeli klasyfikacji, w których można by powiedzieć z N punktów, jeśli klasyfikator jest w stanie skutecznie rozbić punkty k, miarą …

1
Transformacja liniowa zmiennej losowej przez wysoką prostokątną macierz
X⃗ ∈RnX→∈Rn\vec{X} \in \mathbb{R}^nfX⃗ (x⃗ )fX→(x→)f_\vec{X}(\vec{x})n×nn×nn \times nAAAY⃗ =AX⃗ Y→=AX→\vec{Y} = A\vec{X}Y⃗ Y→\vec{Y}fY⃗ (y⃗ )=1|detA|fX⃗ (A−1y⃗ ).fY→(y→)=1|detA|fX→(A−1y→). f_{\vec{Y}}(\vec{y}) = \frac{1}{\left|\det A\right|}f_{\vec{X}}(A^{-1}\vec{y}). Powiedzmy teraz, że przekształcamy zamiast macierzy macierzy , z , dając . Wyraźnie , ale „żyje” w wymiarowej podprzestrzeni . Jaka jest gęstość warunkowa , skoro wiemy, że leży …

1
Jaki jest związek między regularyzacją a metodą mnożników Lagrange'a?
Aby zapobiec nadmiernemu dopasowywaniu się ludzi, dodaj funkcję regularyzacji (proporcjonalną do kwadratowej sumy parametrów modelu) z parametrem regularyzacji do funkcji kosztu regresji liniowej. Czy ten parametr taki sam jak mnożnik lagrange'a? Czy zatem regularyzacja jest taka sama jak metoda mnożnika lagrange'a? Lub w jaki sposób te metody są połączone? λλλ\lambdaλλ\lambda

2
Jak utworzyć dane dotyczące przeżycia zabawki (czas do zdarzenia) z odpowiednią cenzurą
Chciałbym stworzyć dane dotyczące przeżycia zabawki (czas do zdarzenia), które są odpowiednio cenzurowane i podążają za pewnym rozkładem z proporcjonalnymi zagrożeniami i stałym ryzykiem podstawowym. Utworzyłem dane w następujący sposób, ale nie jestem w stanie uzyskać szacunkowych współczynników ryzyka, które są zbliżone do prawdziwych wartości po dopasowaniu proporcjonalnego modelu zagrożeń …


2
Czy „w porządku” jest wykreślenie linii regresji dla danych rankingowych (korelacja Spearmana)?
Mam dane, dla których obliczyłem korelację Spearmana i chcę ją wizualizować dla publikacji. Zmienna zależna jest uszeregowana, zmienna niezależna nie jest. To, co chcę zwizualizować, to bardziej ogólny trend niż faktyczne nachylenie, więc uszeregowałem niezależność i zastosowałem korelację / regresję Spearmana. Ale kiedy sporządziłem swoje dane i miałem zamiar wstawić …




4
Podręcznik nauki o wzmacnianiu
Szukam notatek z podręczników / wykładów dotyczących uczenia się wzmacniającego. Lubię „Wprowadzenie do uczenia statystycznego” , ale niestety nie obejmują one tego tematu. Wiem, że książka Suttona i Barto jest standardowym materiałem źródłowym i być może NDP jest również dobra, ale są datowane na lata 1997-98, i miałem nadzieję znaleźć …

2
Algorytmy uczenia maszynowego dla danych panelu
W tym pytaniu - Czy istnieje metoda konstruowania drzew decyzyjnych uwzględniająca predyktory strukturalne / hierarchiczne / wielopoziomowe? - wspominają o metodzie danych panelowych dla drzew. Czy istnieją specjalne metody danych panelowych do obsługi maszyn wektorowych i sieci neuronowych? Jeśli tak, czy możesz przytoczyć dokumenty dotyczące algorytmów i (jeśli są dostępne) …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.