Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Wyprowadzenie dwuwymiarowego rozkładu Poissona
Niedawno spotkałem dwuwymiarowy rozkład Poissona, ale jestem trochę zdezorientowany, jak można go uzyskać. Rozkład podaje: P(X=x,Y=y)=e−(θ1+θ2+θ0)θx1x!θy2y!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP.(X=x,Y=y)=mi-(θ1+θ2)+θ0)θ1xx!θ2)yy!∑ja=0mjan(x,y)(xja)(yja)ja!(θ0θ1θ2))jaP(X = x, Y = y) = e^{-(\theta_{1}+\theta_{2}+\theta_{0})} \displaystyle\frac{\theta_{1}^{x}}{x!}\frac{\theta_{2}^{y}}{y!} \sum_{i=0}^{min(x,y)}\binom{x}{i}\binom{y}{i}i!\left(\frac{\theta_{0}}{\theta_{1}\theta_{2}}\right)^{i} Z tego, co mogę zebrać, pojęcie θ0θ0\theta_{0} jest miarą korelacji między XXX i YYY ; stąd, gdy XXX i YYY są niezależne, θ0=0θ0=0\theta_{0} = 0 …


2
Zastosowanie zagnieżdżonej weryfikacji krzyżowej
Strona Scikit Learn na temat wyboru modelu wspomina o zagnieżdżonej weryfikacji krzyżowej: >>> clf = GridSearchCV(estimator=svc, param_grid=dict(gamma=gammas), ... n_jobs=-1) >>> cross_validation.cross_val_score(clf, X_digits, y_digits) Dwie pętle wzajemnej weryfikacji są wykonywane równolegle: jedna przez estymator GridSearchCV, aby ustawić gamma, a druga przez cross_val_score, aby zmierzyć wydajność predykcji estymatora. Wynikowe wyniki są obiektywnymi …

1
Dlaczego warto korzystać z parametrycznego ładowania początkowego?
Obecnie próbuję omówić niektóre kwestie dotyczące parametrycznego ładowania początkowego. Większość rzeczy jest prawdopodobnie trywialna, ale nadal myślę, że coś przeoczyłem. Załóżmy, że chcę uzyskać przedziały ufności dla danych przy użyciu parametrycznej procedury ładowania początkowego. Mam więc tę próbkę i zakładam, że jest normalnie dystrybuowana. Oszacowałbym wtedy wariancję i znaczyłbym i …

2
Przyczynowość w mikroekonometrii kontra przyczynowość Grangera w ekonometrii szeregów czasowych
Rozumiem przyczynowość stosowaną w mikroekonomii (w szczególności projektowanie nieciągłości IV lub regresji), a także przyczynowość Grangera stosowaną w ekonometrii szeregów czasowych. Jak powiązać jedno z drugim? Na przykład widziałem, że oba dane są stosowane do danych panelowych (powiedzmy , ). Wszelkie odniesienia do dokumentów w tym zakresie będą mile widziane.T …

2
Dlaczego sferyczność zdiagnozowana w teście Bartletta oznacza, że ​​PCA jest niewłaściwa?
Rozumiem, że test Bartletta dotyczy ustalenia, czy twoje próbki pochodzą z populacji o równych wariancjach. Jeśli próbki pochodzą z populacji o równych wariancjach, wówczas nie odrzucamy hipotezy zerowej testu, a zatem analiza głównego składnika jest nieodpowiednia. Nie jestem pewien, gdzie leży problem z tą sytuacją (posiadanie zestawu danych homoskedastycznych). Na …



1
Kernel Bandwidth: Scott's vs. Silverman
Czy ktoś mógłby wyjaśnić prostym językiem angielskim, jaka jest różnica między podstawowymi zasadami Scotta i Silvermana dotyczącymi wyboru przepustowości? W szczególności, kiedy jedno jest lepsze od drugiego? Czy jest to związane z dystrybucją podstawową? Liczba przykładów? PS Mam na myśli kod w SciPy .

1
Czy istnieje intuicyjna charakterystyka korelacji odległości?
Patrzyłem na stronę wikipedii, aby znaleźć korelację odległości, na której wydaje się, że cechuje ją sposób jej obliczenia. O ile mogłem zrobić obliczenia walczę aby uzyskać środki korelacji jakiej odległości i dlatego obliczenia wyglądają tak robią. Czy istnieje (lub wiele) bardziej intuicyjna charakterystyka korelacji odległości, która mogłaby pomóc mi zrozumieć, …

1
Procedura wyboru eps i minPts dla DBSCAN
DBSCAN jest najczęściej cytowanym algorytmem klastrowania według literatury i może znaleźć klastry o dowolnym kształcie na podstawie gęstości. Ma dwa parametry eps (jako promień sąsiedztwa) i minPts (jako minimalni sąsiedzi, aby uznać punkt za punkt centralny), co moim zdaniem w dużym stopniu zależy od nich. Czy istnieje jakaś rutynowa lub …


3
Gdzie przydatne jest szacowanie gęstości?
Po przejrzeniu nieco zwięzłej matematyki, myślę, że mam niewielką intuicję w szacowaniu gęstości jądra. Ale jestem również świadomy, że szacowanie gęstości wielu zmiennych dla więcej niż trzech zmiennych może nie być dobrym pomysłem, jeśli chodzi o właściwości statystyczne jego estymatorów. Więc w jakich sytuacjach powinienem oszacować, powiedzmy, gęstość dwuwymiarową przy …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.