Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak automatycznie klastrować U-Matrix?
Po przeszkoleniu samoorganizującej się mapy można obliczyć U-Matrix . Istnieje kilka narzędzi do ręcznej wizualizacji i identyfikacji klastrów, ale zastanawiam się, czy istnieje jakiś algorytm do wykonania tego procesu w sposób automatyczny (tj. Bez patrzenia na postać w celu zidentyfikowania klastrów). Czy jest na to sposób? Piszę swój kod w …

4
Dlaczego metody regresji metodą najmniejszych kwadratów i największej wiarygodności nie są równoważne, gdy błędy nie są zwykle rozkładane?
Tytuł mówi wszystko. Rozumiem, że najmniejsze kwadraty i maksymalne prawdopodobieństwo dadzą taki sam wynik dla współczynników regresji, jeśli błędy modelu są zwykle rozkładane. Ale co się stanie, jeśli błędy nie są zwykle dystrybuowane? Dlaczego te dwie metody nie są już równoważne?

1
Wypukłość funkcji PDF i CDF standardowej normalnej zmiennej losowej
Proszę przedstawić dowód, że jest wypukły . W tym przypadku i są odpowiednio standardowymi normalnymi plikami PDF i CDF.Q(x)=x2+xϕ(x)Φ(x)Q(x)=x2+xϕ(x)Φ(x)Q\left(x\right)=x^{2}+x\frac{\phi\left(x\right)}{\Phi\left(x\right)}∀x>0∀x>0\forall x>0 ϕϕ\phiΦΦ\mathbf{\Phi} SPRAWDZONE KROKI 1) METODA OBLICZEŃ Próbowałem metody rachunku różniczkowego i mam wzór na drugą pochodną, ​​ale nie jestem w stanie wykazać, że jest ona dodatnia . Daj mi znać, …

5
Jak poprawić wykryte wartości odstające dla prognozowania danych szeregów czasowych?
Próbuję znaleźć sposób korygowania wartości odstających, gdy tylko znajdę je / wykryję w danych szeregów czasowych. Niektóre metody, takie jak nnetar w R, dają pewne błędy dla szeregów czasowych z dużymi / dużymi wartościami odstającymi. Udało mi się już poprawić brakujące wartości, ale wartości odstające wciąż niszczą moje prognozy ...

1
Interpretacja rozkładu szeregów czasowych przy użyciu TBATS z pakietu prognozy R.
Chciałbym rozłożyć następujące dane szeregów czasowych na komponenty sezonowe, trendowe i resztkowe. Dane to godzinny profil energii chłodzenia z budynku komercyjnego: TotalCoolingForDecompose.ts <- ts(TotalCoolingForDecompose, start=c(2012,3,18), freq=8765.81) plot(TotalCoolingForDecompose.ts) Istnieją zatem oczywiste dzienne i tygodniowe efekty sezonowe w związku z tym na podstawie porady: Jak rozłożyć szereg czasowy z wieloma składnikami sezonowymi? …


1
Czy MLE z
Załóżmy, że ma plik pdf(X,Y)(X,Y)(X,Y) fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0f_{\theta}(x,y)=e^{-(x/\theta+\theta y)}\mathbf1_{x>0,y>0}\quad,\,\theta>0 Gęstość próbki pobranej z tej populacji jest zatem(X,Y)=(Xi,Yi)1≤i≤n(X,Y)=(Xi,Yi)1≤i≤n(\mathbf X,\mathbf Y)=(X_i,Y_i)_{1\le i\le n} gθ(x,y)=∏i=1nfθ(xi,yi)=exp[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0gθ(x,y)=∏i=1nfθ(xi,yi)=exp⁡[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp⁡[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0\begin{align} g_{\theta}(\mathbf x,\mathbf y)&=\prod_{i=1}^n f_{\theta}(x_i,y_i) \\&=\exp\left[{-\sum_{i=1}^n\left(\frac{x_i}{\theta}+\theta y_i\right)}\right]\mathbf1_{x_1,\ldots,x_n,y_1,\ldots,y_n>0} \\&=\exp\left[-\frac{n\bar x}{\theta}-\theta n\bar y\right]\mathbf1_{x_{(1)},y_{(1)}>0}\quad,\,\theta>0 \end{align} Estymator największego prawdopodobieństwa można uzyskać jakoθθ\theta θ^(X,Y)=X¯¯¯¯Y¯¯¯¯−−−√θ^(X,Y)=X¯Y¯\hat\theta(\mathbf X,\mathbf Y)=\sqrt\frac{\overline X}{\overline Y} Chcę wiedzieć, czy ograniczenie tego MLE jest normalne, …

1
Powtarzane miary anova: lm vs lmer
Próbuję odtworzyć kilka testów interakcji między obiema lmi lmerpowtarzanymi pomiarami (2x2x2). Powodem, dla którego chcę porównać obie metody, jest to, że GLM SPSS dla powtarzanych pomiarów daje dokładnie takie same wyniki, jak lmprzedstawione tutaj podejście, więc na koniec chcę porównać SPSS z R-lmer. Do tej pory udało mi się tylko …

2
Rozwiązanie niemieckiego problemu czołgów
Czy istnieje formalny dowód matematyczny, że roztwór do zbiornika Problem niemiecki jest funkcją tylko do parametrów k (liczba obserwowanych próbek) i m (maksymalna wartość spośród obserwowanych próbek)? Innymi słowy, czy można udowodnić, że rozwiązanie jest niezależne od innych wartości próbki oprócz wartości maksymalnej?



2
Dlaczego lemat Neymana-Pearsona jest lematem, a nie twierdzeniem?
To bardziej pytanie historyczne niż techniczne. Dlaczego `` lemat Neymana-Pearsona '' jest lemą, a nie twierdzeniem? link do wiki: https://en.wikipedia.org/wiki/Neyman%E2%80%93Pearson_lemma NB : Pytanie nie dotyczy tego, czym jest lemat i jak lematy są wykorzystywane do udowodnienia twierdzenia, ale o historię lematu Neymana-Pearsona. Czy użyto go do udowodnienia twierdzenia, a potem …

4
Czy „losowa projekcja” ściśle nie jest projekcją?
Obecne implementacje algorytmu losowej projekcji zmniejszają wymiarowość próbek danych poprzez mapowanie ich z do przy użyciu macierzy projekcji d \ razy k R, której wpisy znajdują się w odpowiednim rozkładzie (na przykład z \ matematyka N (0,1) ):RdRd\mathbb R^dRkRk\mathbb R^kd×kd×kd\times kRRRN(0,1)N(0,1)\mathcal N(0,1) x′=1k√xRx′=1kxRx^\prime = \frac{1}{\sqrt k}xR Dogodnie istnieją teoretyczne dowody …

2
Co się stało z Fuzzy Logic?
Rozmyta logika wydawała się być aktywnym obszarem badań w uczeniu maszynowym i eksploracji danych, kiedy byłem w szkole podstawowej (na początku 2000 roku). Rozmyte systemy wnioskowania, rozmyte c-średnie, rozmyte wersje różnych sieci neuronowych i architektury maszyn wektorów wspomagających były nauczane na kursach gradowych i omawiane na konferencjach. Odkąd zacząłem ponownie …

2
Rozkład propozycji uogólnionego rozkładu normalnego
Modeluję rozproszenie roślin przy użyciu uogólnionego rozkładu normalnego ( wpis na Wikipedii ), który ma funkcję gęstości prawdopodobieństwa: b2aΓ(1/b)e−(da)bb2aΓ(1/b)e−(da)b \frac{b}{2a\Gamma(1/b)} e^{-(\frac{d}{a})^b} gdzie jest przebytą odległością, jest parametrem skali, a jest parametrem kształtu. Średnią przebytą odległość podaje standardowe odchylenie tego rozkładu:dddaaabbb a2Γ(3/b)Γ(1/b)−−−−−−−−√a2Γ(3/b)Γ(1/b) \sqrt{\frac{a^2 \Gamma(3/b)}{\Gamma(1/b)}} Jest to wygodne, ponieważ pozwala na uzyskanie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.