Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jeśli oraz , to czy ?
To nie jest praca domowa. Niech XXX będzie zmienną losową. Jeśli E[X]=k∈RE[X]=k∈R\mathbb{E}[X] = k \in \mathbb{R} i Var[X]=0Var[X]=0\text{Var}[X] = 0 , czy wynika z tego, że Pr(X=k)=1Pr(X=k)=1\Pr\left(X = k\right) = 1 ? Intuicyjnie wydaje się to oczywiste, ale nie jestem pewien, jak to udowodnię. Wiem na pewno, że z założeń …


1
Asymptotyczna normalność statystyki rzędu rozkładów ciężkich
Tło: Mam próbkę, którą chcę modelować z rozkładem o dużym ogonie. Mam pewne ekstremalne wartości, takie, że zasięg obserwacji jest stosunkowo duży. Moim pomysłem było modelowanie tego z uogólnioną dystrybucją Pareto, i tak zrobiłem. Teraz kwantyl 0,975 moich danych empirycznych (około 100 punktów danych) jest niższy niż kwantyl 0,975 Uogólnionego …

2
Jakie dziedziny naukowe badają, w jaki sposób ludzie interpretują podsumowania ilościowe i wizualizacje?
Istnieje mnóstwo dobrze znanych zasobów oferujących porady dotyczące wizualizacji danych. (Np. Tufte, Stephen Few i in. , Nathan Yau .) Ale do jakich dziedzin można się zwrócić w celu uzyskania odpowiedzi na takie pytania: Czy krytyka wykresu kołowego jest istotna w praktyce? Czy ludzie znacznie lepiej interpretują długość skali liniowej …

1
Są kontury
Zakładam, że ogólna konfiguracja regresji, czyli ciągła funkcja jest wybierana z rodziny celu dopasowania danych ( może być dowolną przestrzenią, taką jak sześcian lub faktycznie dowolną rozsądną przestrzenią topologiczną) zgodnie z niektórymi naturalnymi kryteriami.hθ:X→Rnhθ:X→Rnh_\theta:X\to \mathbb R^n{hθ}θ{hθ}θ\{h_\theta\}_\theta(xi,yi)∈X×Rn,i=1,…,k(xja,yja)∈X×Rn,ja=1,…,k(x_i,y_i)\in X\times \mathbb R^n, i=1,\ldots, kXXX[0,1]m[0,1]m[0,1]^m Czy istnieją zastosowania regresji, w których zainteresowany jest kontur? …

1
Co powinien obejmować kurs dla absolwentów eksperymentalnego projektowania?
Poproszono mnie o zaproponowanie kursu z zakresu projektowania eksperymentalnego dla zaawansowanych absolwentów agronomii i ekologii. Nigdy nie brałem takiego kursu i zdziwiłem się, że kurs ten może być bardziej trafnie nazwany „Poza jednokierunkową ANOVA” i że obejmuje on materiał, którego nauczyłem się na zaawansowanym kursie dla absolwentów statystyki eksperymentów w …

1
niezmienność korelacji z transformacją liniową:
Jest to faktycznie jeden z problemów w czwartym wydaniu Gujarati Basic Econometrics (Q3.11) i mówi, że współczynnik korelacji jest niezmienny w odniesieniu do zmiany pochodzenia i skali, czyli gdzie , , , są stałymi arbitralnymi.corr(aX+b,cY+d)=corr(X,Y)corr(aX+b,cY+d)=corr(X,Y)\text{corr}(aX+b, cY+d) = \text{corr}(X,Y)aaabbbcccddd Ale moje główne pytanie jest następujące: Niech i będą sparowanymi obserwacjami i …



2
Wybór funkcji dla problemów związanych z klastrowaniem
Usiłuję grupować różne zestawy danych przy użyciu nienadzorowanych algorytmów (klastrowanie). Problem polega na tym, że mam wiele funkcji (~ 500) i niewielką liczbę skrzynek (200-300). Do tej pory robiłem tylko problemy z klasyfikacją, dla których zawsze oznaczyłem dane jako zestawy szkoleniowe. Tam zastosowałem jakieś kryterium (tj. Losowy.lasy.importance lub information.gain) do …

3
Zmniejszenie o połowę dyskretnej zmiennej losowej?
Pozwolić XXX być dyskretną zmienną losową przyjmującą jej wartości N.N\mathbb{N}. Chciałbym zmniejszyć tę zmienną o połowę , to znaczy znaleźć zmienną losowąYYY Jak na przykład: X= Y+Y∗X=Y+Y∗X = Y + Y^* gdzie Y∗Y∗Y^* jest niezależną kopią YYY. Odnoszę się do tego procesu jako do połowy ; to wymyślona terminologia. Czy …

3
Obracaj komponenty PCA, aby wyrównać wariancję w każdym komponencie
Staram się zmniejszyć wymiarowość i hałas zestawu danych, wykonując PCA na zbiorze danych i wyrzucając kilka ostatnich komputerów. Następnie chcę użyć niektórych algorytmów uczenia maszynowego na pozostałych komputerach, dlatego chcę znormalizować dane, wyrównując wariancję komputerów, aby algorytmy działały lepiej. Jednym prostym sposobem jest po prostu znormalizowanie wariancji wartości jednostkowych. Jednak …

1
Wybór oryginalnego (?) Modelu z k-krotnie CV
Używając k-krotnie CV do wyboru spośród modeli regresji, zwykle obliczam błąd CV osobno dla każdego modelu, wraz z jego standardowym błędem SE, i wybieram najprostszy model w obrębie 1 SE modelu o najniższym błędzie CV (1 standardowa reguła błędu, patrz na przykład tutaj ). Jednak niedawno powiedziano mi, że w …


1
Regresja liniowa z błędami Laplace'a
Rozważ model regresji liniowej: yi=xi⋅β+εi,i=1,…,n,yi=xi⋅β+εi,i=1,…,n, y_i = \mathbf x_i \cdot \boldsymbol \beta + \varepsilon _i, \, i=1,\ldots ,n, gdzie εi∼L(0,b)εi∼L(0,b)\varepsilon _i \sim \mathcal L(0, b) , to znaczy , Rozkład Laplace'a ze średnią 000 i parametrem skali bbb , wszystkie są wzajemnie niezależne. Rozważ maksymalne oszacowanie prawdopodobieństwa nieznanego parametru ββ\boldsymbol …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.