Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak obliczyć
Jak ocenić oczekiwania normalnego CDF do kwadratu w formie zamkniętej? E[Φ(aZ+b)2]=∫∞−∞Φ(az+b)2ϕ(z)dzE[Φ(aZ+b)2]=∫−∞∞Φ(az+b)2ϕ(z)dz\mathbb{E}\left[\Phi\left(aZ+b\right)^{2}\right] = \int_{-\infty}^{\infty}\Phi\left(az+b\right)^{2}\phi(z)\,dz Tutaj , b są liczbami rzeczywistymi, Z ∼ N ( 0 , 1 ) , a ϕ ( ⋅ ) i Φ ( ⋅ ) są odpowiednio funkcjami gęstości i rozkładu standardowej normalnej zmiennej losowej.aaabbbZ∼N(0,1)Z∼N(0,1)Z\sim\mathcal{N}(0,1)ϕ(⋅)ϕ(⋅)\phi(\cdot)Φ(⋅)Φ(⋅)\Phi(\cdot)

3
Klasyfikator z regulowaną precyzją vs przywołanie
Pracuję nad problemem klasyfikacji binarnej, w której znacznie ważniejsze jest, aby nie mieć fałszywych trafień; całkiem sporo fałszywych negatywów jest w porządku. Użyłem na przykład wielu klasyfikatorów w sklearn, ale myślę, że żaden z nich nie ma możliwości wyraźnego dostosowania kompromisu przywoływania precyzji (dają całkiem dobre wyniki, ale nie można …

2
Pytanie o ciągłą torbę słów
Mam problem ze zrozumieniem tego zdania: Pierwsza proponowana architektura jest podobna do sprzężenia zwrotnego NNLM, w którym nieliniowa warstwa ukryta jest usuwana, a warstwa projekcyjna jest wspólna dla wszystkich słów (nie tylko matrycy projekcyjnej); dlatego wszystkie słowa są rzutowane na tę samą pozycję (ich wektory są uśredniane). Czym jest warstwa …

2
Dlaczego powinniśmy usuwać sezonowość z szeregów czasowych?
Podczas pracy z szeregami czasowymi czasami wykrywamy i usuwamy sezonowość za pomocą analizy spektralnej. Jestem prawdziwym początkującym w szeregach czasowych i jestem zdezorientowany, dlaczego ktoś chciałby usunąć sezonowość z oryginalnej serii czasowej? Czy usunięcie sezonowości nie zakłóca oryginalnych danych? Jakie korzyści czerpiemy dzięki konstruowaniu szeregów czasowych poprzez usunięcie sezonowości?

2
Jaki rozkład zakłada dokładny test Fishera?
W swojej pracy widziałem kilka zastosowań dokładnego testu Fishera i zastanawiałem się, jak dobrze pasuje do moich danych. Patrząc na kilka źródeł, rozumiałem, jak obliczyć statystyki, ale nigdy nie widziałem jasnego i formalnego wyjaśnienia przyjętej hipotezy zerowej. Czy ktoś może mi wyjaśnić lub odesłać mnie do formalnego wyjaśnienia zakładanego podziału? …

2
Dlaczego warto korzystać z drzew decyzyjnych?
Czytałem trochę o algorytmach usprawniających dla zadań klasyfikacyjnych, aw szczególności Adaboost. Rozumiem, że celem Adaboost jest wzięcie kilku „słabych uczniów” i poprzez zestaw iteracji danych treningowych, popchnąć klasyfikatorów, aby nauczyli się przewidywać klasy, w których model (y) wielokrotnie popełnia błędy. Zastanawiałem się jednak, dlaczego w tak wielu odczytach wykorzystałem drzewa …

2
Dlaczego splot działa?
Wiem więc, że jeśli chcemy znaleźć rozkład prawdopodobieństwa sumy niezależnych zmiennych losowych X+YX+YX + Y , możemy obliczyć go z rozkładów prawdopodobieństwa XXX i , mówiąc:YYY fX+Y(a)=∫∞x=−∞fX,Y(X=x,Y=a−x) dx=∫∞x=−∞fX(x)fY(a−x) dxfX+Y(a)=∫x=−∞∞fX,Y(X=x,Y=a−x) dx=∫x=−∞∞fX(x)fY(a−x) dxf_{X + Y}(a) = \int_{x = -\infty}^{\infty} f_{X, Y}(X = x, Y = a - x)~dx = \int_{x = -\infty}^{\infty} …

1
Referencje i najlepsze praktyki dotyczące ustawiania nasion w pseudolosowym generowaniu liczb
W tym dokumencie , który dotyczy polecenia „ustaw ziarno”, ludzie Stata omawiają kwestie związane z ustawieniem nasion podczas generowania liczb pseudolosowych. Znamienne „nie” to „nie używaj szeregowo liczb naturalnych jako nasion, ponieważ ma to wzór i zagraża pseudolosowości”. Jedyną jedną czwartą żartobliwie godną uwagi „do” jest ustawienie tylko jednego ziarna …

2
Co to jest rozkład logarytmiczny?
Czytam podręcznik na temat uczenia maszynowego (Data Mining autorstwa Witten i wsp., 2011) i natknąłem się na ten fragment: ... Ponadto można zastosować różne rozkłady. Chociaż rozkład normalny jest zwykle dobrym wyborem dla atrybutów liczbowych, nie jest odpowiedni dla atrybutów, które mają z góry określone minimum, ale nie mają górnej …

2
Jak przeprowadzić analizę resztkową dla binarnych / dychotomicznych niezależnych predyktorów w regresji liniowej?
Przeprowadzam wielokrotną regresję liniową poniżej w R, aby przewidzieć zwrot z zarządzanego funduszu. reg <- lm(formula=RET~GRI+SAT+MBA+AGE+TEN, data=rawdata) Tutaj tylko GRI i MBA są predyktorami binarnymi / dychotomicznymi; pozostałe predyktory są ciągłe. Używam tego kodu do generowania wykresów resztkowych dla zmiennych binarnych. plot(rawdata$GRI, reg$residuals) abline(lm(reg$residuals~rawdata$GRI, data=rawdata), col="red") # regression line (y~x) …

3
Co jest dobrym AUC dla krzywej przywołania dokładności?
Ponieważ mam bardzo niezrównoważony zestaw danych (9% pozytywnych wyników), zdecydowałem, że krzywa przywołania dokładności jest bardziej odpowiednia niż krzywa ROC. Otrzymałem analogiczną miarę sumaryczną pola powierzchni pod krzywą PR (0,49, jeśli jesteś zainteresowany), ale nie jestem pewien, jak ją interpretować. Słyszałem, że 0,8 lub więcej to dobry AUC dla ROC, …

2
Jeśli szereg czasowy jest stacjonarny drugiego rzędu, czy oznacza to, że jest ściśle stacjonarny?
Proces jest ściśle stacjonarny, jeśli wspólny rozkład jest taki sam jak wspólny rozkład dla wszystkich m , dla wszystkich k i dla wszystkich t_1, t_2, ..., t_m .XtXtX_tXt1,Xt2,...,XtmXt1,Xt2,...,XtmX_{t_1},X_{t_2},...,X_{t_m}Xt1+k,Xt2+k,...,Xtm+kXt1+k,Xt2+k,...,Xtm+kX_{t_1+k},X_{t_2+k},...,X_{t_m+k}mmmkkkt1,t2,...,tmt1,t2,...,tmt_1,t_2,...,t_m Proces jest stacjonarny drugiego rzędu, jeśli jego średnia jest stała, a jego funkcja autokowariancji zależy tylko od opóźnienia. Czy zatem stacjonarne drugie …

2
Jakie jest maksymalne oszacowanie prawdopodobieństwa kowariancji dwuwymiarowych normalnych danych, gdy znana jest średnia i wariancja?
Załóżmy, że mamy losową próbkę z dwuwymiarowego rozkładu normalnego, który ma zera jako średnie i jedynki jako wariancje, więc jedynym nieznanym parametrem jest kowariancja. Co to jest MLE kowariancji? Wiem, że powinno to być coś takiego jak ale skąd to wiemy?1n∑nj = 1xjotyjot1n∑j=1nxjyj\frac{1}{n} \sum_{j=1}^{n}x_j y_j


1
regresja danych kątowych / kołowych
Nadzorowałem problem uczenia się, w którym cele są kątami. Gdybym zrobił prostą regresję, wówczas liczby 360 i 1 byłyby daleko dla mojego modelu, ale tak naprawdę są one bliskie, a przewidywanie współrzędnych xiy nie wydaje się właściwe, ponieważ próbuję tutaj przewidzieć tylko jedną liczbę. Jaki jest właściwy sposób rozwiązania takiego …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.