Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Zmienne losowe, dla których nierówności Markowa i Czebyszewa są ścisłe
Interesuje mnie konstruowanie zmiennych losowych, dla których nierówności Markowa lub Czebyszewa są ścisłe. Trywialnym przykładem jest następująca zmienna losowa. P.( X= 1 ) = P.( X= - 1 ) = 0,5P(X=1)=P(X=−1)=0.5P(X=1)=P(X=-1) = 0.5 . Jego średnia wynosi zero, wariancja wynosi 1, a . W tym przypadku zmienna losowa Czebyszewa jest …

2
Czy dozwolone jest stosowanie średnich dla zbioru danych w celu poprawy korelacji?
Mam zestaw danych z zależną i niezależną zmienną. Oba nie są szeregami czasowymi. Mam 120 obserwacji. Współczynnik korelacji wynosi 0,43 Po tych obliczeniach dodałem kolumnę dla obu zmiennych ze średnią dla każdych 12 obserwacji, w wyniku czego otrzymałem 2 nowe kolumny ze 108 obserwacjami (parami). Współczynnik korelacji tych kolumn wynosi …


2
Regresja na dysku jednostkowym, zaczynając od próbek „równomiernie rozmieszczonych”
Muszę rozwiązać skomplikowany problem regresji na dysku jednostki. Oryginalne pytanie przyciągnęło kilka interesujących komentarzy, ale niestety nie otrzymano odpowiedzi. Tymczasem nauczyłem się czegoś więcej na temat tego problemu, dlatego spróbuję podzielić oryginalny problem na podproblemy i zobaczę, czy tym razem będę miał więcej szczęścia. Mam 40 czujników temperatury regularnie rozmieszczonych …

1
Bayesowskie wykrywanie punktów wymiany w Internecie (marginalny rozkład predykcyjny)
Czytam internetowy dokument wykrywający punkt wymiany w Bayesian przez Adamsa i MacKaya ( link ). Autorzy zaczynają od napisania krańcowego rozkładu predykcyjnego: gdzieP(xt+1|x1:t)=∑rtP(xt+1|rt,x(r)t)P(rt|x1:t)(1)P(xt+1|x1:t)=∑rtP(xt+1|rt,xt(r))P(rt|x1:t)(1) P(x_{t+1} | \textbf{x}_{1:t}) = \sum_{r_t} P(x_{t+1} | r_t, \textbf{x}_t^{(r)}) P(r_t | \textbf{x}_{1:t}) \qquad \qquad (1) xtxtx_t jest obserwacją w czasie ;ttt x1:tx1:t\textbf{x}_{1:t} oznacza zestaw obserwacji do czasu …

1
Czy ktoś może wyjaśnić, jak mam 5 lat, ten problem na podstawie książki ESL Hastie?
Pracuję nad książką ESL Hastie i mam trudności z pytaniem 2.3. Pytanie jest następujące: Rozważamy oszacowanie najbliższego sąsiada w punkcie początkowym, a to równanie podaje medianę odległości od początku do najbliższego punktu danych. Nie mam pojęcia, od czego zacząć, jeśli chodzi o próbę uzyskania tego. Wiem, że większość punktów danych …

2
Czy Poisson i podstawowy Poisson są obcinane przez zero, czy zagnieżdżone?
Widziałem wiele, które dyskutują, czy podstawowa regresja Poissona jest zagnieżdżoną wersją zerowej regresji Poissona. Na przykład ta strona twierdzi, że tak jest, ponieważ ta ostatnia zawiera dodatkowe parametry w celu modelowania dodatkowych zer, ale poza tym zawiera te same parametry regresji Poissona, co pierwsza, chociaż strona zawiera odwołanie, które się …

1
Jak optymalnie rozłożyć losowania przy obliczaniu wielu oczekiwań
Załóżmy, że chcemy obliczyć pewne oczekiwania: EYEX|Y[f(X,Y)]EYEX|Y[f(X,Y)]E_YE_{X|Y}[f(X,Y)] Załóżmy, że chcemy to przybliżyć za pomocą symulacji Monte Carlo. EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)E_YE_{X|Y}[f(X,Y)] \approx \frac1{RS}\sum_{r=1}^R\sum_{s=1}^Sf(x^{r,s},y^r) ALE załóżmy, że pobieranie próbek z obu rozkładów jest kosztowne, dlatego możemy sobie pozwolić tylko na narysowanie stałej liczby KKK. Jak powinniśmy przydzielić KKK? Przykłady obejmująK/2K/2K/2 losuje do każdego rozkładu, …

6
Chciałbym nauczyć się teorii prawdopodobieństwa, teorii miary i wreszcie uczenia maszynowego. Gdzie zaczynam? [Zamknięte]
Zamknięte . To pytanie musi być bardziej skoncentrowane . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby skupiało się tylko na jednym problemie, edytując ten post . Zamknięte 3 lata temu . Chciałbym nauczyć się teorii prawdopodobieństwa, teorii miary i wreszcie uczenia maszynowego. Moim ostatecznym celem jest …

1
Łatwiejszy sposób na znalezienie ?
Rozważ 3 próbki pobrane z rozkładu jednolitego , gdzie jest parametrem. Chcę znaleźć gdzie to statystyka zamówień .u(θ,2θ)u(θ,2θ)u(\theta, 2\theta)θθ\thetaE [X( 2 )|X( 1 ),X( 3 )]E[X(2)|X(1),X(3)] \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] X( i )X(i)X_{(i)}jaii Spodziewałbym się, że wynikiem będzie Ale jedynym sposobem na pokazanie tego wyniku wydaje się być zbyt długo, nie …


1
Jak działa liniowy uczeń w wzmacnianiu? A jak to działa w bibliotece xgboost?
Wiem, jak zaimplementować liniową funkcję celu i liniowe wzmocnienia w XGBoost. Moje konkretne pytanie brzmi: kiedy algorytm pasuje do resztkowego (lub ujemnego gradientu), czy używa jednej cechy na każdym etapie (tj. Modelu jednoczynnikowego) czy wszystkich cech (model wielowymiarowy)? Będziemy wdzięczni za wszelkie odniesienia do dokumentacji dotyczącej liniowych wzmocnień w XGBoost. …


2
Modelowanie meloników do krykieta wydostających się z nieba
Mam zestaw danych opisujący dużą liczbę gier w krykieta (kilka tysięcy). W krykieta „meloniki” wielokrotnie rzucają piłkę z rzędu „pałkarzy”. Melonik próbuje wydostać pałkarza na zewnątrz. Pod tym względem przypomina miotacze i pałkarzy w baseballu. Gdybym wziął cały zestaw danych i podzielił całkowitą liczbę piłek, które wydały odbijającego przez całkowitą …

1
Rozkład kwadratowej postaci normalnej
Próbuję ustalić rozkład gdzie , iid wiem, że biorąc każdy z tych warunków osobno, i Ale nie jestem pewien co do dystrybucji (*)(n−1)∑i=1nZ2i−(∑i=1nZi)2(∗)(n−1)∑i=1nZi2−(∑i=1nZi)2(∗) (n-1) \sum_{i=1}^n Z_i^2 - \left( \sum_{i=1}^n Z_i \right)^2 \qquad (*) Zi∼N(0,1)Zi∼N(0,1)Z_i \sim \mathcal{N}(0,1)∑i=1nZ2i∼χ2(n)∑i=1nZi2∼χ2(n) \sum_{i=1}^n Z_i^2 \sim \chi^2(n) 1n(∑i=1nZi)2∼χ2(1).1n(∑i=1nZi)2∼χ2(1). \frac{1}{n}\left( \sum_{i=1}^n Z_i \right)^2 \sim \chi^2(1).

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.