Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Skośność logarytmu zmiennej losowej gamma
Rozważ losową zmienną gamma . Istnieją zgrabne wzory na średnią, wariancję i skośność:X∼Γ(α,θ)X∼Γ(α,θ)X\sim\Gamma(\alpha, \theta) E[X]Var[X]Skewness[X]=αθ=αθ2=1/α⋅E[X]2=2/α−−√E[X]=αθVar⁡[X]=αθ2=1/α⋅E[X]2Skewness⁡[X]=2/α\begin{align} \mathbb E[X]&=\alpha\theta\\ \operatorname{Var}[X]&=\alpha\theta^2=1/\alpha\cdot\mathbb E[X]^2\\ \operatorname{Skewness}[X]&=2/\sqrt{\alpha} \end{align} Rozważmy teraz zmienną losową przekształconą logarytmicznie . Wikipedia podaje wzory na średnią i wariancję:Y=log(X)Y=log⁡(X)Y=\log(X) E[Y]Var[Y]=ψ(α)+log(θ)=ψ1(α)E[Y]=ψ(α)+log⁡(θ)Var⁡[Y]=ψ1(α)\begin{align} \mathbb E[Y]&=\psi(\alpha)+\log(\theta)\\ \operatorname{Var}[Y]&=\psi_1(\alpha)\\ \end{align} poprzez funkcje digamma i trigamma, które są zdefiniowane jako pierwsza …

2
Jak obliczyć średnią długość przylegania do wegetarianizmu, gdy mamy tylko dane ankietowe na temat aktualnych wegetarian?
Badano losową próbę populacji. Zapytano ich, czy jedzą dietę wegetariańską. Jeśli odpowiedzieli „tak”, poproszono ich również o określenie, jak długo bez przerwy je dietę wegetariańską. Chcę wykorzystać te dane do obliczenia średniej długości przestrzegania zasady wegetarianizmu. Innymi słowy, kiedy ktoś zostaje wegetarianinem, chcę wiedzieć, że średnio długo pozostaje wegetarianinem. Załóżmy, …

1
Czy prywatna tabela liderów Kaggle jest dobrym predyktorem wydajności poza próbą zwycięskiego modelu?
Chociaż wyników prywatnego zestawu testowego nie można wykorzystać do dalszego udoskonalenia modelu, to czy wybór modelu z ogromnej liczby modeli przeprowadzanych na podstawie wyników prywatnego zestawu testowego nie jest możliwy? Czy nie sprawiłbyś, że dzięki temu samemu procesowi nadmierne dopasowanie do prywatnego zestawu testowego? Według „Pseudo-matematyki i finansowego szarlatanizmu: skutki …


4
Co uważa się za dobrą utratę logów?
Próbuję lepiej zrozumieć utratę logów i sposób, w jaki to działa, ale jedną rzeczą, której nie mogę znaleźć, jest umieszczenie numeru utraty logów w jakimś kontekście. Jeśli mój model ma utratę dziennika 0,5, czy to dobrze? Co uważa się za dobry i zły wynik? Jak zmieniają się te progi?

7
Dlaczego zniekształcone dane nie są preferowane do modelowania?
W większości przypadków, gdy ludzie mówią o transformacjach zmiennych (zarówno dla zmiennych predykcyjnych, jak i zmiennych odpowiedzi), dyskutują o sposobach leczenia skośności danych (takich jak transformacja logów, transformacja box i Cox itp.). Nie jestem w stanie zrozumieć, dlaczego usuwanie skośności jest uważane za tak powszechną najlepszą praktykę? W jaki sposób …

4
Co oznacza „as”?
Czytałem artykuł i zobaczyłem następujące zdanie: Dla danego Martingale, jeśli ma górną lub dolną granicę, to Martingale musi się zbiegać (as). Ponieważ prawdopodobieństwo jest zawsze nieujemne, 0 jest dolną granicą. Co oznacza „as”? Czy to powszechne zastosowanie? Domyślam się „asymptotycznie”, ale chciałbym to zweryfikować.

3
Co to jest model zerowy w regresji i jak ma się do hipotezy zerowej?
Co to jest model zerowy w regresji i jaki jest związek między modelem zerowym a hipotezą zerową? Dla mojego zrozumienia, czy to oznacza Używasz „średniej zmiennej odpowiedzi” do przewidywania zmiennej odpowiedzi ciągłej? Używasz „rozkładu etykiet” w przewidywaniu zmiennych dyskretnych odpowiedzi? W takim przypadku wydaje się, że brakuje powiązań między hipotezą …


1
Maksymalny odstęp między próbkami pobranymi bez zamiany z dyskretnego jednorodnego rozkładu
Ten problem jest związany z badaniami mojego laboratorium w zakresie robotów: Narysuj losowo liczb ze zbioru bez zamiany i posortuj liczby w porządku rosnącym. .n nn{ 1 , 2 , … , m } {1,2,…,m}\{1,2,\ldots,m\}1 ≤ n ≤ m1≤n≤m1\le n\le m Z tej posortowanej listy liczb wygeneruj różnicę między kolejnymi …

1
Jakie teorie przyczynowości powinienem wiedzieć?
Jakie teoretyczne podejścia do związku przyczynowego powinienem znać jako statystyczny / ekonometryczny? Znam (trochę) Model przyczynowy Neyman – Rubin (i Roy , Haavelmo itp.) Praca Pearl o przyczynowości Przyczynowość Grangera (choć mniej zorientowana na leczenie) Których koncepcji brakuje mi, czy powinienem być świadomy? Powiązane: Które teorie są podstawą przyczynowości w …


1
Tensory w literaturze dotyczącej sieci neuronowych: jaka jest najprostsza definicja?
W literaturze dotyczącej sieci neuronowych często spotykamy słowo „tensor”. Czy różni się od wektora? A z matrycy? Czy masz jakiś konkretny przykład, który wyjaśnia jego definicję? Jestem trochę zdezorientowany co do jego definicji. Wikipedia nie pomaga i czasami mam wrażenie, że jej definicja zależy od konkretnego używanego środowiska uczenia maszynowego …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.