Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Interpretacja wartości p w testowaniu hipotez
Niedawno natknąłem się na artykuł „Nieistotność zerowego testowania istotności hipotezy”, Jeff Gill (1999) . Autor podniósł kilka typowych nieporozumień dotyczących testowania hipotez i wartości p, na które mam dwa konkretne pytania: Wartość p jest technicznie P(observation|H0)P(observation|H0)P({\rm observation}|H_{0}) , co, jak wskazano w pracy, zasadniczo nie mówi nam nic o P(H0|observation)P(H0|observation)P(H_{0}|{\rm …

3
Jak uzyskać macierz wariancji-kowariancji współczynników w regresji liniowej
Czytam książkę o regresji liniowej i mam pewne problemy ze zrozumieniem macierzy wariancji-kowariancji :bb\mathbf{b} Elementy po przekątnej są dość łatwe, ale te o przekątnej są nieco trudniejsze, co mnie że σ( b0, b1) = E( b0b1) - E( b0) E( b1) = E( b0b1) - β0β1σ(b0,b1)=mi(b0b1)-mi(b0)mi(b1)=mi(b0b1)-β0β1 \sigma(b_0, b_1) = E(b_0 …
36 regression 

4
Dobre metody dla wykresów gęstości zmiennych nieujemnych w R?
plot(density(rexp(100)) Oczywiście cała gęstość na lewo od zera reprezentuje błąd. Chciałbym podsumować niektóre dane dla statystycznych i chcę uniknąć pytań o to, dlaczego dane nieujemne mają gęstość na lewo od zera. Wykresy służą do sprawdzania losowości; Chcę pokazać rozkład zmiennych według grup leczenia i kontroli. Rozkłady są często wykładnicze. Histogramy …

3
Rzeczy do rozważenia na temat programów magisterskich w statystyce
Jest sezon przyjęć do szkół wyższych. Ja (i wielu studentów takich jak ja) próbuję teraz zdecydować, który program statystyczny wybrać. Jakie rzeczy sugerują ci, którzy pracują ze statystykami, na temat programów magisterskich w statystyce? Czy są częste pułapki lub błędy, które popełniają uczniowie (być może w odniesieniu do reputacji szkoły)? …

6
Dlaczego „wyjaśnianie” ma sens intuicyjny?
Niedawno dowiedziałem się o zasadzie rozumowania probabilistycznego zwanej „ wyjaśnianiem ” i staram się pojąć w tym intuicję. Pozwól, że przygotuję scenariusz. Niech AAA będzie wydarzeniem, w którym ma miejsce trzęsienie ziemi. Niech wydarzenie BBB będzie wydarzeniem, gdy wesoły zielony gigant spaceruje po mieście. Niech CCC będzie wydarzeniem, w którym …

6
Jak mogę analitycznie udowodnić, że losowy podział kwoty powoduje wykładniczy rozkład (np. Dochodu i majątku)?
W bieżącym artykule w NAUCE proponuje się: Załóżmy, że losowo dzielisz 500 milionów dochodów na 10 000 osób. Jest tylko jeden sposób na zapewnienie wszystkim równych 50 000 udziałów. Jeśli więc losujesz pieniądze, równość jest bardzo mało prawdopodobna. Ale istnieją niezliczone sposoby, aby dać kilku osobom dużo gotówki, a wielu …

4
Gdzie jest
Bardzo prosta wersja centralnego ograniczonego twierdzenia, jak poniżej n−−√((1n∑i=1nXi)−μ) →d N(0,σ2)n((1n∑i=1nXi)−μ) →d N(0,σ2) \sqrt{n}\bigg(\bigg(\frac{1}{n}\sum_{i=1}^n X_i\bigg) - \mu\bigg)\ \xrightarrow{d}\ \mathcal{N}(0,\;\sigma^2) czyli Lindeberg – Lévy CLT. Nie rozumiem, dlaczegopo lewej stronieznajduje się. A Lyapunov CLT mówi ale dlaczego nie? Czy ktoś powiedziałby mi, jakie są te czynniki, takie jaki? jak uzyskać je …



3
Tworzysz „wynik pewności” z głosów w losowych lasach?
Chcę wyszkolić klasyfikatora, który będzie rozróżniał Type Ai Type Bprzedmioty przy pomocy dość dużego zestawu szkoleniowego złożonego z około 10 000 obiektów, z których około połowa jest, Type Aa połowa z nich jest Type B. Zestaw danych składa się ze 100 ciągłych elementów wyszczególniających właściwości fizyczne komórek (rozmiar, średni promień …

4
Jak dopasować regresję ograniczoną w R, aby współczynniki ogółem = 1?
Widzę tutaj podobną ograniczoną regresję: Ograniczona regresja liniowa przez określony punkt ale moje wymagania są nieco inne. Potrzebuję współczynników do zsumowania 1. W szczególności regresuję zwroty z 1 serii walut obcych w stosunku do 3 innych serii walutowych, aby inwestorzy mogli zastąpić ekspozycję na tej serii kombinacją ekspozycji na pozostałe …
36 r  regression 

2
Jaki jest rozkład sumy zmiennych nie iid gaussowskich?
Jeśli jest dystrybuowane , jest dystrybuowane i , wiem, że jest dystrybuowane jeśli X i Y są niezależne.XXXN(μX,σ2X)N(μX,σX2)N(\mu_X, \sigma^2_X)YYYN(μY,σ2Y)N(μY,σY2)N(\mu_Y, \sigma^2_Y)Z=X+YZ=X+YZ = X + YZZZN(μX+μY,σ2X+σ2Y)N(μX+μY,σX2+σY2)N(\mu_X + \mu_Y, \sigma^2_X + \sigma^2_Y) Ale co by się stało, gdyby X i Y nie były niezależne, tj. (X,Y)≈N((μXμY),(σ2XσX,YσX,Yσ2Y))(X,Y)≈N((μXμY),(σX2σX,YσX,YσY2))(X, Y) \approx N\big( (\begin{smallmatrix} \mu_X\\\mu_Y \end{smallmatrix}) , …

5
Wzrost miary w eksploracji danych
Przeszukałem wiele stron internetowych, aby dowiedzieć się, co dokładnie zrobi winda? Wszystkie znalezione przeze mnie wyniki dotyczyły używania go w aplikacjach innych niż samo. Wiem o funkcji wsparcia i zaufania. Z Wikipedii, w eksploracji danych, lift jest miarą wydajności modelu w przewidywaniu lub klasyfikowaniu przypadków, mierząc w stosunku do modelu …

5
Funkcje czasowe w R [zamknięte]
Chciałbym zmierzyć czas potrzebny do powtórzenia działania funkcji. Czy replicate()używanie pętli for jest równoważne? Na przykład: system.time(replicate(1000, f())); system.time(for(i in 1:1000){f()}); Która jest preferowaną metodą. Na wyjściu system.time(), to sys+userrzeczywisty czas CPU na uruchomienie programu? Czy elapseddobra miara wydajności programu w czasie?
36 r 

8
W jakich warunkach należy stosować analizę wielopoziomową / hierarchiczną?
W jakich warunkach należy rozważyć zastosowanie analizy wielopoziomowej / hierarchicznej zamiast analiz bardziej podstawowych / tradycyjnych (np. ANOVA, regresja OLS itp.)? Czy istnieją sytuacje, w których można to uznać za obowiązkowe? Czy istnieją sytuacje, w których stosowanie analizy wielopoziomowej / hierarchicznej jest nieodpowiednie? Wreszcie, jakie są dobre zasoby dla początkujących …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.