Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Wyprowadzanie całkowitej (w ramach klasy + między klasami) macierzy rozproszenia
Bawiłem się metodami PCA i LDA i utknąłem w pewnym momencie, mam wrażenie, że jest to tak proste, że nie widzę tego. Macierze rozproszenia wewnątrz klasy ( ) i między klasami ( S_B ) są zdefiniowane jako:S BSWSWS_WSBSBS_B SW=∑i=1C∑t=1N(xit−μi)(xit−μi)TSW=∑i=1C∑t=1N(xti−μi)(xti−μi)T S_W = \sum_{i=1}^C\sum_{t=1}^N(x_t^i - \mu_i)(x_t^i - \mu_i)^T SB=∑i=1CN(μi−μ)(μi−μ)TSB=∑i=1CN(μi−μ)(μi−μ)T S_B = \sum_{i=1}^CN(\mu_i-\mu)(\mu_i-\mu)^T …


3
Jaka jest różnica między użyciem aov () i lme () w analizie podłużnego zestawu danych?
Czy ktoś może mi powiedzieć różnicę między używaniem aov()i lme()do analizy danych podłużnych a sposobem interpretacji wyników z tych dwóch metod? Poniżej analizuję tego samego zestawu danych przy użyciu aov()i lme()otrzymał 2 różne wyniki. Z tym aov(), że uzyskałem znaczący wynik w czasie dzięki interakcji leczenia, ale dopasowując liniowy model …

2
Model szacowania gęstości zaludnienia
Baza danych (populacja, powierzchnia, kształt) może być wykorzystana do mapowania gęstości zaludnienia poprzez przypisanie stałej wartości populacji / obszaru do każdego kształtu (który jest wielokątem, takim jak blok spisu, obszar, okręg, stan, cokolwiek innego). Jednak populacje zwykle nie są równomiernie rozmieszczone w obrębie swoich wielokątów. Mapowanie dasymetryczne to proces udoskonalania …

2
Wyjaśnij dostosowanie modelu, w prostym języku angielskim
Czytając o metodach i wynikach analizy statystycznej, szczególnie w epidemiologii, bardzo często słyszę o dostosowaniu lub kontroli modeli. Jak wytłumaczyłbyś niestatystycznemu cel tego? Jak interpretujesz swoje wyniki po kontrolowaniu pewnej zmiennej? Mały spacer po Stata lub R, lub wskaźnik do jednego online, byłby prawdziwym klejnotem.

1
Jak określić wielkość próbki potrzebnej do powtórzenia pomiaru ANOVA?
Potrzebuję pomocy w zakresie powtarzania pomiaru ANOVA. Badamy wpływ niektórych interwencji na zmniejszenie częstości zakażeń krwiobiegu (BSI) na niektórych oddziałach. Planujemy przechwytywać informacje o stawkach BSI co miesiąc, najpierw 12 miesięcy bez interwencji, a następnie 12 miesięcy z interwencją. Myślimy o wykonaniu ANOVA dla szeregów czasowych lub powtarzanych pomiarów, wolę …


1
Jak entropia zależy od lokalizacji i skali?
Entropia ciągłego rozkładu z funkcją gęstości faff określa się jako ujemny z oczekiwaniem log( f) ,log⁡(f),\log(f), a zatem jest równa H.fa= - ∫∞- ∞log( f( x ) ) f( x ) d x .Hf=−∫−∞∞log⁡(f(x))f(x)dx.H_f = -\int_{-\infty}^{\infty} \log(f(x)) f(x)\mathrm{d}x. Także, że każdej zmiennej losowej XXX , której rozkład jest gęstości faff …

3
Gdzie jest bomba: Jak oszacować prawdopodobieństwo, biorąc pod uwagę sumy wierszy i kolumn?
To pytanie jest inspirowane minigierką Pokemon Soulsilver: Wyobraź sobie, że na tym obszarze 5x6 jest ukrytych 15 bomb (EDYCJA: maksymalnie 1 bomba / komórka): Jak oszacowałbyś prawdopodobieństwo znalezienia bomby na określonym polu, biorąc pod uwagę sumy wierszy / kolumn? Jeśli spojrzysz na kolumnę 5 (suma bomb = 5), możesz pomyśleć: …

5
Algorytm losowego lasu i drzewa decyzyjnego
Losowy las to zbiór drzew decyzyjnych według koncepcji workowania. Kiedy przechodzimy z jednego drzewa decyzyjnego do następnego drzewa decyzyjnego, w jaki sposób informacje zdobyte przez ostatnie drzewo decyzyjne przechodzą do następnego? Ponieważ, zgodnie z moim zrozumieniem, nie ma nic takiego jak wyszkolony model, który jest tworzony dla każdego drzewa decyzyjnego, …

1
Czy dla REML istnieje interpretacja bayesowska?
Czy dostępna jest bayesowska interpretacja REML? Według mojej intuicji, REML ma silne podobieństwo do tak zwanych empirycznych procedur estymacji Bayesa i zastanawiam się, czy wykazano jakąś asymptotyczną równoważność (powiedzmy, w ramach odpowiedniej klasy priorytetów). Zarówno empiryczne Bayesa, jak i REML wydają się na przykład „kompromitowanym” podejściem estymacyjnym podejmowanym na przykład …

1
Dlaczego w Random Forest losowy podzbiór funkcji jest wybierany na poziomie węzła, a nie na poziomie drzewa?
Moje pytanie: Dlaczego losowy las rozważa losowe podzbiory funkcji do podziału na poziomie węzłów w obrębie każdego drzewa, a nie na poziomie drzewa ? Tło: To jest pytanie historyczne. Tin Kam Ho opublikował ten artykuł na temat budowy „lasów decyzyjnych”, losowo wybierając podzbiór cech do uprawy każdego drzewa w 1998 …

3
Jak dopasować splajn do danych zawierających wartości i 1. / 2. pochodną?
Mam zestaw danych, który zawiera, powiedzmy, kilka pomiarów pozycji, prędkości i przyspieszenia. Wszystkie pochodzą z tego samego „biegu”. Mógłbym zbudować układ liniowy i dopasować wielomian do wszystkich tych pomiarów. Ale czy mogę zrobić to samo z splajnami? W jaki sposób można to zrobić? Oto kilka symulowanych danych, które chciałbym dopasować: …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.