Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Przyczyny normalnej dystrybucji danych
Jakie są niektóre twierdzenia, które mogą wyjaśnić (tj. Generalnie), dlaczego można oczekiwać normalnej dystrybucji danych w świecie rzeczywistym? Są dwa, które znam: Centralne twierdzenie graniczne (oczywiście), które mówi nam, że suma kilku niezależnych zmiennych losowych o średniej i wariancji (nawet jeśli nie są one identycznie rozmieszczone) zmierza w kierunku rozkładu …

4
Czym dokładnie są chwile? Jak powstają?
Zazwyczaj wprowadzamy się do metody estymatorów momentów poprzez „zrównanie momentów populacyjnych z ich odpowiednikiem próbki”, dopóki nie oszacujemy wszystkich parametrów populacji; tak, że w przypadku rozkładu normalnego potrzebowalibyśmy tylko pierwszego i drugiego momentu, ponieważ w pełni opisują ten rozkład. E(X)=μ⟹∑ni=1Xi/n=X¯E(X)=μ⟹∑i=1nXi/n=X¯E(X) = \mu \implies \sum_{i=1}^n X_i/n = \bar{X} E(X2)=μ2+σ2⟹∑ni=1X2i/nE(X2)=μ2+σ2⟹∑i=1nXi2/nE(X^2) = \mu^2 …


4
Czy średnia = mediana oznacza, że ​​rozkład unimodalny jest symetryczny?
W przypadku rozkładu unimodalnego, jeśli średnia = mediana, wystarczy powiedzieć, że rozkład jest symetryczny? Wikipedia mówi w związku między średnią a medianą: „Jeśli rozkład jest symetryczny, średnia jest równa medianie, a rozkład będzie miał zerową skośność. Jeśli ponadto rozkład jest jednomodalny, wówczas średnia = mediana = tryb. Tak jest w …

2
Uogólnione modele addytywne - kto je bada oprócz Simona Wooda?
Coraz częściej używam GAM. Kiedy idę, aby podać odniesienia do ich różnych składników (wybór parametrów wygładzania, różne podstawy splajnu, wartości p gładkich wyrażeń), wszystkie pochodzą od jednego badacza - Simona Wooda z University of Bath w Anglii. Jest także opiekunem mgcvw R, który realizuje swoją pracę. mgcvjest niezwykle złożony, ale …

2
Co oznacza nazwa „regresja logistyczna”?
Mam sprawdzanie implementację regresja logistyczna z tutaj . Po przeczytaniu tego artykułu wydaje się, że ważną częścią jest znalezienie najlepszych współczynników do określenia funkcji sigmoidalnej. Zastanawiam się więc, dlaczego ta metoda nazywa się „regresją logistyczną”. Czy jest to związane z funkcją logarytmiczną? Może potrzebuję informacji historycznych, aby lepiej to zrozumieć.

2
Obliczanie błędu standardowego po transformacji dziennika
Rozważ losowy zestaw liczb, które są zwykle dystrybuowane: x <- rnorm(n=1000, mean=10) Chcielibyśmy poznać średnią i błąd standardowy średniej, dlatego wykonujemy następujące czynności: se <- function(x) { sd(x)/sqrt(length(x)) } mean(x) # something near 10.0 units se(x) # something near 0.03 units Świetny! Załóżmy jednak, że niekoniecznie wiemy, że nasza pierwotna …

2
Jak interpretować PCA na danych szeregów czasowych?
Próbuję zrozumieć zastosowanie PCA w niedawnym artykule w czasopiśmie zatytułowanym „Mapowanie aktywności mózgu na dużą skalę za pomocą obliczeń klastrowych” Freeman i in., 2014 (bezpłatny plik pdf dostępny na stronie laboratorium ). Używają PCA do danych szeregów czasowych i wykorzystują wagi PCA do stworzenia mapy mózgu. Dane to średnie dane …



1
Jak mogę „uchylić” pozycję geom_point w ggplot2?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Używam ggplot2 w R do tworzenia wykresów takich jak te: Paski błędów nakładają się na siebie, co wygląda na bardzo niechlujne. Jak mogę oddzielić paski …

4
Potrzebny jest dobry przykład danych z zmienną towarzyszącą poddaną leczeniu
Przejrzałem wiele zestawów danych R, wpisów w DASL i innych miejscach i nie znajduję zbyt wielu dobrych przykładów interesujących zestawów danych ilustrujących analizę kowariancji danych eksperymentalnych. Istnieje wiele „zabawkowych” zbiorów danych z wymyślonymi danymi w podręcznikach statystycznych. Chciałbym mieć przykład, w którym: Dane są prawdziwe, z ciekawą historią Istnieje co …


1
Brak normalizacji danych przed PCA daje lepiej wyjaśniony współczynnik wariancji
Znormalizowałem mój zestaw danych, a następnie uruchomiłem 3-składnikowy PCA, aby uzyskać małe wyjaśnione współczynniki wariancji ([0,50, 0,1, 0,05]). Kiedy nie znormalizowałem, ale wybieliłem mój zestaw danych, a następnie uruchomiłem 3-składnikowy PCA, otrzymałem wysokie wyjaśnione współczynniki wariancji ([0,86, 0,06,0,01]). Ponieważ chcę zachować tyle danych w 3 komponentach, czy NIE powinienem normalizować …
19 pca 

2
Konstruowanie dyskretnego rv mającego jako wsparcie wszystkie racjonalne argumenty w
To jest konstruktywistyczna kontynuacja tego pytania . Jeśli nie możemy mieć dyskretnej jednorodnej zmiennej losowej mającej wszystkie racjonalności w przedziale [0,1][0,1][0,1] , to następną najlepszą rzeczą jest: Skonstruuj losową zmienną QQQ która ma to wsparcie, Q∈Q∩[0,1]Q∈Q∩[0,1]Q\in \mathbb{Q}\cap[0,1] i która ma pewien rozkład. I rzemieślnik we mnie wymaga, aby ta zmienna …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.