Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Krok po kroku wdrożenie PCA w języku R przy użyciu samouczka Lindsay Smith
Pracuję w R poprzez doskonały samouczek PCA autorstwa Lindsay I Smith i utknąłem w ostatnim etapie. Poniższy skrypt R przenosi nas do etapu (na str. 19), na którym odtwarzane są oryginalne dane z (w tym przypadku pojedynczego) głównego elementu, który powinien dać wykres linii prostej wzdłuż osi PCA1 (biorąc pod …
13 r  pca 

3
Przekształcanie bardzo wypaczonych rozkładów
Załóżmy, że mam zmienną, której rozkład jest wypaczony w bardzo dużym stopniu pozytywnie, tak że pobranie logu nie będzie wystarczające, aby umieścić go w zakresie skośności dla rozkładu normalnego. Jakie są moje opcje w tym momencie? Co mogę zrobić, aby przekształcić zmienną w rozkład normalny?

1
Interpretacja geometryczna uogólnionego modelu liniowego
W przypadku modelu liniowego możemy uzyskać przyjemną geometryczną interpretację oszacowanego modelu za pomocą OLS: . jest rzutem y na przestrzeń rozpiętą na x, a reszta jest prostopadła do tej przestrzeni rozpiętej na x.y = x β + e r ey= x β+ ey=xβ+ey=x\beta+ey^= x β^+ e^y^=xβ^+e^\hat{y}=x\hat{\beta}+\hat{e}y^y^\hat{y}mi^e^\hat{e} Moje pytanie brzmi: czy …


1
Używanie MLE vs. OLS
Kiedy lepiej jest stosować oszacowanie maksymalnego prawdopodobieństwa zamiast zwykłych najmniejszych kwadratów? Jakie są zalety i ograniczenia każdego z nich? Staram się zebrać praktyczną wiedzę na temat tego, gdzie wykorzystać każdą z nich w typowych sytuacjach.


1
Estymacja parametru LogLikelihood dla liniowego Gaussowskiego filtra Kalmana
Napisałem kod, który potrafi filtrować Kalmana (używając wielu różnych filtrów typu Kalmana [Information Filter i in.]) Dla liniowej analizy przestrzeni stanu gaussowskiego dla n-wymiarowego wektora stanu. Filtry działają świetnie i otrzymuję niezłą wydajność. Jednak oszacowanie parametru za pomocą oszacowania wiarygodności logicznej mnie dezorientuje. Nie jestem statystykiem, ale fizykiem, więc proszę …

3
Czy powinienem używać Kernel Trick, gdy tylko jest to możliwe, do danych nieliniowych?
Niedawno dowiedziałem się o użyciu sztuczki jądra, która odwzorowuje dane na przestrzenie o wyższych wymiarach, próbując zlinearyzować dane w tych wymiarach. Czy są jakieś przypadki, w których powinienem unikać stosowania tej techniki? Czy to tylko kwestia znalezienia właściwej funkcji jądra? W przypadku danych liniowych nie jest to oczywiście pomocne, ale …


2
Kształt przedziałów ufności i predykcji dla regresji nieliniowej
Czy pasma ufności i prognozy wokół regresji nieliniowej powinny być symetryczne wokół linii regresji? Oznacza to, że nie przyjmują kształtu klepsydry, jak w przypadku pasm regresji liniowej. Dlaczego? Oto model: Oto rysunek: fa( x ) = ⎛⎝⎜⎜A - D1 + ( xdo)b⎞⎠⎟⎟+ DF(x)=(A−D1+(xC)B)+D F(x) = \left(\frac{A-D}{1 + \left(\frac x C\right)^B}\right) …


2
Test Dunnetta w R zwraca za każdym razem różne wartości
Korzystam z biblioteki R „multcomp” ( http://cran.r-project.org/web/packages/multcomp/ ) do obliczenia testu Dunnetta. Korzystam ze skryptu poniżej: Group <- factor(c("A","A","B","B","B","C","C","C","D","D","D","E","E","F","F","F")) Value <- c(5,5.09901951359278,4.69041575982343,4.58257569495584,4.79583152331272,5,5.09901951359278,4.24264068711928,5.09901951359278,5.19615242270663,4.58257569495584,6.16441400296898,6.85565460040104,7.68114574786861,7.07106781186548,6.48074069840786) data <- data.frame(Group, Value) aov <- aov(Value ~ Group, data) summary(glht(aov, linfct=mcp(Group="Dunnett"))) Teraz, jeśli uruchomię ten skrypt wiele razy w Konsoli R. Za każdym razem otrzymuję nieco inne …

2
Jaka jest maksymalna funkcja gęstości prawdopodobieństwa entropii dla dodatniej zmiennej ciągłej danej średniej i odchylenia standardowego?
Jaki jest maksymalny rozkład entropii dla dodatniej zmiennej ciągłej, biorąc pod uwagę jej pierwszy i drugi moment? Na przykład rozkład Gaussa jest maksymalnym rozkładem entropii dla zmiennej niezwiązanej, biorąc pod uwagę jego średnią i odchylenie standardowe, a rozkład gamma jest maksymalnym rozkładem entropii dla zmiennej dodatniej, biorąc pod uwagę jego …


2
ARIMA vs ARMA w zróżnicowanej serii
W R (2.15.2) dopasowałem raz ARIMA (3,1,3) na szeregu czasowym i raz ARMA (3,3) na raz zróżnicowanym szeregu czasowym. Dopasowane parametry różnią się, co przypisałem metodzie dopasowania w ARIMA. Ponadto dopasowanie ARIMA (3,0,3) do tych samych danych co ARMA (3,3) nie da identycznych parametrów, bez względu na zastosowaną metodę dopasowania. …
13 r  time-series  arima  fitting  arma 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.