Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Najlepsze metody ekstrakcji czynnikowej w analizie czynnikowej
SPSS oferuje kilka metod ekstrakcji czynników: Główne składniki (które wcale nie są analizą czynnikową) Nieważone najmniejsze kwadraty Uogólnione najmniejsze kwadraty Maksymalne prawdopodobieństwo Głównej osi Faktoring alfa Faktoring obrazu Ignorując pierwszą metodę, która nie jest analizą czynnikową (ale analizą głównego składnika, PCA), która z tych metod jest „najlepsza”? Jakie są względne …

2
Różnica między naiwnymi Bayesami a wielomianowymi naiwnymi Bayesami
Wcześniej miałem do czynienia z klasyfikatorem Naive Bayes . Czytałem ostatnio o Multinomial Naive Bayes . Również prawdopodobieństwo późniejsze = (wcześniejsze * prawdopodobieństwo) / (dowód) . Jedyną podstawową różnicą (podczas programowania tych klasyfikatorów), którą znalazłem między Naive Bayes i Multinomial Naive Bayes, jest to, że Wielomian Naive Bayes oblicza prawdopodobieństwo, …

3
Interpretacja prostych prognoz na iloraz szans w regresji logistycznej
Nieco jestem nowy w stosowaniu regresji logistycznej i jestem nieco zdezorientowany rozbieżnością między moimi interpretacjami następujących wartości, które moim zdaniem byłyby takie same: wykładnicze wartości beta przewidywane prawdopodobieństwo wyniku przy użyciu wartości beta. Oto uproszczona wersja modelu, którego używam, gdzie niedożywienie i ubezpieczenie są zarówno binarne, a bogactwo jest ciągłe: …

1
SVD skorelowanej macierzy powinno być addytywne, ale nie wydaje się
Usiłuję tylko powtórzyć twierdzenie przedstawione w poniższym artykule Finding Correlated Biclusters z Gene Expression Data , czyli: Twierdzenie 4. Jeśli . Następnie mamy:Xjajot= RjadoT.jotXIJ=RICJTX_{IJ}=R_{I}C^{T}_{J} ja. Jeśli jest idealnym biclusterem z modelem addytywnym, to jest idealnym biclusterem z korelacją na kolumnach; ii. Jeśli jest idealnym bicluster z modelem addytywnym, to jest …

1
Różnice między modelem statystycznym a modelem prawdopodobieństwa?
Zastosowane prawdopodobieństwo jest ważną gałęzią prawdopodobieństwa, w tym prawdopodobieństwem obliczeniowym. Ponieważ statystyki wykorzystują teorię prawdopodobieństwa do konstruowania modeli do przetwarzania danych, w moim rozumieniu zastanawiam się, jaka jest zasadnicza różnica między modelem statystycznym a modelem prawdopodobieństwa? Model prawdopodobieństwa nie potrzebuje rzeczywistych danych? Dzięki.



3
Czym różni się rozkład Poissona od rozkładu normalnego?
Wygenerowałem wektor, który ma rozkład Poissona, jak następuje: x = rpois(1000,10) Jeśli wykonam histogram używając hist(x), rozkład wygląda jak znajomy rozkład normalny w kształcie dzwonu. Jednak w teście Kołmogorowa-Smirnoffa ks.test(x, 'pnorm',10,3)stwierdzono, że rozkład różni się znacznie od rozkładu normalnego z powodu bardzo małej pwartości. Moje pytanie brzmi zatem: czym różni …


2
Oblicz macierz przejścia (Markov) w R.
Czy istnieje sposób w R (funkcja wbudowana) do obliczenia macierzy przejścia dla łańcucha Markowa na podstawie zestawu obserwacji? Na przykład biorąc zestaw danych jak poniżej i obliczyć macierz przejścia pierwszego rzędu? dat<-data.frame(replicate(20,sample(c("A", "B", "C","D"), size = 100, replace=TRUE)))
29 r  markov-process 

3
Jakiego testu mogę użyć do porównania nachyleń z dwóch lub więcej modeli regresji?
Chciałbym przetestować różnicę w odpowiedzi dwóch zmiennych na jeden predyktor. Oto minimalny odtwarzalny przykład. library(nlme) ## gls is used in the application; lm would suffice for this example m.set <- gls(Sepal.Length ~ Petal.Width, data = iris, subset = Species == "setosa") m.vir <- gls(Sepal.Length ~ Petal.Width, data = iris, subset …

6
Interpretacja testu Shapiro-Wilka
Jestem całkiem nowy w statystyce i potrzebuję twojej pomocy. Mam małą próbkę, jak następuje: H4U 0.269 0.357 0.2 0.221 0.275 0.277 0.253 0.127 0.246 Przeprowadziłem test Shapiro-Wilk przy użyciu R: shapiro.test(precisionH4U$H4U) i otrzymałem następujący wynik: W = 0.9502, p-value = 0.6921 Teraz, jeśli założę, że poziom istotności na 0,05, niż …

2
Dopasowanie modelu ARIMAX z regularyzacją lub penalizacją (np. Z regresją lasso, elastyczną siatką lub kalenicą)
Korzystam z funkcji auto.arima () w pakiecie prognozy , aby dopasować modele ARMAX do różnych zmiennych towarzyszących. Jednak często mam dużą liczbę zmiennych do wyboru i zwykle kończę na ostatecznym modelu, który działa z ich podzbiorem. Nie lubię technik ad hoc do wybierania zmiennych, ponieważ jestem człowiekiem i podlegam tendencyjności, …

3
Dobre samouczki Gibbs i samouczki
Chcę się dowiedzieć, jak działa Gibbs Sampling i szukam dobrego papieru podstawowego do średnio zaawansowanego. Mam wykształcenie informatyczne i podstawową wiedzę statystyczną. Czy ktoś czytał wokół dobry materiał? gdzie się tego nauczyłeś? Dzięki
29 references  gibbs 


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.