Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Prognozowanie szeregów czasowych R za pomocą sieci neuronowej, auto.arima i ets
Słyszałem trochę o używaniu sieci neuronowych do prognozowania szeregów czasowych. Jak mogę porównać, która metoda prognozowania moich szeregów czasowych (dziennych danych detalicznych) jest lepsza: auto.arima (x), ets (x) lub nnetar (x). Mogę porównać auto.arima z ets przez AIC lub BIC. Ale jak mogę je porównać z sieciami neuronowymi? Na przykład: …

1
Ocenianie wydajności modelu regresji za pomocą zestawów szkoleniowych i testowych?
Często słyszę o ocenie wydajności modelu klasyfikacyjnego poprzez trzymanie zestawu testowego i szkolenie modelu na zestawie treningowym. Następnie tworzymy 2 wektory, jeden dla przewidywanych wartości i jeden dla prawdziwych wartości. Oczywiście dokonanie porównania pozwala ocenić wydajność modelu na podstawie jego mocy predykcyjnej przy użyciu takich parametrów, jak F-Score, statystyki Kappa, …

4
W jaki sposób test t może być statystycznie istotny, jeśli średnia różnica wynosi prawie 0?
Próbuję porównać dane z 2 populacji, aby stwierdzić, czy różnica między terapiami jest statystycznie znacząca. Zestawy danych wydają się być normalnie rozmieszczone z bardzo niewielką różnicą między tymi dwoma zestawami. Średnia różnica wynosi 0,00017. Przeprowadziłem sparowany test t, spodziewając się, że nie odrzucę hipotezy zerowej o braku różnicy między średnimi, …

1
Podejścia Bayesa i Fishera do liniowej analizy dyskryminacyjnej
Znam 2 podejścia do zrobienia LDA, podejście bayesowskie i podejście Fishera . Załóżmy, że mamy dane (x,y)(x,y)(x,y) , gdzie xxx jest predyktorem ppp wymiarowym, a yyy jest zmienną zależnąKKKklas K. Metodą bayesowską obliczamy tylne p(yk|x)=p(x|yk)p(yk)p(x)∝p(x|yk)p(yk)p(yk|x)=p(x|yk)p(yk)p(x)∝p(x|yk)p(yk)p(y_k|x)=\frac{p(x|y_k)p(y_k)}{p(x)}\propto p(x|y_k)p(y_k), i jak powiedziano w książkach, zakładamy, żep(x|yk)p(x|yk)p(x|y_k)jest gaussowską, mamy teraz funkcję dyskryminacyjną dlakkktej klasy …

1
Jak zgłosić test Manna – Whitneya?
Robię rozprawę i przeprowadzam szereg testów. Po zastosowaniu testu Kruskala – Wallisa zwykle zgłaszam taki wynik: Jest znacząca różnica (χ2(2)=7.448,p=.024)(χ(2)2=7.448,p=.024)(\chi^2_{(2)}=7.448, p=.024) między środkami ... Ale teraz przeprowadziłem test Manna – Whitneya i nie jestem pewien, jakie wartości przedstawić. SPSS daje mi Manna-Whitneya UUU , Wilcoxona , i -value. Czy przedstawiam …

2
Dlaczego warto korzystać z Bonferroni zamiast Holm-Bonferroni?
Rozumiem, dlaczego nie możesz zastosować mocniejszej metody, takiej jak metoda Hochberga, zamiast korekcji Bonferroniego, ponieważ mogą one mieć dodatkowe założenia, takie jak niezależność hipotez w tym przypadku, ale nie rozumiem, dlaczego miałbyś używajcie zawsze korekty Bonferroniego w stosunku do sekwencyjnie odrzucającej modyfikacji Holma, ponieważ ta ostatnia jest potężniejsza i nie …

3
Pojęcie „udowodnione statystycznie”
Kiedy wiadomości mówią o „udowodnieniu statystycznym”, czy używają prawidłowo zdefiniowanej koncepcji statystyki, źle ją stosują, czy po prostu używają oksymoronu? Wyobrażam sobie, że „dowód statystyczny” nie jest w rzeczywistości czymś wykonywanym w celu udowodnienia hipotezy, ani dowodu matematycznego, ale raczej „testem statystycznym”.
10 inference  proof 

2
Jaka jest dobra analogia do zilustrowania mocnych stron hierarchicznych modeli bayesowskich?
Jestem stosunkowo nowy w statystyce bayesowskiej i ostatnio korzystam z JAGS do tworzenia hierarchicznych modeli bayesowskich na różnych zestawach danych. Chociaż jestem bardzo zadowolony z wyników (w porównaniu ze standardowymi modelami glm), muszę wyjaśnić niestatystom, czym różni się od standardowych modeli statystycznych. W szczególności chciałbym zilustrować, dlaczego i kiedy HBM …

1
Dlaczego
W zestawie problemów udowodniłem ten „lemat”, którego wynik nie jest dla mnie intuicyjny. ZZZ jest standardowym rozkładem normalnym w modelu ocenzurowanym. Formalnie, Z∗∼Norm(0,σ2)Z∗∼Norm(0,σ2)Z^* \sim Norm(0, \sigma^2) , a Z=max(Z∗,c)Z=max(Z∗,c)Z = max(Z^*, c) . Następnie E[Z|Z>c]=∫∞cziϕ(zi)dzi=12π−−√∫∞cziexp(−12z2i)dzi=12π−−√exp(−12c2) (Integration by substitution)=ϕ(c)E[Z|Z>c]=∫c∞ziϕ(zi)dzi=12π∫c∞ziexp(−12zi2)dzi=12πexp(−12c2) (Integration by substitution)=ϕ(c)\begin{align} E[Z|Z>c] &= \int_c^\infty z_i \phi({z_i})\mathrm{d}z_i \\ &= \frac{1}{\sqrt{2\pi}}\int_c^\infty z_i …

1
Dopasowywanie rozkładu do danych przestrzennych
Cross wysyłając moje pytanie z matematyki, aby znaleźć pomoc dotyczącą statystyk. Badam fizyczny proces generujący dane, które ładnie rzutują na dwa wymiary o wartościach nieujemnych. Każdy proces ma (rzutowaną) ścieżkę punktów - y - patrz obrazek poniżej.xxxyyy Przykładowe ścieżki są niebieskie, kłopotliwy typ ścieżki został narysowany ręcznie na zielono, a …


1
Jaka jest podstawowa różnica między tymi dwoma modelami regresji?
Załóżmy, że mam odpowiedzi dwuwymiarowe ze znaczną korelacją. Próbuję porównać dwa sposoby modelowania tych wyników. Jednym ze sposobów jest modelowanie różnicy między dwoma wynikami: Innym sposobem jest użycie lub ich: ( y i j = β 0 + czas + X ′ β )(yi2−yi1=β0+X′β)(yi2−yi1=β0+X′β)(y_{i2}-y_{i1}=\beta_0+X'\beta)glsgee(yij=β0+time+X′β)(yij=β0+time+X′β)(y_{ij}=\beta_0+\text{time}+X'\beta) Oto przykład foo: #create foo data …

2
Co się stanie w teście t dla jednej próbki, jeśli w estymatorze wariancji średnia próbki zostanie zastąpiona przez
Załóżmy test t dla jednej próbki, w którym hipoteza zerowa wynosi μ = μ0μ=μ0\mu=\mu_0 . Statystyka wynosi wtedy t = x¯¯¯-μ0s / n√t=x¯-μ0s/nt=\frac{\overline{x}-\mu_0}{s/\sqrt{n}} używając przykładowego odchylenia standardowegosss. Przy szacowaniusssporównuje się obserwacje ze średnią próbkix¯¯¯x¯\overline{x}: .s = 1n - 1∑ni = 1( xja- x¯¯¯)2)---------------√s=1n-1∑ja=1n(xja-x¯)2)s=\sqrt{\frac{1}{n-1}\sum_{i=1}^n (x_i-\overline{x})^2} Jeśli jednak założymy, że dane jest …

2
Czy istnieje powód, by pozostawić rozwiązanie analizy czynników eksploracyjnych bez zmian?
Czy istnieją powody, by nie zmieniać rozwiązania analizy czynników eksploracyjnych? Łatwo jest znaleźć dyskusje porównujące rozwiązania ortogonalne z rozwiązaniami ukośnymi i myślę, że całkowicie rozumiem wszystkie te rzeczy. Ponadto, z tego, co udało mi się znaleźć w podręcznikach, autorzy zwykle przechodzą od wyjaśnienia metod szacowania analizy czynnikowej do wyjaśnienia, jak …

1
Porównanie CPH, modelu przyspieszonego czasu awarii lub sieci neuronowych do analizy przeżycia
Jestem nowy w analizie przeżycia, a ostatnio dowiedziałem się, że istnieją różne sposoby, aby osiągnąć określony cel. Interesuje mnie faktyczne wdrożenie i odpowiedniość tych metod. Przedstawiono mi tradycyjne Cox Proporcjonalne zagrożenia , modele przyspieszonego czasu awarii i sieci neuronowe (perceptron wielowarstwowy) jako metody pozwalające na przeżycie pacjenta, biorąc pod uwagę …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.