Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Odpowiedni pozostały stopień swobody po usunięciu warunków z modelu
Zastanawiam się nad dyskusją wokół tego pytania, aw szczególności z komentarzem Franka Harrella, że ​​oszacowanie wariancji w modelu zredukowanym (tj. Takim, z którego przetestowano i odrzucono wiele zmiennych objaśniających) powinno wykorzystywać ogólny stopień wolności Ye . Profesor Harrell podkreśla, że ​​będzie to znacznie bliższe pozostałym stopniom swobody oryginalnego „pełnego” modelu …

12
Narzędzie wiersza polecenia do obliczania podstawowych statystyk dla strumienia wartości [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte w zeszłym roku . Czy jest jakieś narzędzie wiersza polecenia, które akceptuje przepływ liczb (w formacie ascii) ze standardowego wejścia i podaje podstawowe statystyki opisowe …


3
Który szpital powinien zostać wybrany? Jeden ma wyższy wskaźnik sukcesu, ale drugi ma wyższy ogólny wskaźnik sukcesu
To pytanie zostało przeniesione z Mathematics Stack Exchange, ponieważ można na nie odpowiedzieć podczas weryfikacji krzyżowej. Migrował 7 lat temu . Mam pytanie dotyczące czegoś, co mój nauczyciel statystyk powiedział o następującym problemie. Moje pytanie nawet nie dotyczy wystąpienia paradoksu Simpsona w tej sytuacji. Moje pytanie dotyczy po prostu nacisku …

2
Czy hipotezy zerowe i alternatywne muszą być wyczerpujące, czy nie?
Wiele razy widziałem, że muszą one być wyczerpujące (przykłady w takich książkach zawsze były ustawione w taki sposób, że rzeczywiście były), z drugiej strony widziałem też wiele razy, w których książki powinny być wyjątkowe ( na przykład as i as ) bez wyjaśnienia wyczerpującego problemu. Dopiero przed wpisaniem tego pytania …

1
Czy sprawdzanie poprawności jest właściwym zamiennikiem zestawu sprawdzania poprawności?
W klasyfikacji tekstowej mam zestaw szkoleniowy z około 800 próbkami i zestaw testowy z około 150 próbkami. Zestaw testowy nigdy nie był używany i czeka na użycie do końca. Używam całego zestawu 800 próbek treningowych, z 10-krotnym sprawdzaniem poprawności podczas strojenia i poprawiania klasyfikatorów i funkcji. Oznacza to, że nie …

3
Dlaczego priory Jeffreysa uważane są za nieinformacyjne?
Rozważmy Jeffreysa przed gdzie , gdzie jest informacją Fishera.p(θ)∝|i(θ)|−−−−√p(θ)∝|i(θ)|p(\theta) \propto \sqrt{|i(\theta)|}iii Nadal widzę, że ten uprzedzenie jest wymieniany jako nieinformacyjny, ale nigdy nie widziałem argumentu, dlaczego jest on nieinformacyjny. W końcu nie jest to stały uprzedni, więc musi być jakiś inny argument. Rozumiem, że nie zależy to od reparametryzacji, co …
27 bayesian  prior 

2
Znaczenie wartości p w regresji
To pytanie zostało przeniesione z Mathematics Stack Exchange, ponieważ można na nie odpowiedzieć podczas weryfikacji krzyżowej. Migrował 8 lat temu . Kiedy wykonuję regresję liniową w niektórych pakietach oprogramowania (na przykład Mathematica), otrzymuję wartości p związane z poszczególnymi parametrami w modelu. Na przykład wyniki regresji liniowej, która daje wynik będą …

2
Trend STL szeregów czasowych przy użyciu R.
Jestem nowy w R i analizie szeregów czasowych. Próbuję znaleźć trend w długim (40 lat) dziennym szeregu czasowym temperatur i próbowałem różnych przybliżeń. Pierwszy to po prostu prosta regresja liniowa, a drugi to Sezonowy rozkład szeregów czasowych według Loessa. W tym ostatnim wydaje się, że składnik sezonowy jest większy niż …
27 r  time-series  trend 


3
Czy AIC może porównywać różne typy modeli?
Używam AIC (Akaike's Information Criterion) do porównywania modeli nieliniowych w R. Czy warto porównywać AIC różnych typów modeli? Konkretnie porównuję model dopasowany przez glm do modelu z terminem efektu losowego dopasowanego przez glmer (lme4). Jeśli nie, to czy można dokonać takiego porównania? A może pomysł jest całkowicie nieważny?

4
Jak mierzyć / oceniać „zmienne znaczenie” podczas korzystania z CART? (konkretnie używając {rpart} z R)
Podczas budowania modelu CART (w szczególności drzewa klasyfikacji) przy użyciu rpart (w R) często interesujące jest wiedzieć, jakie znaczenie mają różne zmienne wprowadzone do modelu. Tak więc moje pytanie brzmi: jakie wspólne miary istnieją dla uszeregowania / pomiaru znaczenia zmiennych uczestniczących zmiennych w modelu CART? I jak można to obliczyć …

2
Czy korelacja zakłada stacjonarność danych?
Analiza międzyrynkowa jest metodą modelowania zachowań rynkowych poprzez znajdowanie relacji między różnymi rynkami. Często oblicza się korelację między dwoma rynkami, powiedzmy S&P 500 i 30-letnimi amerykańskimi skarbami. Obliczenia te najczęściej oparte są na danych cenowych, co jest oczywiste dla wszystkich, że nie pasuje do definicji stacjonarnych szeregów czasowych. Pomijając możliwe …

3
Obliczenia symboliczne w R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Zastanawiałem się, czy można wykonać obliczenia symboliczne w języku R? Na przykład, Miałem nadzieję uzyskać odwrotność symbolicznej macierzy kowariancji rozkładu Gaussa 3D. Czy mogę także …
27 r 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.