Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak interpretować wykres autokorelacji w MCMC
Zapoznam się ze statystykami bayesowskimi, czytając książkę Doing Bayesian Data Analysis autorstwa Johna K. Kruschke znaną również jako „książkę o szczeniętach”. W rozdziale 9 przedstawiono modele hierarchiczne na tym prostym przykładzie: a obserwacje Bernoulliego to 3 monety, każde 10 rzutów. Jeden pokazuje 9 głów, drugi 5 głów, a drugi 1 …

3
Zrozumienie parametrów funkcji podstawy Gaussa do zastosowania w regresji liniowej
Chciałbym zastosować funkcję bazową Gaussa do implementacji regresji liniowej. Niestety trudno mi zrozumieć kilka parametrów funkcji podstawowej. W szczególności i .μμ\muσσ\sigma Mój zestaw danych to macierz 10 000 x 31. 10 000 próbek i 31 funkcji. Przeczytałem, że „Każda funkcja podstawowa przekształca wektor wejściowy x w wartość skalarną”. Zakładam więc, …

1
Jak znaleźć przedział prognozy GBM
Pracuję z modelami GBM przy użyciu pakietu Caret i szukam metody rozwiązania przedziałów prognoz dla moich przewidywanych danych. Szukałem obszernie, ale wpadłem tylko na kilka pomysłów, aby znaleźć przedziały prognoz dla Losowego Lasu. Każdy kod pomocy / R byłby bardzo mile widziany!

3
Jak mogę zinterpretować wykres procentu przycięcia w porównaniu ze średnią przyciętą?
W przypadku części zadania domowego poproszono mnie o obliczenie skróconej średniej dla zbioru danych poprzez usunięcie najmniejszej i największej obserwacji oraz o interpretację wyniku. Średnia obcięta była niższa niż średnia nieprzycięta. Z mojej interpretacji wynika, że ​​było to spowodowane dodatnim wypaczeniem leżącego u podstaw rozkładu, więc lewy ogon jest gęstszy …

1
t.test zwraca błąd „dane są zasadniczo stałe”
R version 3.1.1 (2014-07-10) -- "Sock it to Me" > bl <- c(140, 138, 150, 148, 135) > fu <- c(138, 136, 148, 146, 133) > t.test(fu, bl, alternative = "two.sided", paired = TRUE) Error in t.test.default(fu, bl, alternative = "two.sided", paired = TRUE) : data are essentially constant Następnie …
12 r  t-test 

4
Dobra forma do usuwania wartości odstających?
Pracuję nad statystykami dla kompilacji oprogramowania. Mam dane dla każdego kompilacji na pass / fail i upływający czas i generujemy ~ 200 z nich / tydzień. Wskaźnik skuteczności można łatwo agregować, mogę powiedzieć, że 45% minęło w danym tygodniu. Ale chciałbym również zsumować upływający czas i chcę się upewnić, że …

3
testowanie współczynników regresji logistycznej z wykorzystaniem odchyleń resztkowych stopni swobody
Podsumowanie: Czy istnieje jakaś teoria statystyczna, która przemawia za wykorzystaniem rozkładu (z stopniami swobody opartymi na odchyleniu resztkowym) do testów współczynników regresji logistycznej zamiast standardowego rozkładu normalnego?ttt Jakiś czas temu odkryłem, że przy dopasowaniu modelu regresji logistycznej w SAS PROC GLIMMIX, przy ustawieniach domyślnych, współczynniki regresji logistycznej są testowane przy …

2
Dlaczego SAS PROC GLIMMIX daje mi BARDZO różne losowe nachylenia niż glmer (lme4) dla dwumianowego glmm
Jestem użytkownikiem bardziej zaznajomionym z R. Próbowałem oszacować losowe zbocza (współczynniki selekcji) dla około 35 osobników w ciągu 5 lat dla czterech zmiennych siedlisk. Zmienna odpowiedzi określa, czy lokalizacja była siedliskiem „używanym” (1), czy „dostępnym” (0) („używaj” poniżej). Korzystam z 64-bitowego komputera z systemem Windows. W wersji R 3.1.0 używam …

1
Pojęcie wyników analizy mediacji w R.
Próbuję obejść pakiet mediacyjny w języku R, używając winiety dla pakietu. Próbuję zrozumieć wynik działania tej mediate()funkcji. require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age + educ + gender + …
12 r  mediation 

3
Pomysł tworzenia danych ma wartość zero
Często widzę ludzi, którzy określają wymiar / cechę zestawu danych jako zero-średnią poprzez usunięcie średniej ze wszystkich elementów. Ale nigdy nie rozumiałem, dlaczego to robić? Jaki jest efekt robienia tego jako etapu wstępnego przetwarzania? Czy poprawia to klasyfikację? Czy pomaga odpowiedzieć na coś o zestawie danych? Czy pomaga w wizualizacji …

2
Czy niewłaściwe jest używanie wykresów liniowych do dyskretnych danych?
Często widziałem dyskretne zestawy danych wykreślane jako wykresy liniowe, ale przychodzi mi do głowy, że linia wyznacza wartość w punkcie między przedziałami pomiarowymi, co nie ma znaczenia dla dyskretnych zestawów danych. Czy w takim przypadku użycie wykresów liniowych dla danych dyskretnych jest nieprawidłowe? Jako przykład weźmy dwa zestawy danych szeregów …

4
Czy w stacjonarnej serii trendów można modelować ARIMA?
Mam pytanie / zamieszanie dotyczące stacjonarnych serii wymaganych do modelowania za pomocą ARIMA (X). Myślę o tym bardziej w kategoriach wnioskowania (efekt interwencji), ale chciałbym wiedzieć, czy prognozowanie kontra wnioskowanie ma jakikolwiek wpływ na odpowiedź. Pytanie: Wszystkie wstępne materiały, które przeczytałem, stwierdzają, że seria musi być stacjonarna, co ma dla …

3
Jaki jest najlepszy sposób na Przekształcenie / Restrukturyzację danych?
Jestem asystentem naukowym w laboratorium (wolontariusz). Ja i mała grupa zlecono mi analizę danych dla zestawu danych pobranych z dużego badania. Niestety dane zostały zebrane za pomocą jakiejś aplikacji online i nie została zaprogramowana do wyświetlania danych w najbardziej użytecznej formie. Poniższe zdjęcia ilustrują podstawowy problem. Powiedziano mi, że nazywa …
12 r  excel  data-cleaning 

2
Czy normalnie rozłożone X i Y częściej powodują powstanie resztek normalnie rozłożonych?
W tym miejscu omawiana jest błędna interpretacja założenia normalności w regresji liniowej (że „normalność” odnosi się do X i / lub Y zamiast do reszt), a plakat pyta, czy możliwe jest uzyskanie nietypowo rozłożonych X i Y i nadal mają normalnie rozłożone resztki. Moje pytanie brzmi: czy zwykle rozkład X …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.