Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Regresja logistyczna: zmienne Bernoulliego vs. dwumianowe odpowiedzi
Chcę przeprowadzić regresję logistyczną z następującą odpowiedzią dwumianową oraz z i jako moimi predyktorami. X1X1X_1X2X2X_2 Mogę przedstawić te same dane, co odpowiedzi Bernoulliego w następującym formacie. Wyniki regresji logistycznej dla tych 2 zestawów danych są w większości takie same. Wartości odchylenia i AIC są różne. (Różnica między dewiacją zerową a …

5
Dlaczego są dwa rodzaje „heteroskedastyczny” lub „heteroscedastyczny”?
Często widzę zarówno pisownię „heteroskedastyczną”, jak i „heteroscedastyczną”, podobnie jak „homoscedastyczną” i „homoskedastyczną”. Wydaje się, że nie ma różnicy w znaczeniu między wariantami „c” i „k”, po prostu różnica ortograficzna związana z grecką etymologią tego słowa. Jakie są początki dwóch różnych pisowni? Czy jedno użycie jest bardziej powszechne i czy …



3
Czy można zmienić hipotezę, aby dopasować obserwowane dane (inaczej wyprawa na ryby) i uniknąć wzrostu liczby błędów typu I?
Dobrze wiadomo, że badacze powinni poświęcić czas na obserwowanie i badanie istniejących danych i badań przed sformułowaniem hipotezy, a następnie zebraniem danych w celu przetestowania tej hipotezy (odnosząc się do testowania istotności zerowej hipotezy). Wiele podstawowych książek statystycznych ostrzega, że ​​hipotezy muszą zostać sformułowane a priori i nie można ich …

1
Wykrywanie anomalii linków w sieci czasowej
Natknąłem się na ten artykuł, który wykorzystuje wykrywanie anomalii linków do przewidywania trendów, i uważam, że jest to niezwykle intrygujące: artykuł „Odkrywanie pojawiających się tematów w strumieniach społecznościowych poprzez wykrywanie anomalii linków” . Chciałbym powielić go na innym zestawie danych, ale nie znam wystarczająco metod, aby wiedzieć, jak z nich …

1
Porównanie dwóch modeli za pomocą funkcji anova () w języku R
Z dokumentacji dla anova(): Po podaniu sekwencji obiektów „anova” testuje modele względem siebie w podanej kolejności ... Co to znaczy testować modele ze sobą? A dlaczego kolejność ma znaczenie? Oto przykład z samouczka GenABEL : > modelAdd = lm(qt~as.numeric(snp1)) > modelDom = lm(qt~I(as.numeric(snp1)>=2)) > modelRec = lm(qt~I(as.numeric(snp1)>=3)) anova(modelAdd, modelGen, test="Chisq") …
32 r  anova 

3
Regresja logistyczna jądra a SVM
Jak wiadomo wszystkim, SVM może używać metody jądra do rzutowania punktów danych w wyższych przestrzeniach, aby punkty można było oddzielić przestrzenią liniową. Ale możemy również użyć regresji logistycznej, aby wybrać tę granicę w przestrzeni jądra, więc jakie są zalety SVM? Skoro SVM używa rzadkiego modelu, w którym tylko te wektory …
32 svm 

3
Czy można znaleźć połączone odchylenie standardowe?
Załóżmy, że mam 2 zestawy: Zestaw A : liczba pozycji , ,n=10n=10n= 10μ=2.4μ=2.4\mu = 2.4σ=0.8σ=0.8\sigma = 0.8 Zestaw B : liczba pozycji , ,n=5n=5n= 5μ=2μ=2\mu = 2σ=1.2σ=1.2\sigma = 1.2 Mogę łatwo znaleźć połączoną średnią ( ), ale jak mam znaleźć połączone odchylenie standardowe?μμ\mu


5
Wytyczne AIC w wyborze modelu
Zazwyczaj używam BIC, ponieważ rozumiem, że bardziej ceni parsimony niż AIC. Jednak zdecydowałem się teraz zastosować bardziej kompleksowe podejście i chciałbym również użyć AIC. Wiem, że Raftery (1995) przedstawił dobre wytyczne dla różnic BIC: 0-2 jest słaby, 2-4 jest pozytywnym dowodem na lepszy model jednego itd. Zajrzałem do podręczników i …


5
Dlaczego w sondażach politycznych są tak duże próby?
Kiedy oglądam wiadomości, zauważyłem, że sondaże Gallupa dotyczące takich rzeczy, jak wybory prezydenckie, mają [zakładam losowe] próbki o wielkości znacznie przekraczającej 1000. Ze statystyk uczelni wyższych pamiętam, że próbka o wielkości 30 była próbką „znacznie większą”. Wydawało się, że wielkość próby powyżej 30 jest bezcelowa ze względu na malejące zwroty.

1
Dlaczego R miałby zwracać NA jako współczynnik lm ()?
Dopasowuję lm()model do zestawu danych, który zawiera wskaźniki dla kwartału finansowego (I kw., II kw., III kw., Domyślnie ustawiam Q4). Za pomocą lm(Y~., data = data) otrzymuję NAjako współczynnik dla Q3 i ostrzeżenie, że jedna zmienna została wykluczona z powodu osobliwości. Czy muszę dodać kolumnę Q4?
32 r  regression 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.