Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Intuicja za odchyleniem standardowym
Próbuję uzyskać lepsze intuicyjne zrozumienie odchylenia standardowego. Z tego, co rozumiem, jest reprezentatywna dla średniej różnic zestawu obserwacji w zbiorze danych ze średniej tego zbioru danych. Jednak NIE jest ona w rzeczywistości równa średnim różnicom, ponieważ nadaje większą wagę obserwacjom w porównaniu do średniej. Powiedzmy, że mam następującą populację wartości …

2
Czy poprawnie podałem swój model w lmer?
Przeszukałem wiele stron pomocy i wciąż nie jestem pewien, jak określić bardziej skomplikowane terminy zagnieżdżone w modelu mieszanym. Jestem również mylić jak wykorzystanie :i /oraz |w określaniu i gniazdowania interakcje z czynnikami losowymi wykorzystujących lmer()w lme4opakowaniu w R. Na potrzeby tego pytania załóżmy, że dokładnie przedstawiłem moje dane za pomocą …

4
Różnica między regułą dwumianową, ujemną dwumianową i regresją Poissona
Szukam informacji na temat różnicy między regresją dwumianową, ujemną dwumianową i regresją Poissona i dla jakich sytuacji ta regresja najlepiej pasuje. Czy są jakieś testy, które mogę wykonać w SPSS, które mogą mi powiedzieć, która z tych regresji jest najlepsza w mojej sytuacji? Ponadto, jak uruchomić Poissona lub dwumian ujemny …

5
Włączenie opóźnionej zmiennej zależnej do regresji
Jestem bardzo zdezorientowany, czy uzasadnione jest włączenie opóźnionej zmiennej zależnej do modelu regresji. Zasadniczo myślę, że jeśli ten model skupia się na związku między zmianą Y i innymi zmiennymi niezależnymi, to dodanie opóźnionej zmiennej zależnej po prawej stronie może zagwarantować, że współczynnik przed innymi IV jest niezależny od poprzedniej wartości …

4
Walidacja wewnętrzna i zewnętrzna oraz wybór modelu
Rozumiem, że przy weryfikacji krzyżowej i wyborze modelu staramy się rozwiązać dwie rzeczy: P1 . Oszacuj oczekiwaną stratę w populacji podczas treningu z naszą próbą P2 . Zmierz i zgłoś naszą niepewność dotyczącą tego oszacowania (wariancja, przedziały ufności, stronniczość itp.) Standardową praktyką wydaje się być powtarzanie krzyżowej weryfikacji, ponieważ zmniejsza …

2
Co tak naprawdę oznacza wartość logit?
Mam model logit, który w wielu przypadkach podaje liczbę od 0 do 1, ale jak możemy to zinterpretować? Weźmy skrzynkę z logitem 0.20 Czy możemy twierdzić, że istnieje 20% prawdopodobieństwo, że sprawa należy do grupy B w porównaniu do grupy A? czy to właściwy sposób interpretowania wartości logit?


6
Czy istnieje grafika „witaj, świecie” dla grafiki statystycznej?
W programowaniu komputerowym istnieje klasyczny pierwszy program do nauki / nauczania nowego języka lub systemu, zwany „witaj, świecie”. http://en.wikipedia.org/wiki/Hello_world_program Czy istnieje klasyczna pierwsza wizualizacja danych do korzystania z pakietu graficznego? Jeśli tak, co to jest? A jeśli nie, czym byliby dobrzy kandydaci?

2
W karecie, jaka jest prawdziwa różnica między cv a repeatcv?
Jest to podobne do metody ponownego próbkowania pytania Careta , chociaż tak naprawdę nigdy nie odpowiedziałem na tę część pytania w uzgodniony sposób. oferty funkcji pociągu Careta cvi repeatedcv. Jaka jest różnica w powiedzeniu: MyTrainControl=trainControl( method = "cv", number=5, repeats=5 ) vs MyTrainControl=trainControl( method = "repeatedcv", number=5, repeats=5 ) Rozumiem, …

1
PCA, LDA, CCA i PLS
W jaki sposób powiązane są PCA, LDA, CCA i PLS? Wszystkie wydają się „widmowe” i algebraiczne liniowe i bardzo dobrze rozumiane (powiedzmy, że ponad 50 lat teorii wokół nich zbudowanych). Są używane do bardzo różnych rzeczy (PCA do redukcji wymiarów, LDA do klasyfikacji, PLS do regresji), ale nadal czują się …

4
Prognozowanie za pomocą funkcji ciągłych i kategorycznych
Niektóre techniki modelowania predykcyjnego są bardziej zaprojektowane do obsługi ciągłych predyktorów, podczas gdy inne są lepsze do obsługi zmiennych jakościowych lub dyskretnych. Oczywiście istnieją techniki przekształcania jednego typu na inny (dyskretyzacja, zmienne fikcyjne itp.). Czy są jednak jakieś techniki modelowania predykcyjnego, które zostały zaprojektowane do obsługi obu typów danych wejściowych …

6
Szacowanie tego samego modelu w wielu szeregach czasowych
Mam doświadczenie dla początkujących w szeregach czasowych (niektóre oszacowania / prognozy ARIMA) i napotykam problem, którego nie do końca rozumiem. Każda pomoc byłaby bardzo mile widziana. Analizuję wiele szeregów czasowych, w tym samym przedziale czasowym i na tej samej częstotliwości, wszystkie opisują podobny typ danych. Każda seria jest tylko jedną …




Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.