Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych




2
Jakie są standardowe praktyki tworzenia syntetycznych zestawów danych?
Jako kontekst: podczas pracy z bardzo dużym zestawem danych czasami pojawia się pytanie, czy możemy stworzyć syntetyczny zestaw danych, w którym „znamy” związek między predyktorami a zmienną odpowiedzi lub relacje między predyktorami. Z biegiem lat wydaje mi się, że spotykam albo jednorazowe syntetyczne zestawy danych, które wyglądają, jakby zostały przygotowane …

9
Pomiar dokładności modelu opartego na regresji logistycznej
Mam wyszkolony model regresji logistycznej, który stosuję do testowanego zestawu danych. Zmienna zależna jest binarna (boolean). Dla każdej próbki w zestawie danych testowych stosuję model regresji logistycznej, aby wygenerować% prawdopodobieństwa, że ​​zmienna zależna będzie prawdziwa. Następnie rejestruję, czy wartość rzeczywista była prawdziwa, czy fałszywa. Ja próbuje obliczyć lub regulowane R …

3
Różnice między MANOVA a ANOVA z powtarzanymi pomiarami?
Jaka jest różnica między ANOVA z powtarzanymi pomiarami w stosunku do pewnego czynnika (powiedzmy warunki eksperymentalne) a MANOVA? W szczególności jedna strona, na którą natknąłem się, sugeruje, że MANOVA nie przyjmuje tego samego założenia sferyczności, co powtarzane pomiary ANOVA, czy to prawda? Jeśli tak, to dlaczego nie zawsze korzystamy z …


4
Importować cenę akcji z Yahoo Finance do R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Chciałbym zaimportować cenę akcji „Last Trade” z finansów Yahoo do R. Intencją jest praca z (prawie) danymi w czasie rzeczywistym. Czy są jakieś rozwiązania? Z …
26 r 

3
Co to jest theta w ujemnej regresji dwumianowej dopasowanej do R?
Mam pytanie dotyczące ujemnej regresji dwumianowej: Załóżmy, że masz następujące polecenia: require(MASS) attach(cars) mod.NB<-glm.nb(dist~speed) summary(mod.NB) detach(cars) (Pamiętaj, że samochody to zestaw danych, który jest dostępny w R, i tak naprawdę nie obchodzi mnie, czy ten model ma sens). Chciałbym wiedzieć: jak mogę interpretować zmienną theta(zwróconą na końcu wywołania do summary). …

2
Czy dystrybucja ma nazwę?
Pewnego dnia natknąłem się na tę gęstość. Czy ktoś nadał temu imię? fa( x ) = log( 1 + x- 2) / 2 πfa(x)=log⁡(1+x-2))/2)πf(x) = \log(1 + x^{-2}) / 2\pi Gęstość jest nieskończona u źródła, a także ma grube ogony. Widziałem go jako wcześniejszy rozkład w kontekście, w którym spodziewano …

3
Czy sensowne jest testowanie normalności przy bardzo małej wielkości próby (np. N = 6)?
Mam próbkę o wielkości 6. W takim przypadku, czy warto testować normalność za pomocą testu Kołmogorowa-Smirnowa? Użyłem SPSS. Mam bardzo małą próbkę, ponieważ uzyskanie każdej z nich wymaga czasu. Jeśli to nie ma sensu, ile próbek jest najniższą liczbą, która ma sens do testowania? Uwaga: przeprowadziłem eksperyment związany z kodem …

7
Testowanie liniowej zależności między kolumnami macierzy
Mam macierz korelacji zwrotów bezpieczeństwa, których wyznacznikiem jest zero. (Jest to nieco zaskakujące, ponieważ macierz korelacji próbki i odpowiadająca jej macierz kowariancji powinny teoretycznie być określone dodatnio). Moja hipoteza jest taka, że ​​co najmniej jedno zabezpieczenie jest liniowo zależne od innych papierów wartościowych. Czy w R jest funkcja, która sekwencyjnie …

7
Jak wykonać ANOVA SS typu III w R z kodami kontrastu?
Proszę podać kod R, który pozwala przeprowadzić ANOVA między podmiotami z kontrastami -3, -1, 1, 3. Rozumiem, że jest debata na temat odpowiedniego rodzaju sumy kwadratów (SS) do takiej analizy. Jednak jako domyślny typ SS używany w SAS i SPSS (typ III) jest uważany za standard w mojej okolicy. Dlatego …

4
Dlaczego RANSAC nie jest najczęściej stosowany w statystykach?
Pochodząc z pola widzenia komputerowego, często stosowałem metodę RANSAC (Random Sample Consensus) do dopasowywania modeli do danych z wieloma wartościami odstającymi. Jednak nigdy nie widziałem, aby używali go statystycy i zawsze miałem wrażenie, że nie była uważana za metodę „statystycznie solidną”. Dlaczego to jest takie? Ma charakter losowy, co utrudnia …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.