Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Zrozumienie pomiaru nierówności koncentracji
W duchu tego pytania. Rozumiejąc dowód lematu stosowanego w nierówności Hoeffdinga , staram się zrozumieć kroki, które prowadzą do nierówności Hoeffdinga. Najbardziej tajemnicą dla mnie jest część obliczania momentów wykładniczych dla sumy zmiennych iid, po których stosuje się nierówność Markowa. Moim celem jest zrozumienie: Dlaczego ta technika powoduje ścisłą nierówność …

2
Model mieszany z 1 obserwacją na poziom
Dopasowuję model efektów losowych glmerdo niektórych danych biznesowych. Celem jest analiza wyników sprzedaży przez dystrybutora, z uwzględnieniem różnic regionalnych. Mam następujące zmienne: distcode: identyfikator dystrybutora z około 800 poziomami region: identyfikator geograficzny najwyższego poziomu (północ, południe, wschód, zachód) zone: zagnieżdżona geografia średniego poziomu region, w sumie około 30 poziomów territory: …


1
Kryteria wyboru „najlepszego” modelu w ukrytym modelu Markowa
Mam zestaw danych szeregów czasowych, do którego próbuję dopasować ukryty model Markowa (HMM) w celu oszacowania liczby stanów ukrytych w danych. Mój pseudo-kod do tego jest następujący: for( i in 2 : max_number_of_states ){ ... calculate HMM with i states ... optimal_number_of_states = "model with smallest BIC" ... } Teraz, …

2
Modele binarne (Probit i Logit) z przesunięciem logarytmicznym
Czy ktoś ma pochodne tego, jak offset działa w modelach binarnych, takich jak probit i logit? W moim problemie okno kontrolne może mieć różną długość. Załóżmy, że pacjenci dostają zastrzyk profilaktyczny jako leczenie. Strzal zdarza się w różnych momentach, więc jeśli wynik jest binarnym wskaźnikiem tego, czy zdarzyły się jakieś …

2
Jak próbkować z dyskretnego (kategorycznego) rozkładu w przestrzeni dziennika?
Załóżmy, że mam rozkład dyskretny zdefiniowany przez wektor tak, że kategoria zostanie narysowana z prawdopodobieństwem i tak dalej. Następnie odkrywam, że niektóre wartości w rozkładzie są tak małe, że nie odpowiadają one liczbom zmiennoprzecinkowym mojego komputera, więc aby to zrekompensować, wykonuję wszystkie obliczenia w przestrzeni dziennika. Teraz mam dziennik wektorowy …

2
Związek i różnica między szeregami czasowymi a regresją?
Jakie są zależności i różnice między szeregami czasowymi a regresją? Czy w przypadku modeli i założeń jest prawdą, że modele regresji zakładają niezależność między zmiennymi wyjściowymi dla różnych wartości zmiennej wejściowej, podczas gdy model szeregów czasowych nie? Jakie są inne różnice? Dla metod , od strony internetowej przez Darlington Istnieje …

1
Algorytm normalizacji w czasie rzeczywistym danych szeregów czasowych?
Pracuję nad algorytmem, który przyjmuje wektor najnowszego punktu danych z wielu strumieni czujników i porównuje odległość euklidesową z poprzednimi wektorami. Problem polega na tym, że różne strumienie danych pochodzą z zupełnie różnych czujników, więc przyjęcie prostej odległości euklidesowej dramatycznie przeceni niektóre wartości. Oczywiście potrzebuję sposobu na znormalizowanie danych. Ponieważ jednak …

1
Testowanie niektórych kontrastów: czy jest to trudny problem, czy nie?
Wysłałem to do mathoverflow i nikt nie odpowiada: Metoda Scheffé do identyfikacji statystycznie istotnych kontrastów jest powszechnie znana. Kontrast wśród środków , o populacji jest liniową kombinacją w którym , a skalarna wielokrotność kontrastu jest zasadniczo tym samym kontrastem, więc można powiedzieć, że zestaw kontrastów jest przestrzenią rzutową. Metoda Scheffé'a …

3
Kiedy naprawiony efekt jest naprawiony?
Rozważmy liniowe efekty zauważony model typu: , gdzie jest niezauważalna ale czas niezmienny charakterystyczne i błąd, i indeksować odpowiednio indywidualne obserwacje i czas. Typowym podejściem w regresji efektów stałych (FE) byłoby usunięcie poprzez poszczególne manekiny (LSDV) / usunięcie znaczeń lub przez pierwsze różnicowanie.yjat= Xjatβ+ cja+ei tyjat=Xjatβ+doja+mijaty_{it} = X_{it}\beta + c_{i} …


2
Czy wartości p dla testu korelacji Pearsona można obliczyć na podstawie współczynnika korelacji i wielkości próby?
Tło: Przeczytałem jeden artykuł, w którym autorzy podają korelację Pearsona 0,754 z wielkości próby 878. Wynikowa wartość p dla testu korelacji jest znacząca dla „dwóch gwiazdek” (tj. P <0,01). Myślę jednak, że przy tak dużej próbce odpowiadająca jej wartość p powinna być mniejsza niż 0,001 (tj. Znacząca trzy gwiazdki). Czy …

4
Oczekiwany numer będę włączony po wyciągnięciu kart, dopóki nie otrzymam asa, 2, 3 itd
Mam problem z rozwiązaniem poniższych problemów. Dobierasz karty ze standardowej talii 52 kart bez wymiany, dopóki nie otrzymasz asa. Dobierasz z tego, co pozostało, dopóki nie dostaniesz 2. Kontynuujesz z 3. Jakiej oczekiwanej liczby będziesz się spodziewać po wyczerpaniu całej talii? To było naturalne pozwolić Ti=first position of card whose …

2
Jakie statystyki opisowe nie są wielkościami efektów?
Wikipedia mówi wielkość efektu jest miarą siły zjawiska lub oszacowaniem tej wielkości na podstawie próby. Wielkość efektu obliczona na podstawie danych jest statystyką opisową, która przekazuje szacunkową wielkość związku bez stwierdzenia, czy pozorny związek w danych odzwierciedla prawdziwy związek w populacji. Aby to lepiej zrozumieć, zastanawiałem się, jakie statystyki opisowe …

1
Pierwsze kroki nauki przewidywania okresów finansowych za pomocą uczenia maszynowego
Próbuję zrozumieć, w jaki sposób korzystać z uczenia maszynowego do przewidywania okresów finansowych 1 lub więcej kroków w przyszłość. Mam finansowe szeregi czasowe z niektórymi danymi opisowymi i chciałbym stworzyć model, a następnie użyć tego modelu do przewidzenia n-krok naprzód. Do tej pory robiłem: getSymbols("GOOG") GOOG$sma <- SMA(Cl(GOOG)) GOOG$range <- …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.