Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



1
Gęstość robotów wykonujących losowy spacer na nieskończonym losowym wykresie geometrycznym
Rozważmy nieskończony losowy wykres geometryczny, w którym położenia węzłów są zgodne z procesem punktu Poissona o gęstości a krawędzie są umieszczone między węzłami bliższymi niż d . Dlatego długość krawędzi jest zgodna z następującym plikiem PDF:ρρ\rhoredd fa( l ) = { 2 lre2)l ≤ d0l > df(l)={2ld2l≤d0l>d f(l)= \begin{cases} \frac{2 …



4
Dobry samouczek dotyczący ograniczonych maszyn Boltzmann (RBM)
Studiuję ograniczoną maszynę Boltzmanna (RBM) i mam pewne problemy ze zrozumieniem obliczeń prawdopodobieństwa dziennika w odniesieniu do parametrów RBM. Mimo że opublikowano wiele prac naukowych na temat RBM, nie ma szczegółowych kroków na temat pochodnych. Po przeszukaniu online udało mi się je znaleźć w tym dokumencie: Fischer, A., i Igel, …
10 references  rbm 

1
Techniki eksploracji danych w kampanii Obamy
Natknąłem się na ten artykuł o zespole eksploracji danych w kampanii reelekcyjnej Obamy. Niestety artykuł jest bardzo niejasny na temat rzeczywistej maszynerii algorytmów statystycznych. Wydawało się jednak, że ogólne techniki są znane w naukach społecznych i politycznych. Ponieważ to nie jest moja specjalizacja, czy ktoś może wskazać mi literaturę (przegląd) …

3
Jak interaktywnie wyświetlać dane dużych szeregów czasowych?
Często mam do czynienia z rozsądną ilością danych szeregów czasowych, 50-200 milionów podwójnych z powiązanymi znacznikami czasu i chciałbym je wizualizować dynamicznie. Czy istnieje oprogramowanie umożliwiające to skutecznie? Co powiesz na biblioteki i formaty danych? Zoom-cache jest jednym z przykładów bibliotek skupiających się na dużych seriach czasowych. W Zoom-cache dane …

2
Czy dane porządkowe lub przedziałowe są wymagane do testu rang podpisanego Wilcoxona?
Po zapoznaniu się z wieloma źródłami online wydaje się, że nie mogę uzyskać prostej odpowiedzi. Czy ktoś mógłby mi wyjaśnić, czy dane porządkowe są wystarczające do wykorzystania w WSRT, a jeśli nie, to czy test znakowy jest odpowiednią alternatywą? Wreszcie, dotyczy to mojego projektu pracy doktorskiej na uniwersytecie, więc jeśli …

2
Wpływowa wartość rezydualna vs. wartość odstająca
Po pierwsze, powinienem stwierdzić, że szukałem odpowiedzi na tej stronie. Albo nie znalazłem pytania, które odpowiedziałoby na moje pytanie, albo mój poziom wiedzy jest tak niski, że nie zdawałem sobie sprawy, że już przeczytałem odpowiedź. Studiuję do egzaminu AP Statistics. Muszę nauczyć się regresji liniowej, a jednym z tematów są …

1
Jak obliczyć wzajemne informacje?
Jestem trochę zmieszany. Czy ktoś może mi wyjaśnić, jak obliczyć wzajemne informacje między dwoma terminami w oparciu o matrycę termin-dokument z występowaniem terminów binarnych jako wag? Document1Document2Document3′Why′111′How′101′When′111′Wh e re′100′W.hy′′H.ow′′W.hmin′′W.hmirmi′reodoummint11111reodoummint2)1010reodoummint3)1110 \begin{matrix} & 'Why' & 'How' & 'When' & 'Where' \\ Document1 & 1 & 1 & 1 & 1 \\ Document2 …

2
Model dopasowania dla dwóch normalnych rozkładów w PyMC
Ponieważ jestem inżynierem oprogramowania i próbuję dowiedzieć się więcej statystyk, musisz mi wybaczyć, zanim zacznę, dlatego jest to poważna nowość ... Uczę się PyMC i pracuję nad kilkoma naprawdę (naprawdę) prostymi przykładami. Jednym z problemów, których nie mogę zabrać do pracy (i nie mogę znaleźć żadnych powiązanych przykładów), jest dopasowanie …
10 modeling  python  pymc 

2
Oczekiwana wartość losowej zmiennej Gaussa przekształconej funkcją logistyczną
Zarówno funkcja logistyczna, jak i odchylenie standardowe są zwykle oznaczane . Będziemy używać i y dla standardowego odchylenia.σ ( x ) = 1 / ( 1 + exp ( - x ) ) sσσ\sigmaσ(x)=1/(1+exp(−x))σ(x)=1/(1+exp⁡(−x))\sigma(x) = 1/(1+\exp(-x))sss Mam logistycznego neuron z wejściem losowej którego średnia μμ\mu i odchylenie standardowe sss wiem. …

1
Czy niskie szerokości sylwetki oznaczają, że dane mają niewielką strukturę?
Jestem nowy w analizie sekwencji i zastanawiałem się, jak zareagujesz, jeśli średnie szerokości sylwetki (ASW) z analiz klastrowych macierzy niepodobności opartych na dopasowaniu optymalnym są niskie (około 25). Czy właściwe byłoby stwierdzenie, że istnieje niewielka podstawowa struktura, która pozwalałaby na grupowanie sekwencji? Czy możesz zignorować niskie ASW w oparciu o …

1
Long-tailed rozkład zdarzeń czasowych
Załóżmy, że masz dzienniki serwera WWW. W tych logach masz krotki tego rodzaju: user1, timestamp1 user1, timestamp2 user1, timestamp3 user2, timestamp4 user1, timestamp5 ... Te znaczniki czasu reprezentują np. Kliknięcia użytkowników. Teraz user1będzie odwiedzał witrynę wiele razy (sesji) w ciągu miesiąca, a będziesz mieć serię kliknięć każdego użytkownika podczas każdej …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.