Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Plusy i minusy metaanaliz
Zastanawiałem się nad zrobieniem metaanalizy dla konkretnego kierunku ewolucji, ale zanim przejdę dalej, chciałbym się dowiedzieć; jakie są plusy i minusy tego procesu? Na przykład brak potrzeby praktycznego eksperymentu jest zaletą (czas i pieniądze), ale nastąpi uprzedzenie publikacji (opublikowanie bardziej ekscytujących wyników), co byłoby wadą. Jakie artykuły w czasopismach statystycznych …

2
Czy używanie danych zliczania jako zmiennej niezależnej narusza którekolwiek z założeń GLM?
Chciałbym zastosować dane zliczania jako zmienne towarzyszące przy dopasowaniu modelu regresji logistycznej. Moje pytanie brzmi: Czy naruszam jakiekolwiek założenie modeli logistycznych (a bardziej ogólnie uogólnionych modeli liniowych), stosując jako zmienne niezależne zliczające, nieujemne zmienne całkowite? W literaturze znalazłem wiele odniesień dotyczących wykorzystania danych zliczających jako wyniku, ale nie jako zmiennych …

4
Jak zmierzyć kształt klastra?
Wiem, że to pytanie nie jest dobrze zdefiniowane, ale niektóre gromady mają tendencję do bycia eliptycznymi lub leżą w przestrzeni o mniejszych wymiarach, podczas gdy inne mają kształty nieliniowe (w przykładach 2D lub 3D). Czy istnieje jakakolwiek miara nieliniowości (lub „kształtu”) klastrów? Zauważ, że w przestrzeni 2D i 3D nie …

2
Jak udowodnić, że nie ma skończonej przestrzeni cech dla jądra Gaussa RBF?
Jak udowodnić, że dla radialnej funkcji bazowej nie jest ograniczony-wymiarowej przestrzeni funkcjaHtak, że w przypadku niektórychcp:Rn→Hmamyk(x,y)=⟨Φ(x),Φ(y)⟩?k(x,y)=exp(−||x−y||2)2σ2)k(x,y)=exp⁡(−||x−y||2)2σ2)k(x, y) = \exp(-\frac{||x-y||^2)}{2\sigma^2})HHHΦ:Rn→HΦ:Rn→H\Phi: \text{R}^n \to Hk(x,y)=⟨Φ(x),Φ(y)⟩k(x,y)=⟨Φ(x),Φ(y)⟩k(x, y) = \langle \Phi(x), \Phi(y)\rangle

5
Czy istnieje prosty sposób wykrywania wartości odstających?
Zastanawiam się, czy istnieje prosty sposób wykrywania wartości odstających. W przypadku jednego z moich projektów, który był w zasadzie korelacją między liczbą osób biorących udział w aktywności fizycznej w ciągu tygodnia a liczbą posiłków poza domem (fast food) w ciągu tygodnia, narysowałem wykres rozrzutu i dosłownie usunąłem punkty danych, które …

1
Czy ta metoda ponownego próbkowania szeregów czasowych jest znana w literaturze? Czy to ma imię?
Ostatnio szukałem sposobów na ponowne próbkowanie szeregów czasowych Zachowaj w przybliżeniu autokorelację długich procesów pamięci. Zachowaj domenę obserwacji (na przykład seria liczb całkowitych po ponownym próbkowaniu jest nadal serią liczb całkowitych). W razie potrzeby może wpływać tylko na niektóre skale. Wymyśliłem następujący schemat permutacji dla szeregów czasowych o długości :2N2N2^N …



2
Jak w wyborach możemy stwierdzić, że kandydat zostanie zwycięzcą?
Wczoraj mieszkam w wyborach powszechnych, a sieć telewizyjna zaczęła wzywać zwycięzców na długo przed otwarciem wszystkich kart do głosowania. Okazały się słuszne na wszystkich kontach i nie jestem zaskoczony, że tak zrobili. Wiem, że statystyki są absolutnie wykonalne. Mimo to jestem ciekawa. Zarozumiały: mamy otwarte iii z głosowaniach;jjj mamy kandydatów, …
14 elections 

1
Czy istnieje alternatywa dla testu Kołmogorowa-Smirnowa dla powiązanych danych z korektą?
Mam garść danych z dwóch próbek (kontrolnej i poddanej obróbce), z których każda zawiera kilka tysięcy wartości, które mają zostać poddane testom istotności w R. Teoretycznie wartości powinny być ciągłe, ale z powodu zaokrąglenia wykonanego przez oprogramowanie pomiarowe nie są i mają więzi. Rozkłady są nieznane, a kształty rozkładów kontrolnych …


2
Diagnostyka MCMC Geweke
Korzystam z próbnika Metropolis (C ++) i chcę użyć poprzednich próbek do oszacowania współczynnika konwergencji. Jedną z łatwych do wdrożenia diagnostyki, którą znalazłem, jest diagnostyka Geweke , która oblicza różnicę między dwoma średnimi próbkami podzielonymi przez szacowany błąd standardowy. Błąd standardowy jest szacowany na podstawie gęstości widmowej przy wartości zerowej. …
14 mcmc  diagnostic 

1
Czy istnieje optymalna przepustowość dla estymatora gęstości jądra instrumentów pochodnych?
Muszę oszacować funkcję gęstości na podstawie zestawu obserwacji za pomocą estymatora gęstości jądra. Na podstawie tego samego zestawu obserwacji muszę również oszacować pierwszą i drugą pochodną gęstości za pomocą pochodnych estymatora gęstości jądra. Przepustowość z pewnością będzie miała wielki wpływ na końcowy wynik. Po pierwsze wiem, że istnieje kilka funkcji …

5
Usuwanie obcych punktów w pobliżu środka wykresu QQ
Próbuję wykreślić wykres QQ z dwoma zestawami danych około 1,2 miliona punktów, w R (używając qqplot i wprowadzając dane do ggplot2). Obliczenia są dość łatwe, ale wynikowy wykres jest boleśnie powolny do ładowania, ponieważ jest tak wiele punktów. Próbowałem aproksymacji liniowej, aby zmniejszyć liczbę punktów do 10000 (to właśnie robi …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.