Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Wybór zmiennych a wybór modelu
Rozumiem więc, że wybór zmiennych jest częścią wyboru modelu. Ale na czym dokładnie polega wybór modelu? Czy to coś więcej niż następujące: 1) wybierz rozkład dla swojego modelu 2) wybrać zmienne objaśniające,? Pytam o to, ponieważ czytam artykuł Burnham i Anderson: AIC kontra BIC, w którym mówią o AIC i …

1
Czy w Oz będzie kiedyś nieszczęśliwy Tribble?
Oto zabawny problem przyniesiony mi przez studenta. Chociaż pierwotnie było sformułowane w kategoriach wzajemnie anihilujących pocisków wystrzeliwanych w regularnych odstępach przez broń, pomyślałem, że może ci się podobać bardziej spokojna prezentacja. W nieskończonym płaskim świecie Oz Żółta Ceglana Droga zaczyna się w centrum Szmaragdowego Miasta, odpręża się na wsi i …


2
ICC jako oczekiwana korelacja między dwiema losowo losowanymi jednostkami, które są w tej samej grupie
W modelowaniu wielopoziomowym korelacja wewnątrzklasowa jest często obliczana na podstawie analizy ANOVA z efektami losowymi yI j= γ00+ ujot+ ejajyjajot=γ00+ujot+mijajot y_{ij} = \gamma_{00} + u_j + e_{ij} gdzie to poziomu 2, a to reszty poziomu 1. Następnie otrzymujemy oszacowania, i dla wariancji odpowiednio i , i je do następującego równania:ujotujotu_jmiI …


1
Jak radzić sobie z nadmierną dyspersją w regresji Poissona: quasi-prawdopodobieństwo, ujemny dwumianowy GLM lub efekt losowy na poziomie podmiotu?
Natknąłem się na trzy propozycje rozwiązania problemu nadmiernej dyspersji w zmiennej odpowiedzi Poissona i modelu początkowym o ustalonych efektach: Użyj modelu quasi; Użyj ujemnego dwumianowego GLM; Użyj modelu mieszanego z losowym efektem na poziomie przedmiotu. Ale co właściwie wybrać i dlaczego? Czy jest wśród nich jakieś rzeczywiste kryterium?

4
wykryć liczbę pików w nagraniu audio
Próbuję wymyślić, jak wykryć liczbę sylab w korpusie nagrań audio. Myślę, że dobrym proxy może być szczyty w pliku wave. Oto, co próbowałem z plikiem mówiącym po angielsku (mój faktyczny przypadek użycia to Kiswahili). Zapis tego przykładowego nagrania brzmi: „To ja próbuję użyć funkcji timera. Patrzę na pauzy, wokalizacje”. W …

1
Udowodnić związek między odległością Mahalanobis a dźwignią?
Widziałem formuły na Wikipedii. które odnoszą się do odległości i dźwigni Mahalanobisa: Odległość Mahalanobisa jest ściśle związana ze statystyką dźwigni, , ale ma inną skalę:hhhre2)= ( N- 1 ) ( h - 1N.) .re2)=(N.-1)(h-1N.).D^2 = (N - 1)(h - \tfrac{1}{N}). W powiązanym artykule Wikipedia opisuje w następujących terminach:hhh W tym …

2
Kiedy regresja logistyczna jest odpowiednia?
Obecnie uczę się, jak dokonywać klasyfikacji, a konkretnie przyglądam się trzem metodom: obsłudze maszyn wektorowych, sieci neuronowych i regresji logistycznej. Próbuję zrozumieć, dlaczego regresja logistyczna miałaby kiedykolwiek lepszą wydajność niż pozostałe dwa. Z mojego zrozumienia regresji logistycznej, pomysł polega na dopasowaniu funkcji logistycznej do całych danych. Więc jeśli moje dane …


2
Plusy i minusy połączenia logarytmicznego a identyfikacyjnego dla regresji Poissona
Ja przeprowadzenia regresji Poissona z celem końcowym porównywania (i przy różnicy) prognozowane średnie zliczenie pomiędzy dwoma poziomami czynnika w moim , trzymając inny model współzmiennych (które są binarne ) stała. Zastanawiałem się, czy ktokolwiek mógłby udzielić praktycznych porad, kiedy użyć linku dziennika zamiast linku tożsamości. Jakie są zalety tych dwóch …

2
Oczekiwanie na maksimum zmiennych iid Gumbela
Ciągle czytam w czasopismach ekonomicznych o konkretnym wyniku stosowanym w losowych modelach użytkowych. Jedna wersja wyniku to: jeśli Gumbel ( , to:ϵi∼iid,ϵi∼iid,\epsilon_i \sim_{iid}, μ,1),∀iμ,1),∀i\mu, 1), \forall i E[maxi(δi+ϵi)]=μ+γ+ln(∑iexp{δi}),E[maxi(δi+ϵi)]=μ+γ+ln⁡(∑iexp⁡{δi}),E[\max_i(\delta_i + \epsilon_i)] = \mu + \gamma + \ln\left(\sum_i \exp\left\{\delta_i \right\} \right), gdzie γ≈0.52277γ≈0.52277\gamma \approx 0.52277 jest stałą Eulera-Mascheroniego. Sprawdziłem, czy ma to …

2
Różne definicje AIC
Z Wikipedii istnieje definicja Kryterium Informacyjnego Akaike (AIC) jako , gdzie jest liczbą parametrów, a jest prawdopodobieństwem modelu.AIC=2k−2logLAIC=2k−2log⁡L AIC = 2k -2 \log L kkklogLlog⁡L\log L Jednak nasze ekonometria zauważa na szanowanym uniwersytecie, że . Tutaj to oszacowana wariancja błędów w modelu ARMA, a to liczba obserwacji w zestawie danych …


2
Źle uwarunkowana macierz kowariancji w regresji GP dla optymalizacji bayesowskiej
Tło i problem Korzystam z procesów Gaussa (GP) do regresji i późniejszej optymalizacji bayesowskiej (BO). Do regresji używam pakietu gpml dla MATLAB z kilkoma niestandardowymi modyfikacjami, ale problem jest ogólny. Jest dobrze znanym faktem, że gdy dwa dane treningowe znajdują się zbyt blisko w przestrzeni wejściowej, macierz kowariancji może stać …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.