Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Kiedy kowariancja odległości jest mniej odpowiednia niż kowariancja liniowa?
Właśnie zostałem (niejasno) wprowadzony do kowariancji / korelacji odległości . Wydaje się to szczególnie przydatne w wielu sytuacjach nieliniowych, gdy testuje się zależność. Ale nie wydaje się, aby był używany bardzo często, chociaż kowariancja / korelacja są często stosowane w przypadku danych nieliniowych / chaotycznych. To sprawia, że ​​myślę, że …

4
Znaczenie predyktorów w regresji wielokrotnej: częściowe a współczynniki znormalizowane
Zastanawiam się, jaki jest dokładny związek między częściowym a współczynnikami w modelu liniowym i czy powinienem użyć tylko jednego, czy obu, aby zilustrować znaczenie i wpływ czynników.R2R2R^2 O ile mi wiadomo, wraz z summaryotrzymaniem oszacowań współczynników i anovasumą kwadratów dla każdego czynnika - proporcja sumy kwadratów jednego czynnika podzielona przez …

5
Nowoczesne sieci neuronowe, które budują własną topologię
Ograniczenia standardowych algorytmów sieci neuronowej (takich jak backprop) są takie, że musisz podjąć decyzję projektową, ile ukrytych warstw i neuronów na warstwę chcesz. Zwykle szybkość uczenia się i uogólnienie są bardzo wrażliwe na te wybory. Z tego powodu algorytmy sieci neuronowej, takie jak korelacja kaskadowa, wzbudzają zainteresowanie. Zaczyna się od …

2
Porównywanie klastrów: Indeks Rand a zmienność informacji
Zastanawiałem się, czy ktokolwiek miałby wgląd lub intuicję za różnicą między zmiennością informacji a indeksem Rand do porównywania klastrów. Przeczytałem artykuł „ Porównywanie klastrów - odległość oparta na informacjach ” autorstwa Marii Melii (Journal of Multivariate Analysis, 2007), ale poza zauważeniem różnicy w definicjach, nie rozumiem, co to za odmiana …

5
Jaki jest prawidłowy sposób przetestowania znaczenia wyników klasyfikacji
Istnieje wiele sytuacji, w których możesz trenować kilka różnych klasyfikatorów lub użyć kilku różnych metod wyodrębniania cech. W literaturze autorzy często podają średni błąd klasyfikacji nad zestawem losowych podziałów danych (tj. Po podwójnie zagnieżdżonej walidacji krzyżowej), a czasem także podają wariancje błędu w stosunku do podziałów. Jednak samo to nie …

3
Regresja vs. rozbieżność ANOVA (aov vs lm w R)
Zawsze miałem wrażenie, że regresja jest po prostu bardziej ogólną formą ANOVA i że wyniki będą identyczne. Ostatnio jednak uruchomiłem zarówno regresję, jak i ANOVA dla tych samych danych, a wyniki różnią się znacznie. Oznacza to, że w modelu regresji zarówno główne efekty, jak i interakcja są znaczące, podczas gdy …
21 r  regression  anova 

6
Przykłady problemów z ukrytymi modelami Markowa?
Przeczytałem sporo ukrytych modeli Markowa i sam byłem w stanie napisać całkiem podstawową wersję. Są jednak dwa główne sposoby, których się uczę. Jednym z nich jest przeczytanie i zaimplementowanie go w kodzie (co jest zrobione), a drugim zrozumienie, w jaki sposób ma zastosowanie w różnych sytuacjach (dzięki czemu mogę lepiej …

3
Jak obliczyć margines błędu w wyniku NPS (Net Promoter Score)?
Pozwolę Wikipedii wyjaśnić, w jaki sposób obliczany jest NPS : Wynik promotora netto uzyskuje się, zadając klientom jedno pytanie w skali od 0 do 10, gdzie 10 jest „bardzo prawdopodobne”, a 0 „wcale nie prawdopodobne”: „Jak prawdopodobne jest, że poleciłbyś naszą firmę przyjaciel czy kolega? ” Na podstawie ich odpowiedzi …

3
Dlaczego powinniśmy przejmować się szybkim mieszaniem w łańcuchach MCMC?
Podczas pracy z łańcuchem Markowa Monte Carlo w celu wyciągnięcia wniosku, potrzebujemy łańcucha, który szybko się miesza, tzn. Szybko porusza się podparcie dystrybucji tylnej. Ale nie rozumiem, dlaczego potrzebujemy tej właściwości, ponieważ z tego, co rozumiem, zaakceptowane losowania kandydujące powinny i będą koncentrować się w części o dużym zagęszczeniu rozkładu …
21 mcmc 


4
Co oznacza „bezstronność”?
Co to znaczy powiedzieć, że „wariancja jest tendencyjnym estymatorem”. Co to znaczy przekonwertować tendencyjne oszacowanie na obiektywne oszacowanie za pomocą prostej formuły. Co dokładnie robi ta konwersja? Jakie jest praktyczne zastosowanie tej konwersji? Czy przeliczasz te wyniki, używając pewnego rodzaju statystyk?

1
Regresja logistyczna dla szeregów czasowych
Chciałbym zastosować binarny model regresji logistycznej w kontekście przesyłania strumieniowego danych (wielowymiarowe szeregi czasowe), aby przewidzieć wartość zmiennej zależnej danych (tj. Wiersza), które właśnie nadeszły, biorąc pod uwagę wcześniejsze obserwacje. O ile mi wiadomo, regresja logistyczna jest tradycyjnie stosowana do analizy pośmiertnej, gdzie każda zmienna zależna została już ustawiona (albo …

4
Jaka jest klątwa wymiarowości?
W szczególności szukam odniesień (artykułów, książek), które rygorystycznie pokażą i wyjaśnią przekleństwo wymiarowości. Pytanie to pojawiło się po tym, jak zacząłem czytać białą księgę autorstwa Lafferty i Wassermana. W akapicie trzecim wspominają o „dobrze znanym” równaniu, które implikuje, że najlepszym wskaźnikiem konwergencji jest ; jeśli ktokolwiek może to wyjaśnić (i …
21 theory 

1
Wydajne obliczanie macierzy odwrotnej w R
Muszę obliczyć macierz odwrotnie i używam solvefunkcji. Chociaż działa dobrze na małych matrycach, solvezwykle działa bardzo wolno na dużych matrycach. Zastanawiałem się, czy jest jakaś inna funkcja lub kombinacja funkcji (poprzez SVD, QR, LU lub inne funkcje dekompozycji), które mogą dać mi szybsze wyniki.

1
Dopasowanie modelu wykładniczego do danych
To pytanie zostało przeniesione z Przepełnienia stosu, ponieważ można na nie odpowiedzieć w ramach weryfikacji krzyżowej. Migrował 8 lat temu . Mam 2 zmienne, obie z klasy „numeryczne”: > head(y) [1] 0.4651804 0.6185849 0.3766175 0.5489810 0.3695258 0.4002567 > head(x) [1] 59.32820 68.46436 80.76974 132.90824 216.75995 153.25551 Narysowałem je, a teraz …
21 r 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.