Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Metoda Nystroem dla aproksymacji jądra
Czytałem o metodzie Nyström do aproksymacji jądra niskiej rangi. Ta metoda jest zaimplementowana w scikit-learn [1] jako metoda rzutowania próbek danych na przybliżenie niskiego rzędu mapowania cech jądra. Zgodnie z moją najlepszą wiedzą, biorąc pod uwagę zestaw szkoleniowy i funkcję jądra, generuje przybliżenie niskiego rzędu macierzy jądra poprzez zastosowanie SVD …


5
W jaki sposób łańcuch Markowa jest nieredukowalny?
Mam problem ze zrozumieniem nieredukowalnej własności łańcucha Markowa . Mówi się, że nieredukowalny oznacza, że ​​proces stochastyczny może „przejść z dowolnego stanu do dowolnego stanu”. Ale co określa, czy może przejść ze stanu do stanu , czy nie może przejść?jaiijotjj Strona wikipedia zawiera formalizację: Stan jest dostępny (zapisany ) ze …

3
Dlaczego wymiar VC jest ważny?
Wikipedia mówi, że: Wymiar VC to liczność największego zestawu punktów, które algorytm może rozbić. Na przykład klasyfikator liniowy ma liczność n + 1. Moje pytanie brzmi: dlaczego nas to obchodzi? Większość zestawów danych, na których dokonuje się klasyfikacji liniowej, ma zwykle bardzo duże rozmiary i zawiera wiele punktów.

3
Jak zbudować macierz nieporozumień dla klasyfikatora wieloklasowego?
Mam problem z 6 klasami. Buduję klasyfikator wieloklasowy w następujący sposób: dla każdej klasy mam jeden klasyfikator regresji logistycznej, używając One vs. All, co oznacza, że ​​mam 6 różnych klasyfikatorów. Mogę zgłosić macierz nieporozumień dla każdego z moich klasyfikatorów. Chciałbym jednak zgłosić macierz nieporozumień dla WSZYSTKICH klasyfikatorów, co widziałem w …





2
Jak używać auto.arima do przypisania brakujących wartości
Mam serię zoo z wieloma brakującymi wartościami. Czytałem, że auto.arimamożna przypisać te brakujące wartości? Czy ktoś może mnie nauczyć, jak to zrobić? wielkie dzięki! Próbowałem tego, ale bez powodzenia: fit <- auto.arima(tsx) plot(forecast(fit))
12 arima 



3
Czy można zastosować rozbieżność KL między rozkładem dyskretnym a ciągłym?
Nie jestem matematykiem. Przeszukałem internet o dywergencji KL. Nauczyłem się, że dywergencja KL mierzy utracone informacje, gdy przybliżamy rozkład modelu w odniesieniu do rozkładu wejściowego. Widziałem je między dowolnymi dwoma ciągłymi lub dyskretnymi rozkładami. Czy możemy to zrobić między ciągłym a dyskretnym lub odwrotnie?



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.