Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Różnica między brakującymi danymi a danymi rzadkimi w algorytmach uczenia maszynowego
Jakie są główne różnice między danymi rzadkimi a brakującymi? Jak wpływa na uczenie maszynowe? Mówiąc dokładniej, jaki wpływ rzadkie dane i brakujące dane mają na algorytmy klasyfikacji i algorytmy regresji (przewidywania liczb). Mówię o sytuacji, w której odsetek brakujących danych jest znaczny i nie możemy upuścić wierszy zawierających brakujące dane.

2
Dlaczego minimalizacja MAE prowadzi do prognozowania mediany, a nie średniej?
Z podręcznika Prognozowanie: Zasady i praktyka autorstwa Roba J Hyndmana i George'a Athanasopoulosa , w szczególności rozdziału dotyczącego pomiaru dokładności : Metoda prognozy, która minimalizuje MAE, doprowadzi do prognoz mediany, a minimalizacja RMSE doprowadzi do prognoz średniej Czy ktoś może podać intuicyjne wyjaśnienie, dlaczego minimalizacja MAE prowadzi do prognozowania mediany, …
20 forecasting  mean  median  rms  mae 

2
Bayesian myśli o przeuczeniu
Poświęciłem dużo czasu na opracowanie metod i oprogramowania do walidacji modeli predykcyjnych w tradycyjnej dziedzinie statystyki częstokroć. Wprowadzając w życie więcej pomysłów bayesowskich i nauczając, dostrzegam kilka kluczowych różnic do przyjęcia. Po pierwsze, bayesowskie modelowanie predykcyjne prosi analityka o przemyślenie wcześniejszych dystrybucji, które można dostosować do cech kandydujących, a ci …

5
Dlaczego działa inżynieria funkcji?
Ostatnio dowiedziałem się, że jednym ze sposobów znajdowania lepszych rozwiązań problemów ML jest tworzenie funkcji. Można to zrobić, na przykład sumując dwie funkcje. Na przykład, mamy dwie cechy: „atak” i „obrona” jakiegoś bohatera. Następnie tworzymy dodatkową funkcję o nazwie „total”, która jest sumą „ataku” i „obrony”. Teraz wydaje mi się …

2
Jak sensowne jest wykonywanie OLS po wyborze zmiennej LASSO?
Ostatnio odkryłem, że w stosowanej literaturze ekonometrycznej, gdy mamy do czynienia z problemami wyboru cech, nierzadko wykonuje się LASSO, a następnie regresję OLS przy użyciu wybranych zmiennych. Zastanawiałem się, jak możemy zakwalifikować ważność takiej procedury. Czy spowoduje to problemy takie jak pominięte zmienne? Jakieś dowody wskazujące, że jest on bardziej …

3
Jak właściwie wykorzystać wczesne zatrzymanie do treningu głębokiej sieci neuronowej?
Mam model głębokiej sieci neuronowej i muszę go wyszkolić na moim zestawie danych, który składa się z około 100 000 przykładów, moje dane weryfikacyjne zawierają około 1000 przykładów. Ponieważ trenowanie każdego przykładu zajmuje trochę czasu (około 0,5 s dla każdego przykładu) i aby uniknąć nadmiernego dopasowania, chciałbym zastosować wcześniejsze zatrzymanie, …

4
Różnica między sprzężeniem zwrotnym RNN i LSTM / GRU
Próbuję zrozumieć różne architektury RNN (Recurrent Neural Network), które mają być zastosowane do danych szeregów czasowych, i zaczynam się mylić z różnymi nazwami, które są często używane przy opisywaniu RNN. Czy struktura Długiej pamięci krótkoterminowej (LSTM) i Gated Recurrent Unit (GRU) jest zasadniczo RNN z pętlą sprzężenia zwrotnego?



2
Po co w sieciach neuronowych używać metod gradientowych zamiast innych metaheurystyk?
Dlaczego podczas treningu głębokich i płytkich sieci neuronowych powszechnie stosuje się metody gradientowe (np. Opadanie gradientu, Niestierow, Newton-Raphson), w przeciwieństwie do innych metaheurystyk? Przez metaheurystykę rozumiem metody takie jak symulowane wyżarzanie, optymalizacja kolonii mrówek itp., Które zostały opracowane w celu uniknięcia utknięcia w lokalnych minimach.

2
Co w nazwie: Precyzja (odwrotność wariancji)
Intuicyjnie średnia to tylko średnia z obserwacji. Wariancja polega na tym, jak bardzo te obserwacje różnią się od średniej. Chciałbym wiedzieć, dlaczego odwrotność wariancji jest znana jako precyzja. Jaką intuicję możemy z tego zrobić? I dlaczego macierz precyzji jest tak przydatna jak macierz kowariancji w rozkładzie wielowymiarowym (normalnym)? Wgląd proszę?


1
W jaki sposób LDA, technika klasyfikacji, służy również jako technika redukcji wymiarów, jak PCA
W tym artykule autor łączy liniową analizę dyskryminacyjną (LDA) z analizą głównych składników (PCA). Przy mojej ograniczonej wiedzy nie jestem w stanie śledzić, w jaki sposób LDA może być nieco podobny do PCA. Zawsze uważałem, że LDA jest formą algorytmu klasyfikacji, podobną do regresji logistycznej. Będę wdzięczny za pomoc w …


2
Wykresy rezydualne: dlaczego wykres kontra wartości dopasowane, a nie obserwowane wartości ?
W kontekście regresji OLS rozumiem, że wykres resztkowy (w porównaniu z dopasowanymi wartościami) jest konwencjonalnie oglądany w celu przetestowania stałej wariancji i oceny specyfikacji modelu. Dlaczego reszty są wykreślane względem pasowań, a nie wartości ? Czym różnią się informacje od tych dwóch wykresów?YYY Pracuję nad modelem, który wytworzył następujące wykresy …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.