Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Czy istnieje jakiś problem z nadzorowanym uczeniem się, który (głębokie) sieci neuronowe nie mogłyby oczywiście przewyższyć innych metod?
Widziałem, że ludzie wkładali wiele wysiłku w SVM i jądra i wyglądają całkiem interesująco jako starter w uczeniu maszynowym. Ale jeśli spodziewamy się, że prawie zawsze moglibyśmy znaleźć lepsze rozwiązanie pod względem (głębokiej) sieci neuronowej, jakie jest znaczenie wypróbowania innych metod w tej erze? Oto moje ograniczenie na ten temat. …


3
(Dlaczego) Czy SOM w stylu Kohonena popadł w niełaskę?
O ile mogę stwierdzić, SOM w stylu Kohonen osiągnęły szczyt około 2005 roku i ostatnio nie spotkały się z tak dużą przychylnością. Nie znalazłem żadnego artykułu, który mówi, że SOM zostały uwzględnione inną metodą lub okazały się równoważne z czymś innym (w każdym razie w większych wymiarach). Ale wygląda na …

1
Jaki jest intuicyjny powód wykonywania rotacji w analizie czynnikowej / PCA i jak wybrać odpowiedni obrót?
Moje pytania Jaki jest intuicyjny powód wykonywania rotacji czynników w analizie czynnikowej (lub komponentach w PCA)? Rozumiem, że jeśli zmienne są prawie jednakowo ładowane w najlepszych komponentach (lub czynnikach), to oczywiście trudno jest odróżnić komponenty. W takim przypadku można użyć rotacji, aby uzyskać lepsze rozróżnienie komponentów. Czy to jest poprawne? …

2
Znalezienie kwartyli w R.
Pracuję nad podręcznikiem statystyk, ucząc się języka R, i natknąłem się na przeszkodę na następującym przykładzie: Po obejrzeniu ?quantilepróbowałem odtworzyć to w R z następującymi elementami: > nuclear <- c(7, 20, 16, 6, 58, 9, 20, 50, 23, 33, 8, 10, 15, 16, 104) > quantile(nuclear) 0% 25% 50% 75% …
33 r  quantiles 

2
Różnice między odległością Bhattacharyya a dywergencją KL
Szukam intuicyjnego wyjaśnienia następujących pytań: W statystyce i teorii informacji, jaka jest różnica między odległością Bhattaczarji a dywergencją KL, jako miary różnicy między dwoma dyskretnymi rozkładami prawdopodobieństwa? Czy nie mają absolutnie żadnych zależności i mierzą odległość między dwoma rozkładami prawdopodobieństwa w zupełnie inny sposób?

8
Czy można usunąć wartości odstające z danych?
Szukałem sposobu na usunięcie wartości odstających z zestawu danych i znalazłem to pytanie . Jednak w niektórych komentarzach i odpowiedziach na to pytanie ludzie wspomnieli, że usunięcie wartości odstających z danych jest złą praktyką. W moim zestawie danych mam kilka wartości odstających, które najprawdopodobniej są spowodowane błędami pomiaru. Nawet jeśli …
33 outliers 


2
Stopnie swobody w teście Hosmera-Lemeshowa
Statystyka testu dla testu Hosmera-Lemeshowa (HLT) dla dobroci dopasowania (GOF) modelu regresji logistycznej jest zdefiniowana następująco: Próbka jest następnie dzielona na decyli, , na decyl jeden oblicza następujące ilości:d=10d=10d=10D1,D2,…,DdD1,D2,…,DdD_1, D_2, \dots , D_{d} O1d=∑i∈DdyiO1d=∑i∈DdyiO_{1d}=\displaystyle \sum_{i \in D_d} y_i , tj. Zaobserwowana liczba pozytywnych przypadków w decylu ;DdDdD_d O0d=∑i∈Dd(1−yi)O0d=∑i∈Dd(1−yi)O_{0d}=\displaystyle \sum_{i \in …

4
(Dlaczego) czy modele przebudowane mają zwykle duże współczynniki?
Wyobrażam sobie, że im większy współczynnik dla zmiennej, tym większa zdolność modelu do „kołysania się” w tym wymiarze, co zapewnia większą możliwość dopasowania hałasu. Chociaż myślę, że mam rozsądne wyczucie związku między wariancją w modelu a dużymi współczynnikami, nie mam tak dobrego zrozumienia, dlaczego występują one w modelach z dopasowaniem. …

3
Czy cyfry
Załóżmy, że przestrzegasz sekwencji: 7, 9, 0, 5, 5, 5, 4, 8, 0, 6, 9, 5, 3, 8, 7, 8, 5, 4, 0, 0, 6, 6, 4, 5, 3, 3, 7, 5, 9, 8, 1, 8, 6, 2, 8, 4, 6, 4, 1, 9, 9, 0, 5, 2, 2, 0, …

3
Interpretowanie resztkowych wykresów diagnostycznych dla modeli GLM?
Szukam wskazówek, jak interpretować wykresy resztkowe modeli GLM. Szczególnie modele Poissona, ujemne dwumianowe, dwumianowe. Czego możemy oczekiwać od tych wykresów, gdy modele są „poprawne”? (na przykład oczekujemy wzrostu wariancji wraz ze wzrostem przewidywanej wartości, na przykład w przypadku modelu Poissona) Wiem, że odpowiedzi zależą od modeli. Wszelkie odniesienia (lub ogólne …

5
Czy SVM może strumieniowo uczyć się jednego przykładu na raz?
Mam zestaw danych do przesyłania strumieniowego, przykłady są dostępne pojedynczo. Musiałbym na nich dokonać klasyfikacji wielu klas. Jak tylko podałem przykład szkolenia do procesu uczenia się, muszę go odrzucić. Jednocześnie używam również najnowszego modelu do prognozowania danych nieznakowanych. O ile mi wiadomo, sieć neuronowa jest w stanie przeprowadzić uczenie strumieniowe, …


1
Jak wytrenować i zweryfikować model sieci neuronowej w R?
Jestem nowy w modelowaniu z sieciami neuronowymi, ale udało mi się stworzyć sieć neuronową ze wszystkimi dostępnymi punktami danych, która dobrze pasuje do obserwowanych danych. Sieć neuronowa została wykonana w R z pakietem nnet: require(nnet) ##33.8 is the highest value mynnet.fit <- nnet(DOC/33.80 ~ ., data = MyData, size = …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.