Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Strategia radzenia sobie z regresją logistyczną rzadkich zdarzeń
Chciałbym badać rzadkie zdarzenia w ograniczonej populacji. Ponieważ nie jestem pewien, która strategia najlepiej się nadaje, byłbym wdzięczny za wskazówki i referencje związane z tą kwestią, chociaż jestem świadomy, że została w dużej mierze uwzględniona. Po prostu nie wiem od czego zacząć. Mój problem dotyczy nauk politycznych i mam skończoną …

4
Różnica jąder w SVM?
Czy ktoś może mi powiedzieć różnicę między jądrami w SVM: Liniowy Wielomian Gaussowski (RBF) Sigmoid Ponieważ, jak wiemy, jądro służy do mapowania naszej przestrzeni wejściowej na przestrzeń cech o wysokiej wymiarowości. I w tej przestrzeni cech znajdujemy liniowo oddzielalną granicę. Kiedy są używane (pod jakim warunkiem) i dlaczego?

7
W Naive Bayes, po co zawracać sobie głowę wygładzaniem Laplace'a, gdy w zestawie testowym mamy nieznane słowa?
Czytałem dziś o klasyfikacji Naive Bayes. Przeczytałem pod nagłówkiem Szacowanie parametrów z dodaniem 1 wygładzania : Niech odnosi się do klasy (takiej jak Pozytywna lub Negatywna), a niech odnosi się do tokena lub słowa.cccwww Estymator największego prawdopodobieństwa dla wynosiP(w|c)P(w|c)P(w|c)count(w,c)count(c)=counts w in class ccounts of words in class c.count(w,c)count(c)=counts w in …

3
Rozkład produktów skalarnych dwóch losowych wektorów jednostkowych w wymiarach
Jeśli i są dwoma niezależnymi wektorami jednostek losowych w (równomiernie rozmieszczonymi na kuli jednostkowej), jaki jest rozkład ich iloczynu skalarnego (iloczyn skalarny) ?xx\mathbf{x}yy\mathbf{y}RreRD\mathbb{R}^Dx ⋅ yx⋅y\mathbf x \cdot \mathbf y Wydaje mi się, że gdy szybko rośnie rozkład (?) Staje się normalny z zerową średnią i wariancją malejącą w wyższych wymiarach …

4
Wykrywanie wartości odstających za pomocą standardowych odchyleń
Obserwuję moje pytanie tutaj , zastanawiam się, czy istnieją silne poglądy za czy przeciw wykorzystaniu odchylenia standardowego do wykrycia przekroczeń (np dowolny DATAPOINT że jest więcej niż 2 Odchylenie standardowe jest poboczna). Wiem, że zależy to od kontekstu badania, na przykład punkt danych, 48 kg, z pewnością będzie wartością odstającą …
27 outliers 

1
Przeliczanie macierzy podobieństwa na macierz odległości (euklidesowa)
W algorytmie Losowy las Breiman (autor) konstruuje macierz podobieństwa w następujący sposób: Wyślij wszystkie przykłady uczenia się w dół każdego drzewa w lesie Jeśli dwa przykłady wylądują w tym samym przyrostu liścia, odpowiedni element w macierzy podobieństwa o 1 Normalizuj matrycę z liczbą drzew On mówi: Bliskości między przypadkami n …

3
Czy wybielanie jest zawsze dobre?
Częstym etapem wstępnego przetwarzania algorytmów uczenia maszynowego jest wybielanie danych. Wydaje się, że zawsze dobrze jest wybielić, ponieważ dekoreluje dane, co ułatwia modelowanie. Kiedy wybielanie nie jest zalecane? Uwaga: mam na myśli dekorelację danych.

1
Jaka jest różnica między uogólnionymi równaniami szacunkowymi a GLMM?
Korzystam z GEE na 3-poziomowych niezrównoważonych danych, używając łącza logit. Czym to się różni (pod względem wniosków, które mogę wyciągnąć i znaczenia współczynników) od GLM z efektami mieszanymi (GLMM) i linkiem logit? Więcej szczegółów: Obserwacje są pojedynczymi próbami bernoulli. Są one pogrupowane w klasy i szkoły. Za pomocą R. Przypadkowe …

2
Szacunki wariancji w k-krotnej walidacji krzyżowej
Walidacja krzyżowa K-krotnie może być wykorzystana do oszacowania możliwości generalizacji danego klasyfikatora. Czy mogę (lub powinienem) również obliczyć wariancję zbiorczą ze wszystkich przebiegów sprawdzania poprawności, aby uzyskać lepsze oszacowanie jej wariancji? Jeśli nie to dlaczego? Znalazłem artykuły, które wykorzystują połączone odchylenie standardowe w wielu testach krzyżowych . Znalazłem także artykuły …


2
Utwórz listę nazw zmiennych w pętli for, a następnie przypisz im wartości
Zastanawiam się, czy istnieje prosty sposób na utworzenie listy zmiennych za pomocą pętli for i podanie jej wartości. for(i in 1:3) { noquote(paste("a",i,sep=""))=i } W powyższym kodzie, staram się tworzyć a1, a2, a3, które przypisać do wartości 1, 2, 3. Jednakże R daje komunikat o błędzie. Dzięki za pomoc.
27 r 


2
Jaka jest różnica między wariancją a średnim kwadratowym błędem?
Dziwię się, że nie zadawano tego wcześniej, ale nie mogę znaleźć pytania na stats.stackexchange. Oto wzór na obliczenie wariancji normalnie rozłożonej próbki: ∑(X−X¯)2n−1∑(X−X¯)2n−1\frac{\sum(X - \bar{X}) ^2}{n-1} Oto wzór na obliczenie średniego błędu kwadratu obserwacji w prostej regresji liniowej: ∑(yi−y^i)2n−2∑(yi−y^i)2n−2\frac{\sum(y_i - \hat{y}_i) ^2}{n-2} Jaka jest różnica między tymi dwiema formułami? Jedyną …
27 variance  error 

3
Jak ocenić, czy nadzorowany model uczenia maszynowego jest zbyt dobry, czy nie?
Czy ktoś może mi powiedzieć, jak ocenić, czy nadzorowany model uczenia maszynowego jest zbyt dobry, czy nie? Jeśli nie mam zewnętrznego zestawu danych do sprawdzania poprawności, chcę wiedzieć, czy mogę użyć ROC 10-krotnego sprawdzania poprawności krzyżowej w celu wyjaśnienia nadmiernego dopasowania. Jeśli mam zewnętrzny zestaw danych do sprawdzania poprawności, co …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.