Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Przykłady PCA, w których komputery o niskiej wariancji są „przydatne”
Zwykle w analizie głównych składników (PCA) używa się pierwszych kilku komputerów PC, a komputery o niskiej wariancji są odrzucane, ponieważ nie wyjaśniają one dużej zmienności danych. Czy istnieją jednak przykłady, w których komputery PC o niskiej zmienności są przydatne (tj. Mają zastosowanie w kontekście danych, mają intuicyjne wyjaśnienie itp.) I …
24 pca 

5
Jaka jest zaleta traktowania czynnika jako losowego w modelu mieszanym?
Mam problem z uznaniem korzyści oznaczania czynnika modelowego za losowy z kilku powodów. Wydaje mi się, że prawie we wszystkich przypadkach optymalnym rozwiązaniem jest traktowanie wszystkich czynników jako ustalonych. Po pierwsze, rozróżnienie między ustalonym a losowym jest dość arbitralne. Standardowe wyjaśnienie jest takie, że jeśli ktoś interesuje się konkretnymi jednostkami …

2
Dlaczego algorytm Expectation Maximization gwarantuje osiągnięcie zbieżności z lokalnym optimum?
Przeczytałem kilka wyjaśnień algorytmu EM (np. Z Bishop's Pattern Recognition and Machine Learning oraz z Roger i Gerolami First Course on Machine Learning). Wyprowadzenie EM jest w porządku, rozumiem to. Rozumiem również, dlaczego algorytm obejmuje coś: na każdym etapie poprawiamy wynik, a prawdopodobieństwo jest ograniczone przez 1,0, więc używając prostego …

4
Czy Shapiro – Wilk jest najlepszym testem normalności? Dlaczego może być lepszy niż inne testy, takie jak Anderson-Darling?
Czytałem gdzieś w literaturze, że test Shapiro – Wilka jest uważany za najlepszy test normalności, ponieważ dla danego poziomu istotności, , prawdopodobieństwo odrzucenia hipotezy zerowej, jeśli jest fałszywe, jest wyższe niż w przypadku drugiej testy normalności.αα\alpha Czy mógłbyś mi wyjaśnić, używając matematycznych argumentów, jeśli to możliwe, jak dokładnie działa w …


3
Cross-validation lub bootstrapping w celu oceny wydajności klasyfikacji?
Jaka jest najbardziej odpowiednia metoda próbkowania do oceny wydajności klasyfikatora na określonym zbiorze danych i porównania go z innymi klasyfikatorami? Cross-validation wydaje się być standardową praktyką, ale przeczytałem, że metody takie jak bootstrap .632 są lepszym wyborem. W następstwie: czy wybór metryki wydajności wpływa na odpowiedź (jeśli użyję AUC zamiast …

2
Dlaczego w analizie przeżycia używamy modeli półparametrycznych (proporcjonalne zagrożenia Coxa) zamiast modeli w pełni parametrycznych?
To pytanie zostało przeniesione z Mathematics Stack Exchange, ponieważ można na nie odpowiedzieć podczas weryfikacji krzyżowej. Migrował 6 lat temu . Studiowałem model Cox Proporcjonalnych Zagrożeń i to pytanie jest przerzucone w większości tekstów. Cox zaproponował dopasowanie współczynników funkcji Hazard przy użyciu metody częściowego prawdopodobieństwa, ale dlaczego nie po prostu …


2
Jak zaprojektować i wdrożyć asymetryczną funkcję straty dla regresji?
Problem W regresji zwykle obliczany jest średni błąd kwadratu (MSE) dla próbki: aby zmierzyć jakość predyktora.MSE=1n∑i=1n(g(xi)−gˆ(xi))2MSE=1n∑i=1n(g(xi)−g^(xi))2 \text{MSE} = \frac{1}{n} \sum_{i=1}^n\left(g(x_i) - \widehat{g}(x_i)\right)^2 Obecnie pracuję nad problemem regresji, którego celem jest przewidzenie ceny, jaką klienci są skłonni zapłacić za produkt, biorąc pod uwagę szereg funkcji numerycznych. Jeśli przewidywana cena jest zbyt …

3
Określ różne klastry danych 1d z bazy danych
Mam tabelę bazy danych przesyłania danych między różnymi węzłami. To ogromna baza danych (z prawie 40 milionami transferów). Jednym z atrybutów jest liczba transferów bajtów (nbajtów) w zakresie od 0 bajtów do 2 tera bajtów. Chciałbym zgrupować nbytes w taki sposób, aby dane k klastrów zawierały niektóre transfery x1 należące …

2
Jak duży jest zestaw treningowy?
Czy istnieje wspólna metoda określania liczby próbek szkoleniowych wymaganych do wyszkolenia klasyfikatora (w tym przypadku LDA) w celu uzyskania minimalnej dokładności uogólnienia progu? Pytam, ponieważ chciałbym zminimalizować czas kalibracji zwykle wymagany w interfejsie mózg-komputer.

4
Czy jest to właściwa metoda testowania skutków sezonowych w danych dotyczących liczby samobójstw?
Mam 17 lat (1995–2011) danych dotyczących aktu zgonu związanych ze śmiercią samobójczą dla stanu w USA. Istnieje wiele mitologii na temat samobójstw i miesięcy / pór roku, wiele z nich jest sprzecznych, a literatura I ” Po przejrzeniu recenzji nie rozumiem zastosowanych metod ani nie ufam wynikom. Dlatego postanowiłem sprawdzić, …


1
Jak zdefiniować warunek zakończenia opadania gradientu?
Właściwie chciałem zapytać, jak mogę zdefiniować warunek końcowy zejścia gradientu. Czy mogę to zatrzymać na podstawie liczby iteracji, tj. Biorąc pod uwagę wartości parametrów, powiedzmy, 100 iteracji? A może powinienem poczekać, aż różne wartości dwóch parametrów „nowy” i „stary” będą bardzo małe w stosunku do powiedzmy ? To na pewno …

1
Interwał przewidywania regresji liniowej
Jeśli najlepszym przybliżeniem liniowym (przy użyciu najmniejszych kwadratów) moich punktów danych jest linia y=mx+by=mx+by=mx+b , jak mogę obliczyć błąd przybliżenia? Jeśli obliczę odchylenie standardowe różnic między obserwacjami i prognozami ei=real(xi)−(mxi+b)ei=real(xi)−(mxi+b)e_i=real(x_i)-(mx_i+b) , czy mogę później powiedzieć, że rzeczywista (ale nie zaobserwowana) wartość yr=real(x0)yr=real(x0)y_r=real(x_0) należy do przedziału ( y p = m …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.