Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak grupować szeregi czasowe?
Mam pytanie dotyczące analizy skupień. Istnieje 3000 firm, które muszą być grupowane w zależności od zużycia energii przez 5 lat. Każda firma ma wartości dla każdej godziny przez 5 lat. Chciałbym dowiedzieć się, czy niektóre firmy mają taki sam wzorzec mocy użytkowej w danym okresie. Wyniki należy wykorzystać do codziennego …

5
Próbkowanie dla niezrównoważonych danych w regresji
Pojawiły się dobre pytania dotyczące postępowania z niezrównoważonymi danymi w kontekście klasyfikacji , ale zastanawiam się, co ludzie robią, aby próbować pod kątem regresji. Powiedzmy, że dziedzina problemowa jest bardzo wrażliwa na znak, ale tylko w pewnym stopniu wrażliwa na wielkość celu. Jednak wielkość jest na tyle ważna, że ​​modelem …


5
Twierdzenie Bayesa Intuicja
Próbowałem opracować intuicyjne rozumienie twierdzenia Bayesa w kategoriach wcześniejszego , późniejszego , prawdopodobieństwa i marginalnego prawdopodobieństwa. W tym celu używam następującego równania: gdzie reprezentuje hipotezę lub przekonanie, a reprezentuje dane lub dowody. Zrozumiałem pojęcie a posteriori - jest to jednocząca istota, która łączy wcześniejsze przekonanie i prawdopodobieństwo zdarzenia. Czego nie …

4
Dlaczego dane wyjściowe softmax nie są dobrą miarą niepewności w modelach Deep Learning?
Od jakiegoś czasu pracuję z Convolutional Neural Networks (CNN), głównie nad danymi obrazu do segmentacji semantycznej / segmentacji instancji. Często wizualizowałem softmax wyjścia sieciowego jako „mapę cieplną”, aby zobaczyć, jak wysokie są aktywacje na piksel dla określonej klasy. Zinterpretowałem niskie aktywacje jako „niepewne” / „niepewne”, a wysokie aktywacje jako „pewne” …

5
Surowa czy ortogonalna regresja wielomianowa?
Chcę regresować zmienną na . Czy powinienem to zrobić przy użyciu surowych czy ortogonalnych wielomianów? Spojrzałem na pytanie na stronie, które się nimi zajmują, ale tak naprawdę nie rozumiem, jaka jest różnica między ich używaniem. yyyx , x2), … , X5x,x2),…,x5x,x^2,\ldots,x^5 Dlaczego nie mogę po prostu wykonać „normalnej” regresji, aby …

1
Upuszczenie jednej z kolumn podczas kodowania na gorąco
Rozumiem, że w uczeniu maszynowym może być problem, jeśli zestaw danych ma wysoce skorelowane funkcje, ponieważ skutecznie kodują te same informacje. Ostatnio ktoś zauważył, że gdy wykonujesz kodowanie na gorąco na zmiennej kategorialnej, masz skorelowane cechy, więc powinieneś upuścić jedną z nich jako „odniesienie”. Na przykład kodowanie płci jako dwóch …

2
Czy PCA można zastosować do danych szeregów czasowych?
Rozumiem, że analiza głównych składników (PCA) może być stosowana zasadniczo do danych przekrojowych. Czy PCA można skutecznie wykorzystać do danych szeregów czasowych, określając rok jako zmienną szeregu czasowego i normalnie uruchamiając PCA? Przekonałem się, że dynamiczny PCA działa dla danych panelu, a kodowanie w Stata jest przeznaczone dla danych panelu, …
22 time-series  pca 


2
Skąd nazwa „jądro” w statystykach i ML?
Zostało to zadane na innych stronach SE w kontekście systemów operacyjnych i algebry liniowej, ale to samo pytanie mnie martwi w odniesieniu do metod jądra używanych w statystyce i uczeniu maszynowym. Często mówi się, że jądra, np. W szacowaniu gęstości jądra lub SVM, reprezentują pewne podobieństwo, ale nie rozumiem, skąd …

3
Czym dokładnie jest ziarno w generatorze liczb losowych?
Próbowałem użyć zwykłego wyszukiwania w Google itp., Ale większość odpowiedzi, które znalazłem, są albo niejasne, albo specyficzne dla języka / biblioteki, takie jak Python lub C ++ stdlib.hitp. Szukam agnostycznej, matematycznej odpowiedzi na język, a nie specyfiki biblioteki. Na przykład wielu twierdzi, że ziarno jest punktem początkowym generatora liczb losowych, …

3
Czy istnieje jakaś różnica między częstym a bayesowskim w definicji prawdopodobieństwa?
Niektóre źródła podają, że funkcja prawdopodobieństwa nie jest prawdopodobieństwem warunkowym, niektóre twierdzą, że tak. To jest dla mnie bardzo mylące. Według większości źródeł, które widziałem, prawdopodobieństwo rozkładu z parametrem powinno być iloczynem funkcji masy prawdopodobieństwa, biorąc pod uwagę próbek x_i :n x iθθ\thetannnxixix_i L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(\theta) = L(x_1,x_2,...,x_n;\theta) = \prod_{i=1}^n p(x_i;\theta) Na …

4
Biorąc pod uwagę wystarczająco dużą wielkość próby, test zawsze pokaże znaczący wynik, chyba że rzeczywisty rozmiar efektu wynosi dokładnie zero. Czemu?
Jestem ciekawy twierdzenia zawartego w artykule Wikipedii dotyczącym wielkości efektu . Konkretnie: [...] porównanie statystyczne o wartości innej niż zero zawsze będzie wykazywać statystycznie znaczące wyniki, chyba że wielkość efektu populacji będzie dokładnie równa zero Nie jestem pewien, co to oznacza / sugeruje, nie mówiąc już o argumentach na poparcie …

2
Granica estymacji regresji grzbietu „wariancji jednostkowej”, gdy
Rozważ regresję kalenicową z dodatkowym ograniczeniem wymagającym, aby miał jednostkową sumę kwadratów (równoważnie wariancję jednostkową); w razie potrzeby można założyć, że ma również jednostkową sumę kwadratów:y^y^\hat{\mathbf y}yy\mathbf y β^∗λ=argmin{∥y−Xβ∥2+λ∥β∥2}s.t.∥Xβ∥2=1.β^λ∗=arg⁡min{‖y−Xβ‖2+λ‖β‖2}s.t.‖Xβ‖2=1.\hat{\boldsymbol\beta}_\lambda^* = \arg\min\Big\{\|\mathbf y - \mathbf X \boldsymbol \beta\|^2+\lambda\|\boldsymbol\beta\|^2\Big\} \:\:\text{s.t.}\:\: \|\mathbf X \boldsymbol\beta\|^2=1. Jaki jest limit β^∗λβ^λ∗\hat{\boldsymbol\beta}_\lambda^* kiedy λ→∞λ→∞\lambda\to\infty ? Oto kilka …

1
Pokazuje, że 100 pomiarów dla 5 pacjentów dostarcza znacznie mniej informacji niż 5 pomiarów dla 100 pacjentów
Na konferencji usłyszałem następujące oświadczenie: 100 pomiarów dla 5 osób dostarcza znacznie mniej informacji niż 5 pomiarów dla 100 osób. To trochę oczywiste, że to prawda, ale zastanawiałem się, jak można to udowodnić matematycznie ... Myślę, że można zastosować liniowy model mieszany. Jednak niewiele wiem o matematyce użytej do ich …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.