Mam pytanie dotyczące analizy skupień. Istnieje 3000 firm, które muszą być grupowane w zależności od zużycia energii przez 5 lat. Każda firma ma wartości dla każdej godziny przez 5 lat. Chciałbym dowiedzieć się, czy niektóre firmy mają taki sam wzorzec mocy użytkowej w danym okresie. Wyniki należy wykorzystać do codziennego …
Pojawiły się dobre pytania dotyczące postępowania z niezrównoważonymi danymi w kontekście klasyfikacji , ale zastanawiam się, co ludzie robią, aby próbować pod kątem regresji. Powiedzmy, że dziedzina problemowa jest bardzo wrażliwa na znak, ale tylko w pewnym stopniu wrażliwa na wielkość celu. Jednak wielkość jest na tyle ważna, że modelem …
Próbowałem opracować intuicyjne rozumienie twierdzenia Bayesa w kategoriach wcześniejszego , późniejszego , prawdopodobieństwa i marginalnego prawdopodobieństwa. W tym celu używam następującego równania: gdzie reprezentuje hipotezę lub przekonanie, a reprezentuje dane lub dowody. Zrozumiałem pojęcie a posteriori - jest to jednocząca istota, która łączy wcześniejsze przekonanie i prawdopodobieństwo zdarzenia. Czego nie …
Od jakiegoś czasu pracuję z Convolutional Neural Networks (CNN), głównie nad danymi obrazu do segmentacji semantycznej / segmentacji instancji. Często wizualizowałem softmax wyjścia sieciowego jako „mapę cieplną”, aby zobaczyć, jak wysokie są aktywacje na piksel dla określonej klasy. Zinterpretowałem niskie aktywacje jako „niepewne” / „niepewne”, a wysokie aktywacje jako „pewne” …
Chcę regresować zmienną na . Czy powinienem to zrobić przy użyciu surowych czy ortogonalnych wielomianów? Spojrzałem na pytanie na stronie, które się nimi zajmują, ale tak naprawdę nie rozumiem, jaka jest różnica między ich używaniem. yyyx , x2), … , X5x,x2),…,x5x,x^2,\ldots,x^5 Dlaczego nie mogę po prostu wykonać „normalnej” regresji, aby …
Rozumiem, że w uczeniu maszynowym może być problem, jeśli zestaw danych ma wysoce skorelowane funkcje, ponieważ skutecznie kodują te same informacje. Ostatnio ktoś zauważył, że gdy wykonujesz kodowanie na gorąco na zmiennej kategorialnej, masz skorelowane cechy, więc powinieneś upuścić jedną z nich jako „odniesienie”. Na przykład kodowanie płci jako dwóch …
Rozumiem, że analiza głównych składników (PCA) może być stosowana zasadniczo do danych przekrojowych. Czy PCA można skutecznie wykorzystać do danych szeregów czasowych, określając rok jako zmienną szeregu czasowego i normalnie uruchamiając PCA? Przekonałem się, że dynamiczny PCA działa dla danych panelu, a kodowanie w Stata jest przeznaczone dla danych panelu, …
Jaka jest motywacja do wprowadzenia dodatkowego poziomu pośredniczości od opisowego „fałszywie dodatniego” do liczby całkowitej „1”? Czy „fałszywie pozytywne” jest naprawdę zbyt długie?
Zostało to zadane na innych stronach SE w kontekście systemów operacyjnych i algebry liniowej, ale to samo pytanie mnie martwi w odniesieniu do metod jądra używanych w statystyce i uczeniu maszynowym. Często mówi się, że jądra, np. W szacowaniu gęstości jądra lub SVM, reprezentują pewne podobieństwo, ale nie rozumiem, skąd …
Próbowałem użyć zwykłego wyszukiwania w Google itp., Ale większość odpowiedzi, które znalazłem, są albo niejasne, albo specyficzne dla języka / biblioteki, takie jak Python lub C ++ stdlib.hitp. Szukam agnostycznej, matematycznej odpowiedzi na język, a nie specyfiki biblioteki. Na przykład wielu twierdzi, że ziarno jest punktem początkowym generatora liczb losowych, …
Niektóre źródła podają, że funkcja prawdopodobieństwa nie jest prawdopodobieństwem warunkowym, niektóre twierdzą, że tak. To jest dla mnie bardzo mylące. Według większości źródeł, które widziałem, prawdopodobieństwo rozkładu z parametrem powinno być iloczynem funkcji masy prawdopodobieństwa, biorąc pod uwagę próbek x_i :n x iθθ\thetannnxixix_i L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(\theta) = L(x_1,x_2,...,x_n;\theta) = \prod_{i=1}^n p(x_i;\theta) Na …
Jestem ciekawy twierdzenia zawartego w artykule Wikipedii dotyczącym wielkości efektu . Konkretnie: [...] porównanie statystyczne o wartości innej niż zero zawsze będzie wykazywać statystycznie znaczące wyniki, chyba że wielkość efektu populacji będzie dokładnie równa zero Nie jestem pewien, co to oznacza / sugeruje, nie mówiąc już o argumentach na poparcie …
Rozważ regresję kalenicową z dodatkowym ograniczeniem wymagającym, aby miał jednostkową sumę kwadratów (równoważnie wariancję jednostkową); w razie potrzeby można założyć, że ma również jednostkową sumę kwadratów:y^y^\hat{\mathbf y}yy\mathbf y β^∗λ=argmin{∥y−Xβ∥2+λ∥β∥2}s.t.∥Xβ∥2=1.β^λ∗=argmin{‖y−Xβ‖2+λ‖β‖2}s.t.‖Xβ‖2=1.\hat{\boldsymbol\beta}_\lambda^* = \arg\min\Big\{\|\mathbf y - \mathbf X \boldsymbol \beta\|^2+\lambda\|\boldsymbol\beta\|^2\Big\} \:\:\text{s.t.}\:\: \|\mathbf X \boldsymbol\beta\|^2=1. Jaki jest limit β^∗λβ^λ∗\hat{\boldsymbol\beta}_\lambda^* kiedy λ→∞λ→∞\lambda\to\infty ? Oto kilka …
Na konferencji usłyszałem następujące oświadczenie: 100 pomiarów dla 5 osób dostarcza znacznie mniej informacji niż 5 pomiarów dla 100 osób. To trochę oczywiste, że to prawda, ale zastanawiałem się, jak można to udowodnić matematycznie ... Myślę, że można zastosować liniowy model mieszany. Jednak niewiele wiem o matematyce użytej do ich …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.