Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Która funkcja strat jest prawidłowa dla regresji logistycznej?
Czytałem o dwóch wersjach funkcji straty dla regresji logistycznej, która z nich jest poprawna i dlaczego? Z uczenia maszynowego , Zhou ZH (po chińsku), z :β=(w,b) and βTx=wTx+bβ=(w,b) and βTx=wTx+b\beta = (w, b)\text{ and }\beta^Tx=w^Tx +b l(β)=∑i=1m(−yiβTxi+ln(1+eβTxi))(1)(1)l(β)=∑i=1m(−yiβTxi+ln⁡(1+eβTxi))l(\beta) = \sum\limits_{i=1}^{m}\Big(-y_i\beta^Tx_i+\ln(1+e^{\beta^Tx_i})\Big) \tag 1 Z mojego kursu na uczelni, z :zi=yif(xi)=yi(wTxi+b)zi=yif(xi)=yi(wTxi+b)z_i = y_if(x_i)=y_i(w^Tx_i …

1
Prawdopodobieństwo krzyżowe lub prawdopodobieństwo dziennika w warstwie wyjściowej
Przeczytałem tę stronę: http://neuralnetworksanddeeplearning.com/chap3.html i powiedział, że sigmoidalna warstwa wyjściowa z entropią krzyżową jest dość podobna do warstwy wyjściowej softmax z prawdopodobieństwem logarytmicznym. co się stanie, jeśli użyję sigmoid z logarytmem prawdopodobieństwa lub softmax z entropią krzyżową w warstwie wyjściowej? czy to w porządku? ponieważ widzę, że istnieje niewielka różnica …


3
Jaka jest różnica między tylnym a tylnym rozkładem predykcyjnym?
Rozumiem, co to jest posterior, ale nie jestem pewien, co oznacza ten drugi? Czym różnią się 2? Kevin P Murphy wskazał w swoim podręczniku Machine Learning: Probabilistic Perspective , że jest to „stan wewnętrznego przekonania”. Co to tak naprawdę oznacza? Miałem wrażenie, że przeor reprezentuje twoje wewnętrzne przekonania lub uprzedzenia, …





3
Użyteczność inżynierii funkcji: Po co tworzyć nowe funkcje w oparciu o istniejące funkcje?
Często widzę, że ludzie tworzą nowe funkcje w oparciu o istniejące funkcje związane z problemem uczenia maszynowego. Na przykład tutaj: https://triangleinequality.wordpress.com/2013/09/08/basic-feature-engineering-with-the-titanic-data/ ludzie uważają, że wielkość rodziny osoby jest nową funkcją na temat liczby braci, sióstr i rodziców, które były cechami istniejącymi. Ale po co to? Nie rozumiem, dlaczego tworzenie nowych …

6
Dlaczego nazywa się tak oczekiwana wartość?
Rozumiem, w jaki sposób otrzymujemy 3,5 jako oczekiwaną wartość dla rzutu rzetelną 6-stronną kostką. Ale intuicyjnie mogę spodziewać się każdej twarzy z równą szansą 1/6. Czyż zatem oczekiwana wartość rzutu kostką nie powinna być równa liczbie od 1 do 6 z jednakowym prawdopodobieństwem? Innymi słowy, na pytanie „jaka jest oczekiwana …

1
Nieprawidłowe stosowanie weryfikacji krzyżowej (raportowanie wydajności dla najlepszej wartości hiperparametru)
Ostatnio natknąłem się na artykuł, który proponuje użycie klasyfikatora k-NN w określonym zbiorze danych. Autorzy wykorzystali wszystkie dostępne próbki danych, aby przeprowadzić k-krotną weryfikację krzyżową dla różnych wartości k i zgłosić wyniki walidacji krzyżowej najlepszej konfiguracji hiperparametrów. Według mojej wiedzy wynik ten jest stronniczy i powinni zachować osobny zestaw testowy, …

2
Czy 50% przedziały ufności są lepiej oszacowane niż 95% przedziały ufności?
Moje pytanie wypływa z tego komentarza na blogu Andrew Gelmana, w którym opowiada się za stosowaniem 50% przedziałów ufności zamiast 95% przedziałów ufności, chociaż nie dlatego, że są one dokładniej oszacowane: Wolę przerwy od 50% do 95% z 3 powodów: Stabilność obliczeniowa, Bardziej intuicyjna ocena (połowa 50% przedziałów powinna zawierać …



2
Kto pierwszy użył / wynalazł wartości p?
Próbuję napisać serię postów na blogu o wartościach p i pomyślałem, że warto wrócić do miejsca, w którym wszystko się zaczęło - co wydaje się być artykułem Pearsona z 1900 roku. Jeśli znasz ten papier, pamiętasz, że obejmuje to testowanie dopasowania. Pearson jest nieco luźny w swoim języku, jeśli chodzi …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.