Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Po co dodawać odwrotną częstotliwość dokumentów?
Mój podręcznik podaje idf jako gdzielog(1+Nnt)log(1+Nnt)log(1+\frac{N}{n_t}) NNN : liczba dokumentów ntntn_t : liczba dokumentów zawierających terminttt Wikipedia wymienia tę formułę jako wygładzoną wersję rzeczywistego . Rozumiem to: waha się od do co wydaje się intuicyjne. Ale przechodzi z do co wydaje się takie dziwne ... Wiem trochę o wygładzaniu z …

3
Wielomianowa utrata logistyczna vs (Entropia krzyżowa vs błąd kwadratowy)
Zauważyłem, że Caffe (platforma do głębokiego uczenia się) używała Softmax Loss Layer SoftmaxWithLoss jako warstwy wyjściowej dla większości próbek modelu . O ile mi wiadomo, warstwa Softmax Loss jest połączeniem warstwy wielomianowej straty logistycznej i warstwy Softmax . Powiedzieli to od Caffe Obliczanie gradientu warstwy Softmax Loss Layer jest bardziej …


1
W jaki sposób wzmocnienie gradientu przypomina opadanie gradientu?
Czytam przydatny wpis w Wikipedii na temat zwiększania gradientu ( https://en.wikipedia.org/wiki/Gradient_boosting ) i próbuję zrozumieć, w jaki sposób / dlaczego możemy przybliżać reszty za pomocą najbardziej stromego kroku opadania (zwanego również pseudo-gradientem ). Czy ktoś może mi podpowiedzieć, w jaki sposób najbardziej strome zejście jest powiązane / podobne do resztek? …


4
Czy rozkład prawdopodobieństwa urny zmienia się, gdy czerpiesz z niej średnio bez zamiany?
Załóżmy, że mam urnę zawierającą N różnych kolorów kulek, a każdy inny kolor może pojawić się różną liczbę razy (jeśli jest 10 czerwonych kulek, nie musi też być 10 niebieskich kulek). Jeśli znamy dokładną zawartość urny przed narysowaniem, możemy utworzyć dyskretny rozkład prawdopodobieństwa, który mówi nam o prawdopodobieństwie narysowania każdego …

5
Jaki jest dobry sposób graficznego przedstawienia bardzo dużej liczby sparowanych punktów danych?
W mojej dziedzinie zwykłym sposobem wykreślania sparowanych danych jest seria cienkich nachylonych segmentów linii, nakładających je na medianę i CI mediany dla dwóch grup: Jednak ten rodzaj wykresu staje się znacznie trudniejszy do odczytania, ponieważ liczba punktów danych staje się bardzo duża (w moim przypadku mam rzędu 10000 par): Zmniejszenie …



1
Oswajanie skosu… Dlaczego jest tak wiele funkcji skosu?
Mam nadzieję uzyskać lepszy wgląd w cztery rodzaje przekrzywienia tej społeczności. Typy, o których mówię, są wymienione na stronie pomocy http://www.inside-r.org/packages/cran/e1071/docs/skewness . Stara metoda nie została wymieniona na stronie pomocy, ale mimo to ją uwzględniam. require(moments) require(e1071) x=rnorm(100) n=length(x) hist(x) ###############type=1 e1071::skewness(x,type=1) sqrt(n) * sum((x-mean(x))^3)/(sum((x - mean(x))^2)^(3/2)) #from e1071::skewness source …
9 skewness 

7
Jeśli wszyscy 1000 badanych pacjentów nie zostanie wyleczonych przez lek, czy nie możemy powiedzieć, że akceptujemy hipotezę zerową?
W wielu miejscach przeczytałem, że nigdy nie możemy powiedzieć, że „akceptujemy” hipotezę zerową. Zamiast tego musimy powiedzieć, że „nie odrzucamy” hipotezy zerowej. Ale nie rozumiem, jak to wygląda w tym prostym przykładzie: Załóżmy, że testujemy lek, który ma całkowicie wyleczyć cukrzycę w ciągu 24 godzin. Wypróbowujemy to na 1000 pacjentach …

1
Szacowanie wielopoziomowych modeli regresji logistycznej
Poniższy wielopoziomowy model logistyczny z jedną zmienną objaśniającą na poziomie 1 (poziom indywidualny) i jedną zmienną objaśniającą na poziomie 2 (poziom grupy): logit (pI j) =π0 j+π1 jxI j… ( 1 )logit(pij)=π0j+π1jxij…(1)\text{logit}(p_{ij})=\pi_{0j}+\pi_{1j}x_{ij}\ldots (1) π0 j=γ00+γ01zjot+u0 j… ( 2 )π0j=γ00+γ01zj+u0j…(2)\pi_{0j}=\gamma_{00}+\gamma_{01}z_j+u_{0j}\ldots (2) π1 j=γ10+γ11zjot+u1 j… ( 3 )π1j=γ10+γ11zj+u1j…(3)\pi_{1j}=\gamma_{10}+\gamma_{11}z_j+u_{1j}\ldots (3) gdzie zakłada się, …


1
Pakiet Metafor: diagnostyka stronniczości i czułości
Prowadzę wielopoziomową metaanalizę, która obejmuje niektóre artykuły z wieloma wynikami. Dlatego używam tej rma.mv()funkcji. Przykładowy kod: test.main = rma.mv(yi,vi,random = ~1|ID, data = data) Mam dwa pytania: Czytałem w poprzedniej kwerendy , które podczas używania rma.mv(), ranktest()nie jest wiarygodnym testem funnel plot asymetrii. Jeśli jednak wariancja próbki zostałaby dodana do …

2
Dlaczego podczas korzystania z SVM muszę skalować funkcje?
Zgodnie z dokumentacją obiektu StandardScaler w scikit-learn: Na przykład wiele elementów wykorzystywanych w funkcji celu algorytmu uczenia się (np. Jądro RBF maszyn wektora wektorowego lub regulatory modeli liniowych L1 i L2) zakłada, że ​​wszystkie funkcje są wyśrodkowane wokół 0 i mają wariancję w tej samej kolejności. Jeśli cecha ma wariancję …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.