Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Dlaczego kilka (jeśli nie wszystkie) testy hipotez parametrycznych zakładają losowe próbkowanie?
Testy takie jak Z, t i kilka innych zakładają, że dane są oparte na losowym próbkowaniu. Dlaczego? Załóżmy, że prowadzę badania eksperymentalne, w których bardziej zależy mi na wewnętrznej ważności niż na zewnętrznej. Tak więc, jeśli moja próbka może być nieco stronnicza, to dobrze, ponieważ zgodziłem się nie wywnioskować hipotezy …

5
Ustalanie wielkości próbki przed rozpoczęciem eksperymentu lub przeprowadzenie eksperymentu w nieskończoność?
Studiowałem statystyki wiele lat temu i zapomniałem o tym wszystkim, więc mogą wydawać się ogólnymi pytaniami koncepcyjnymi niż cokolwiek konkretnego, ale oto mój problem. Pracuję dla witryny e-commerce jako Projektant UX. Mamy platformę testową A / B, która została zbudowana lata temu i zaczynam w to wątpić. Dane, na podstawie …


2
Jak rygorystycznie uzasadnić wybrane fałszywie dodatnie / fałszywie ujemne poziomy błędu i leżący u ich podstaw stosunek kosztów?
Kontekst Grupa naukowców i statystów ( Benjamin i in., 2017 ) niedawno zasugerowała, że ​​typowy współczynnik fałszywie dodatnich ( = 0,05) stosowany jako próg dla określenia „istotności statystycznej” musi zostać dostosowany do bardziej konserwatywnego progu ( = .005). Konkurencyjna grupa naukowców i statystyk ( Lakens i in., 2018 ) odpowiedziała, …

5
gdy i niezależnie
XXX i są niezależnie losowymi zmiennymi losowymi, gdzie i . Jaki jest rozkład ?YYYX∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)}Y∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right)Z=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X Łączną gęstość podaje:(X,Y)(X,Y)(X,Y) fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|

1
Matrycowa forma propagacji wstecznej z normalizacją partii
Normalizacji partii przypisano znaczną poprawę wydajności w głębokich sieciach neuronowych. Wiele materiałów w Internecie pokazuje, jak wdrożyć je na zasadzie aktywacja po aktywacji. Zaimplementowałem już backprop za pomocą algebry macierzy i biorąc pod uwagę, że pracuję w językach wysokiego poziomu (polegając na Rcpp(i ewentualnie GPU) na gęstym mnożeniu macierzy), zgrywanie …

3
Jak zaprogramować symulację Monte Carlo paradoksu pudełkowego Bertranda?
Następujący problem został opublikowany na stronie Mensa International na Facebooku: \quad\quad\quad\quad\quad\quad\quad\quad Sam post otrzymał ponad 1000 komentarzy, ale nie będę wchodził w szczegóły na temat debaty, ponieważ wiem, że jest to paradoks skrzynki Bertranda, a odpowiedź brzmi . Zainteresowało mnie to, w jaki sposób można rozwiązać ten problem, stosując podejście …

1
Czy są -te przekształcenia katalogu głównego?
Mój kolega chce przeanalizować niektóre dane po przekształceniu zmiennej odpowiedzi przez podniesienie jej do potęgi (to znaczy ). i0,1251818\frac18y0,125y0,125y^{0.125} Nie czuję się z tym komfortowo, ale próbuję wyjaśnić, dlaczego. Nie mogę wymyślić żadnego mechanistycznego uzasadnienia tej transformacji. Nigdy wcześniej tego nie widziałem i martwię się, że być może podwyższa to …

1
Uogólnione modele addytywne (GAM), interakcje i zmienne towarzyszące
Eksplorowałem szereg narzędzi do prognozowania i odkryłem, że Uogólnione Modele Addytywne (GAM) mają największy potencjał do tego celu. GRY są świetne! Pozwalają na bardzo zwięzłe określenie złożonych modeli. Jednak ta sama zwięzłość powoduje pewne zamieszanie, szczególnie w odniesieniu do tego, w jaki sposób GAM postrzegają terminy interakcji i zmienne towarzyszące. …
12 r  modeling  gam  mgcv 

3
Badacz 1 przeprowadza 1000 regresji, badacz 2 prowadzi tylko 1, oba osiągają takie same wyniki - czy powinny dokonywać różnych wniosków?
Wyobraź sobie, że badacz bada zbiór danych i przeprowadza 1000 różnych regresji i znajduje między nimi jedną interesującą relację. Teraz wyobraź sobie, że inny badacz z tymi samymi danymi wykonuje tylko 1 regresję i okazuje się, że jest to ta sama, którą drugi badacz wziął 1000 regresji, aby ją znaleźć. …


1
Podsumowanie dopasowania GAM
Jeśli pasujemy do GAM, takiego jak: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) Gdzie używamy zestawu danych College, który można znaleźć w pakiecie ISLR. …
12 anova  gam 

1
Jak radzić sobie z brakującymi danymi podczas korzystania z splajnów lub wielomianów ułamkowych?
Czytam Multivariable Model Building: Pragmatyczne podejście do analizy regresji w oparciu o ułamkowe wielomiany do modelowania zmiennych ciągłych przez Patrick Royston i Willie Sauerbrei. Jak dotąd jestem pod wrażeniem i jest to interesujące podejście, którego wcześniej nie rozważałem. Ale autorzy nie zajmują się brakującymi danymi. Rzeczywiście, na str. 17 twierdzą, …

2
Zrozumienie regresji logistycznej i prawdopodobieństwa
Jak naprawdę działa oszacowanie parametru / Szkolenie regresji logistycznej? Spróbuję umieścić to, co do tej pory mam. Dane wyjściowe są danymi wyjściowymi funkcji logistycznej w postaci prawdopodobieństwa zależnego od wartości x: P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1-P(y=1|x)=1-{1\over1+e^{-\omega^Tx}} Dla jednego wymiaru tak zwane szanse są zdefiniowane w następujący sposób: p(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1xp(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1x{{p(y=1|x)}\over{1-p(y=1|x)}}={{p(y=1|x)}\over{p(y=0|x)}}=e^{\omega_0+\omega_1x} Teraz dodajemy logfunkcję, aby uzyskać …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.