Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



2
Jak znaleźć macierz kowariancji wielokąta?
Wyobraź sobie, że masz wielokąt zdefiniowany przez zestaw współrzędnych (x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n) a jego środek masy wynosi (0,0)(0,0)(0,0). Można traktować wielokąt jako rozkład równomierny z granicą wielokąta. Poszukuję metody, która znajdzie macierz kowariancji wielokąta . Podejrzewam, że macierz kowariancji wielokąta jest ściśle związana z drugim momentem pola , ale nie jestem pewien, …

2
Prawdopodobieństwo
Załóżmy, że i są niezależnymi losowymi zmiennymi geometrycznymi o parametrze . Jakie jest prawdopodobieństwo, że ?X1X1X_1X2X2X_2pppX1≥X2X1≥X2X_1 \geq X_2 Jestem zdezorientowany tym pytaniem, ponieważ nie powiedziano nam nic o i poza tym, że są geometryczne. Czy nie byłoby to ponieważ i mogą być czymkolwiek w tym zakresie?X1X1X_1X2X2X_250%50%50\%X1X1X_1X2X2X_2 EDYCJA: Nowa próba P(X1≥X2)=P(X1>X2)+P(X1=X2)P(X1≥X2)=P(X1>X2)+P(X1=X2)P(X1 …

2
Jak sprawdzić, czy
Załóżmy, że mam średnio trzy niezależne grupy μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 odpowiednio. Jak mogę sprawdzić, czy μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3 lub nie korzystam n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 próbki z każdej grupy? Chciałbym poznać ogólną metodologię, a nie szczegółowe obliczenia. Nie mogłem wymyślić, jak ustalić moją hipotezęH0H0H_0 i …

3
Jak zmniejszyć predyktory we właściwy sposób dla modelu regresji logistycznej
Czytałem więc kilka książek (lub ich części) na temat modelowania (między innymi „Strategie modelowania regresji” F. Harrella, ponieważ moja obecna sytuacja jest taka, że ​​muszę zrobić model logistyczny oparty na danych binarnych odpowiedzi. W moim zestawie danych mam zarówno dane ciągłe, jakościowe, jak i binarne (predyktory). Zasadniczo mam teraz około …

13
Jeśli „B jest bardziej prawdopodobne, że otrzyma A”, to „A jest bardziej prawdopodobne, że otrzyma B”
Próbuję uzyskać jaśniejszy intuicji tyle: „Jeśli sprawia bardziej prawdopodobne, następnie sprawia bardziej prawdopodobne”, czyliZAAAbBBbBBZAAA Niech oznaczają wielkość przestrzeni, w której i są, po czymn ( S)n(S)n(S)ZAAAbBB Twierdzenie: soP.( B | A ) &gt; P( B )P(B|A)&gt;P(B)P(B|A)>P(B)n ( A B ) / n ( A ) &gt; n ( B ) …

1
Dlaczego Bayesian posterior koncentruje się wokół minimalizatora dywergencji KL?
Rozważmy Bayesa posterior . Asymptotycznie, jego maksimum występuje przy oszacowaniu MLE , co tylko maksymalizuje prawdopodobieństwo .θ ∣ Xθ∣X\theta\mid Xθ^θ^\hat \thetaargminθfaθ( X)argminθfθ(X)\operatorname{argmin}_\theta\, f_\theta(X) Wszystkie te koncepcje - priory bayesowskie, maksymalizujące prawdopodobieństwo - brzmią bardzo pryncypialnie i wcale nie są arbitralne. W polu widzenia nie ma logów. Jednak MLE minimalizuje rozbieżność …

2
Szacowanie niepewności w problemach wnioskowania wielowymiarowego bez próbkowania?
Pracuję nad problemem wnioskowania o dużych wymiarach (około 2000 parametrów modelu), dla którego jesteśmy w stanie solidnie przeprowadzić oszacowanie MAP poprzez znalezienie globalnego maksimum log-tylnego przy użyciu kombinacji optymalizacji opartej na gradiencie i algorytmu genetycznego. Bardzo chciałbym mieć możliwość oszacowania niepewności parametrów modelu oprócz znalezienia oszacowania MAP. Jesteśmy w stanie …

2
Dlaczego regresja logistyczna jest dobrze skalibrowana i jak zepsuć jej kalibrację?
W scikit dowiedz się, jakie dokumenty dotyczą kalibracji prawdopodobieństwa, porównują regresję logistyczną z innymi metodami i zauważają, że losowy las jest gorzej skalibrowany niż regresja logistyczna. Dlaczego regresja logistyczna jest dobrze skalibrowana? Jak można zepsuć kalibrację regresji logistycznej (nie żeby nigdy tego nie chciał - tylko jako ćwiczenie)?

1
Dlaczego informacje o danych walidacyjnych wyciekają, jeśli oceniam wydajność modelu na danych walidacyjnych podczas strojenia hiperparametrów?
W głębokim nauczaniu François Cholleta w Pythonie napisano: W rezultacie dostrajanie konfiguracji modelu w oparciu o jego wydajność w zestawie sprawdzania poprawności może szybko doprowadzić do nadmiernego dopasowania do zestawu sprawdzania poprawności, nawet jeśli Twój model nigdy nie jest bezpośrednio na nim szkolony. Centralnym elementem tego zjawiska jest pojęcie wycieków …

1
Sprawdzanie, czy moneta jest uczciwa
Przyjaciel zadał mi następujące pytanie. Nie mogłem jej pomóc, ale mam nadzieję, że ktoś mi to wyjaśni. Nie mogłem znaleźć podobnego przykładu. Dzięki za wszelką pomoc i wyjaśnienia. P: Wyniki 100 eksperymentów rzucania monetą są rejestrowane jako 0 = „Ogon” i 1 = „Głowa”. Wyjściowy x jest łańcuchem zer i …


4
Optymalizacja spadku gradientu
Próbuję zrozumieć optymalizację spadku gradientu w algorytmach ML (uczenie maszynowe). Rozumiem, że jest to funkcja, gdzie koszt celem jest minimalizacja błędu . W scenariuszu, w którym wagi są optymalizowane w celu uzyskania minimalnego błędu i stosowane są pochodne częściowe, czy zmienia on zarówno jak i na każdym etapie, czy też …

1
W jaki sposób dzieci potrafią zbliżyć swoich rodziców do projekcji PCA zestawu danych GWAS?
Weź 20 losowych punktów w przestrzeni 10 000 wymiarów z każdą współrzędną id matematyczną . Podziel je na 10 par („pary”) i dodaj średnią każdej pary („dziecka”) do zestawu danych. Następnie wykonaj PCA na uzyskanych 30 punktach i wykreśl PC1 vs PC2.N(0,1)N(0,1)\mathcal N(0,1) Dzieje się coś niezwykłego: każda „rodzina” tworzy …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.