Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



1
Intuicyjny kalkulator kanapkowy
Wikipedia i winieta pakietu warstwowego R dostarczają dobrych informacji na temat założeń wspierających standardowe błędy współczynnika OLS oraz matematycznego tła estymatorów warstwowych. Nadal nie jestem pewien, w jaki sposób rozwiązany jest problem heteroscedastyczności resztek, prawdopodobnie dlatego, że nie do końca rozumiem standardowe oszacowanie wariancji współczynników OLS. Jaka intuicja kryje się …

12
Przykłady rozkładów z ujemną skośnością
Zainspirowany przez " rzeczywistymi przykładami typowych rozkładów ” zastanawiam się, jakich przykładów pedagogicznych używają ludzie, by wykazać negatywne przekrzywienie? Istnieje wiele „kanonicznych” przykładów rozkładów symetrycznych lub normalnych używanych w nauczaniu - nawet jeśli takie jak wzrost i waga nie przeżyją dokładniejszej analizy biologicznej! Ciśnienie krwi może być bliższe normalności. Lubię …

3
Test liniowej separowalności
Czy istnieje sposób przetestowania liniowej separowalności zestawu danych dwóch klas w dużych wymiarach? Moje wektory cech mają 40 długości. Wiem, że zawsze mogę przeprowadzać eksperymenty z regresją logistyczną i określać szybkość hitrate vs. fałszywego alarmu, aby stwierdzić, czy dwie klasy można rozdzielić liniowo, czy nie, ale dobrze byłoby wiedzieć, czy …


5
Motywacja algorytmu maksymalizacji oczekiwań
W podejściu algorytmu EM wykorzystujemy nierówność Jensena do uzyskania logp(x|θ)≥∫logp(z,x|θ)p(z|x,θ(k))dz−∫logp(z|x,θ)p(z|x,θ(k))dzlog⁡p(x|θ)≥∫log⁡p(z,x|θ)p(z|x,θ(k))dz−∫log⁡p(z|x,θ)p(z|x,θ(k))dz\log p(x|\theta) \geq \int \log p(z,x|\theta) p(z|x,\theta^{(k)}) dz - \int \log p(z|x,\theta) p(z|x,\theta^{(k)})dz θ(k+1)θ(k+1)\theta^{(k+1)}θ(k+1)=argmaxθ∫logp(z,x|θ)p(z|x,θ(k))dzθ(k+1)=arg⁡maxθ∫log⁡p(z,x|θ)p(z|x,θ(k))dz\theta^{(k+1)}=\arg \max_{\theta}\int \log p(z,x|\theta) p(z|x,\theta^{(k)}) dz Wszystko, co czytam EM, po prostu go rozwala, ale zawsze czułem się nieswojo, nie mając wyjaśnienia, dlaczego algorytm EM powstaje naturalnie. Rozumiem, …

2
Czy gdzieś w naturze widzimy kształt krzywej normalnej?
Nie chcę wiedzieć, czy niektóre zjawiska w przyrodzie mają rozkład normalny, ale czy możemy gdzieś zobaczyć kształt krzywej normalnej, tak jak na przykład w polu Galtona. Zobacz ten rysunek z Wikipedii. Należy zauważyć, że wiele matematycznych kształtów lub krzywych jest bezpośrednio widocznych w przyrodzie, na przykład złoty środek i spirala …

3
Związek między miernikiem Fishera a względną entropią
Czy ktoś może udowodnić następujący związek między wskaźnikiem informacji Fishera a względną entropią (lub dywergencją KL) w czysto matematyczny, rygorystyczny sposób? D(p(⋅,a+da)∥p(⋅,a))=12gi,jdaidaj+(O(∥da∥3)D(p(⋅,a+da)∥p(⋅,a))=12gi,jdaidaj+(O(‖da‖3)D( p(\cdot , a+da) \parallel p(\cdot,a) ) =\frac{1}{2} g_{i,j} \, da^i \, da^j + (O( \|da\|^3) gdzie a=(a1,…,an),da=(da1,…,dan)a=(a1,…,an),da=(da1,…,dan)a=(a^1,\dots, a^n), da=(da^1,\dots,da^n) , gi,j=∫∂i(logp(x;a))∂j(logp(x;a)) p(x;a) dxgi,j=∫∂i(log⁡p(x;a))∂j(log⁡p(x;a)) p(x;a) dxg_{i,j}=\int \partial_i (\log p(x;a)) …

2
Algorytm EM ręcznie wdrożony
Chcę, aby zaimplementować algorytm EM ręcznie, a następnie porównać je do wyników działań normalmixEMz mixtoolsopakowania. Oczywiście byłbym szczęśliwy, gdyby oba doprowadziły do ​​tych samych rezultatów. Głównym odniesieniem jest Geoffrey McLachlan (2000), Finite Mixture Models . Mam gęstość mieszanki dwóch Gaussów, w ogólnej formie, logarytmiczne prawdopodobieństwo podaje (McLachlan strona 48): logL.do( …

1
libsvm „osiąganie maksymalnej liczby iteracji” ostrzeżenie i wzajemna weryfikacja
Używam libsvm w trybie C-SVC z wielomianowym jądrem stopnia 2 i muszę trenować wiele SVM. Każdy zestaw treningowy ma 10 funkcji i 5000 wektorów. Podczas treningu otrzymuję to ostrzeżenie dla większości maszyn SVM, które trenuję: WARNING: reaching max number of iterations optimization finished, #iter = 10000000 Czy ktoś mógłby wyjaśnić, …


4
Transformacja w celu zwiększenia kurtozy i skośności normalnego rv
Pracuję nad algorytmem, który opiera się na fakcie, że obserwacje są normalnie rozłożone, i chciałbym empirycznie przetestować odporność algorytmu na to założenie.YYY Aby to zrobić, szukałem sekwencji przemian , które stopniowo zakłócić normalność . Na przykład, jeśli są normalne, mają skośność i kurtozę , i byłoby miło znaleźć sekwencję transformacji, …

4
Jak działa rozkład Poissona podczas modelowania ciągłych danych i czy powoduje utratę informacji?
Współpracownik analizuje niektóre dane biologiczne pod kątem swojej pracy doktorskiej z pewną nieprzyjemną heteroscedastycznością (rysunek poniżej). Analizuje to za pomocą modelu mieszanego, ale nadal ma problemy z resztkami. Logarytmiczne przekształcanie zmiennych odpowiedzi czyści wszystko i na podstawie informacji zwrotnych na to pytanie wydaje się to właściwe podejście. Początkowo sądziliśmy jednak, …

5
Sparowany a niesparowany test t
Załóżmy, że mam 20 myszy. W jakiś sposób łączę myszy w pary, aby uzyskać 10 par. Na potrzeby tego pytania może to być przypadkowa para LUB może to być rozsądna para, na przykład próba sparowania myszy z tego samego miotu, tej samej płci, o podobnej wadze, LUB może to być …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.