Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


5
Co oznacza „rzeczywista” suma wariancji?
Jestem statystą noob, więc proszę, pomóżcie mi tutaj. Moje pytanie brzmi: co właściwie oznacza łączna wariancja ? Kiedy szukam formuły dla wariancji zbiorczej w Internecie, znajduję dużo literatury przy użyciu następującej formuły (na przykład tutaj: http://math.tntech.edu/ISR/Mathematical_Statistics/Introduction_to_Statistic_Tests/thispage/newnode19.html ): S2p=S21(n1−1)+S22(n2−1)n1+n2−2Sp2=S12(n1−1)+S22(n2−1)n1+n2−2\begin{equation} \label{eq:stupidpooledvar} \displaystyle S^2_p = \frac{S_1^2 (n_1-1) + S_2^2 (n_2-1)}{n_1 + n_2 - …
15 variance  mean  pooling 


1
Łączenie wykresów kalibracyjnych po wielokrotnej imputacji
Chciałbym uzyskać porady dotyczące łączenia wykresów kalibracyjnych / statystyk po wielokrotnym imputacji. W kontekście opracowywania modeli statystycznych w celu przewidywania przyszłego zdarzenia (np. Wykorzystanie danych z rejestrów szpitalnych do przewidywania przeżycia lub zdarzeń po wypisie ze szpitala), można sobie wyobrazić, że brakuje wielu informacji. Wielokrotna imputacja jest sposobem na poradzenie …


2
Dlaczego maksymalizacja oczekiwań jest ważna dla modeli mieszanin?
Istnieje wiele literatury podkreślającej metodę maksymalizacji oczekiwań na modelach mieszanin (mieszanina modelu Gaussa, model ukrytego Markowa itp.). Dlaczego EM jest ważny? EM to tylko sposób na optymalizację i nie jest szeroko stosowany jako metoda oparta na gradiencie (metoda przyzwoitego gradientu lub metoda newtona / quasi-newtona) lub inna metoda bez gradientu …

5
Czy oszustwo polega na usuwaniu wartości odstających na podstawie wykresu średniego błędu bezwzględnego w celu ulepszenia modelu regresji
Mam model predykcyjny przetestowany czterema metodami, jak widać na poniższym rysunku. Atrybut prognozowany przez model mieści się w zakresie 0–8. Możesz zauważyć, że istnieje jedna górna granica i trzy dolne granice wskazane przez wszystkie metody. Zastanawiam się, czy właściwe jest usunięcie tych wystąpień z danych? Czy jest to rodzaj oszustwa …


3
Dobra dokładność pomimo wysokiej wartości strat
Podczas szkolenia prostego klasyfikatora binarnego sieci neuronowej uzyskuję wysoką wartość stratności, używając entropii krzyżowej. Mimo to wartość dokładności zestawu sprawdzania poprawności jest całkiem dobra. Czy to ma jakieś znaczenie? Nie ma ścisłej korelacji między stratą a dokładnością? Mam na szkoleniu i walidacji następujące wartości: 0,4011 - acc: 0,8224 - val_loss: …

1
Jaka jest różnica między zwykłym PCA a probabilistycznym PCA?
Wiem, że zwykłe PCA nie stosuje probabilistycznego modelu obserwowanych danych. Jaka jest więc podstawowa różnica między PCA a PPCA ? W modelu PPCA utajona zmienna zawiera na przykład zmienne obserwowane , utajone (zmienne nieobserwowane x ) i macierz W , która nie musi być ortonormalna jak w zwykłym PCA. Jeszcze …
15 pca 

1
Bezstronny estymator stosunku dwóch współczynników regresji?
Załóżmy, że pasujesz do regresji liniowej / logistycznej , w celu obiektywnego oszacowania . Jesteś bardzo pewny, że zarówno jak i są bardzo pozytywne w stosunku do hałasu w swoich oszacowaniach.g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2a1a2a1a2\frac{a_1}{a_2}a1a1a_1a2a2a_2 Jeśli masz wspólną kowariancję , możesz obliczyć lub przynajmniej zasymulować odpowiedź. …

1
Jak dopasować model mieszany ze zmienną odpowiedzi od 0 do 1?
Próbuję użyć, lme4::glmer()aby dopasować dwumianowy uogólniony model mieszany (GLMM) ze zmienną zależną, która nie jest binarna, ale zmienna ciągła od zera do jednego. Można myśleć o tej zmiennej jako o prawdopodobieństwie; w rzeczywistości jest to prawdopodobieństwo zgłaszane przez ludzi (w eksperymencie, który pomagam analizować). Tj. Nie jest to ułamek „dyskretny”, …


4
W jakich rzeczywistych sytuacjach możemy zastosować algorytm wielorękiego bandyty?
Wieloręcy bandyci działają dobrze w sytuacjach, w których masz wybór i nie jesteś pewien, który z nich zmaksymalizuje twoje zdrowie. Możesz użyć algorytmu do niektórych rzeczywistych sytuacji. Na przykład nauka może być dobrą dziedziną: Jeśli dziecko uczy się stolarstwa i jest w tym kiepski, algorytm poinformuje go, że prawdopodobnie powinien …

2
Czy jesteśmy często odwiedzającymi domniemanymi / nieświadomymi Bayesianami?
W przypadku danego problemu wnioskowania wiemy, że podejście bayesowskie zwykle różni się zarówno pod względem formy, jak i wynika z podejścia fequentystycznego. Częstokroć (zwykle obejmuje mnie) często zwraca uwagę, że ich metody nie wymagają uprzedniego, a zatem są bardziej „oparte na danych” niż „oparte na ocenie”. Oczywiście Bayesian może wskazywać …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.