Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Co możemy powiedzieć o modelach danych obserwacyjnych przy braku instrumentów?
W przeszłości zadawano mi wiele pytań dotyczących opublikowanych artykułów w wielu obszarach, w których regresję (i powiązane modele, takie jak modele panelowe lub GLM) stosuje się na danych obserwacyjnych (tj. Danych niepochodzących z kontrolowanego eksperymentu , w wielu przypadkach - ale nie zawsze - danych obserwowanych w czasie), ale nie …

1
Czy modelowanie za pomocą losowych lasów wymaga krzyżowej weryfikacji?
O ile widziałem, opinie na ten temat różnią się. Najlepsza praktyka z pewnością podyktowałaby zastosowanie weryfikacji krzyżowej (szczególnie przy porównywaniu RF z innymi algorytmami w tym samym zbiorze danych). Z drugiej strony oryginalne źródło stwierdza, że ​​fakt błędu OOB obliczanego podczas szkolenia modelu jest wystarczającym wskaźnikiem wydajności zestawu testowego. Nawet …



1
Zrozumienie zastosowania logarytmów w logarytmie TF-IDF
Czytałem: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition Ale nie potrafię zrozumieć, dlaczego formuła została zbudowana w taki sposób. Co robię Rozumiem: iDF powinien na pewnym poziomie zmierzyć, jak często termin S pojawia się w każdym z dokumentów, zmniejszając jego wartość, ponieważ termin pojawia się częściej. Z tej perspektywy iDF(S)=# of Documents# of Documents containing SiDF(S)=# …

1
Zarządzanie wysoką autokorelacją w MCMC
Buduję raczej złożony hierarchiczny model bayesowski do metaanalizy przy użyciu R i JAGS. Upraszczając nieco, dwa kluczowe poziomy modelu mają gdzie jest obserwacją punkt końcowy (w tym przypadku plony GMO i GMO) w badaniu , jest efektem dla badania , są efektami dla różnych zmiennych na poziomie badania (status rozwoju …


1
Dlaczego system oceny Elo używa niewłaściwej reguły aktualizacji?
System oceny Elo wykorzystuje algorytm minimalizacji spadku gradientu funkcji utraty entropii krzyżowej między spodziewanym i obserwowanym prawdopodobieństwem wyniku w porównaniach w parach. Możemy zapisać funkcje strat ogólnych jako E=−∑n,ipiLog(qi)E=−∑n,ipiLog(qi) E=-\sum_{n,i} p_i Log (q_i) gdzie suma jest wykonywana dla wszystkich wyników i wszystkich przeciwników n . p i to obserwowana częstotliwość …

2
Kiedy zbliżają się szeregi Taylora do oczekiwań (całych) funkcji?
Przyjmij oczekiwanie na postać E(f(X))E(f(X))E(f(X)) dla pewnej zmiennej losowej jednowymiarowej XXX i całej funkcji f(⋅)f(⋅)f(\cdot) (tzn. Przedział zbieżności to cała linia rzeczywista) XXXμ≡E(x)μ≡E(x)\mu \equiv E(x)=F(μ)+ ∞ ∑ n=2f(n)(μ)E(f(x))=E(f(μ)+f′(μ)(x−μ)+f′′(μ)(x−μ)22!+…)E(f(x))=E(f(μ)+f′(μ)(x−μ)+f″(μ)(x−μ)22!+…) E(f(x)) = E\left(f(\mu) + f'(\mu)(x - \mu) + f''(\mu)\frac{(x - \mu)^2}{2!} +\ldots\right) Skróć tę serię, EN(f(x))=f(μ)+ N ∑ n=2f ( n ) …


1
Jak działa interpolacja Kriging?
Pracuję nad problemem, w którym muszę użyć Kriginga, aby przewidzieć wartość niektórych zmiennych na podstawie otaczających zmiennych. Chcę sam wdrożyć jego kod. Przejrzałem zbyt wiele dokumentów, aby zrozumieć, jak to działa, ale byłem bardzo zdezorientowany. Ogólnie rozumiem, że jest to średnia ważona, ale nie mogłem całkowicie zrozumieć procesu obliczania masy, …

1
Dlaczego wszystkie składniki PLS razem wyjaśniają tylko część wariancji oryginalnych danych?
Mam zestaw danych składający się z 10 zmiennych. Uruchomiłem częściowe najmniejsze kwadraty (PLS), aby przewidzieć pojedynczą zmienną odpowiedzi na podstawie tych 10 zmiennych, wyodrębniłem 10 składników PLS, a następnie obliczyłem wariancję każdego składnika. Na podstawie oryginalnych danych wziąłem sumę wariancji wszystkich zmiennych, która wynosi 702. Następnie podzieliłem wariancję każdego ze …

1
Matryce modelowe dla modeli efektów mieszanych
W lmerfunkcji w lme4w Ristnieje wezwanie do skonstruowania matrycy modelu efektów przypadkowych, ZZZ , jak opisano tutaj , na stronach 7 - 9. Obliczanie obejmuje produkty KhatriRao i / lub Kronecker dwóch matryc, i . J i X iZZZjotjaJiJ_iXjaXiX_i Macierz to kęs: „Macierz wskaźników wskaźników współczynnika grupowania”, ale wydaje się, …

1
Dlaczego proporcja próbki nie ma również rozkładu dwumianowego
W ustawieniu dwumianowym zmienna losowa X, która podaje liczbę sukcesów, jest rozkładana dwumianowo. Proporcję próbki można następnie obliczyć jako gdzie jest rozmiarem próbki. Mój podręcznik to stwierdzaXnXn\frac{X}{n}nnn Ta proporcja nie ma rozkładu dwumianowego jednak skoro jest po prostu skalowaną wersją losowo zmiennej losowej rozkładzie dwumianowym , czy nie powinien mieć …

2
Czy uporządkowanie wypukłe oznacza dominację prawego ogona?
Biorąc pod uwagę dwa ciągłe rozkłady FXFX\mathcal{F}_X i , nie jest dla mnie jasne, czy relacja dominacji wypukłej między nimi:FYFY\mathcal{F}_Y (0)FX&lt;cFY(0)FX&lt;cFY(0)\quad \mathcal{F}_X <_c \mathcal{F}_Y implikuje to (1)F−1Y(q)≤F−1X(q),∀q∈[0.5,1](1)FY−1(q)≤FX−1(q),∀q∈[0.5,1](1)\quad F_Y^{-1}(q) \leq F_X^{-1}(q),\quad \forall q\in[0.5,1] wstrzymuje się lub czy potrzebna jest jakaś dodatkowa hipoteza, jeśli ma się utrzymać?(1)(1)(1) Definicja dominacji wypukłej. Jeśli dwie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.