Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Jak naprawić jeden współczynnik i dopasować inne za pomocą regresji
Chciałbym ręcznie naprawić pewien współczynnik, powiedzmy , a następnie dopasować współczynniki do wszystkich innych predyktorów, zachowując w modelu.β 1 = 1,0β1=1.0β1=1.0\beta_1=1.0β1=1.0β1=1.0\beta_1=1.0 Jak mogę to osiągnąć za pomocą R? Szczególnie chciałbym pracować z LASSO ( glmnet), jeśli to możliwe. Alternatywnie, jak mogę ograniczyć ten współczynnik do określonego zakresu, powiedzmy ?0.5≤β1≤1.00.5≤β1≤1.00.5\le\beta_1\le1.0

1
Co mam zrobić, gdy wartości AIC są niskie i w przybliżeniu równe?
Chris Chatfield, którego wiele wysokiej jakości książek i artykułów lubiłem czytać, w (1) udziela następujących rad: Na przykład prawdopodobnie należy dokonać wyboru między modelami szeregów czasowych ARIMA o niskich i w przybliżeniu równych wartościach AIC, nie na podstawie tego, co daje minimalny AIC, ale na podstawie których można uzyskać najlepsze …

2
Co to znaczy, że wszystkie krawędzie sieci / wykresu w świecie rzeczywistym są statystycznie równie prawdopodobne, że zdarzy się to przez przypadek?
Korzystałem z metody ekstrakcji sieci szkieletowej opisanej w tym artykule: http://www.pnas.org/content/106/16/6483.abstract Zasadniczo autorzy proponują metodę opartą na statystykach, która daje prawdopodobieństwo dla każdej krawędzi na wykresie, że krawędź mogła wystąpić przypadkowo. Używam typowej granicy istotności statystycznej wynoszącej 0,05. Zastosowałem tę metodę do kilku rzeczywistych sieci, a co ciekawe, niektóre sieci …



2
Rozkład sumy kwadratów zmiennych losowych o rozkładzie T.
Patrzę na rozkład sumy kwadratów zmiennych losowych o rozkładzie T, z wykładnikiem ogona αα\alpha . Gdzie X jest rv, transformata Fouriera dla X2X2X^2 , F(t)F(t)\mathscr{F}(t) daje mi rozwiązanie dla kwadratu przed splotem F(t)nF(t)n\mathscr{F}(t)^n . F(t)=∫∞0exp(itx2)⎛⎝⎜⎜⎜(αα+x2)α+12α−−√ B(α2,12)⎞⎠⎟⎟⎟dxF(t)=∫0∞exp⁡(itx2)((αα+x2)α+12α B(α2,12))dx\mathscr{F}(t)=\int_0^{\infty } \exp \left(i\, t\, x^2\right)\left(\frac{\left(\frac{\alpha }{\alpha +x^2}\right)^{\frac{\alpha +1}{2}} }{\sqrt{\alpha }\ B\left(\frac{\alpha }{2},\frac{1}{2}\right)}\right) \, …

2
Dlaczego wykorzystywanie danych przekrojowych do wnioskowania / przewidywania zmian podłużnych jest złą rzeczą?
Szukam papieru, który mam nadzieję, że istnieje, ale nie wiem, czy on istnieje. Może to być zestaw studiów przypadków i / lub argument z teorii prawdopodobieństwa, dlaczego wykorzystanie danych przekrojowych do wnioskowania / przewidywania zmian podłużnych może być złą rzeczą (tj. Niekoniecznie tak, ale może być). Widziałem błąd popełniony na …


4
Regresja logistyczna i punkt zapalny
Mamy dane z wynikiem binarnym i niektóre zmienne towarzyszące. Użyłem regresji logistycznej do modelowania danych. Po prostu prosta analiza, nic nadzwyczajnego. Ostatecznym wyjściem ma być krzywa zależności odpowiedzi od dawki, na której pokazujemy, jak zmienia się prawdopodobieństwo dla konkretnej zmiennej towarzyszącej. Coś takiego: Otrzymaliśmy krytykę od wewnętrznego recenzenta (nie tylko …

1
Jaka intuicja kryje się za metryką zmienności informacji (VI) do walidacji klastra?
Dla takich statystycznych statystów jak ja bardzo trudno jest uchwycić ideę VImetryki (zmienności informacji) nawet po przeczytaniu odpowiedniego artykułu Marina Melii „ Porównywanie klastrów - odległość oparta na informacjach ” (Journal of Multivariate Analysis, 2007). W rzeczywistości nie znam wielu warunków klastrowania. Poniżej znajduje się MWE i chciałbym wiedzieć, co …


2
Uogólnione liniowe modele mieszane: diagnostyka
Mam losową regresję logistyczną przechwytującą (z powodu powtarzających się pomiarów) i chciałbym przeprowadzić diagnostykę, szczególnie dotyczącą wartości odstających i wpływowych obserwacji. Spojrzałem na pozostałości, aby zobaczyć, czy istnieją spostrzeżenia, które się wyróżniają. Ale chciałbym też spojrzeć na coś w rodzaju odległości Cooka lub DFFITS. Hosmer i Lemeshow (2000) twierdzą, że …

1
Dla jakich rozkładów brak korelacji oznacza niezależność?
Czczone przypomnienie w statystykach brzmi: „nieskorelowanie nie oznacza niezależności”. Zazwyczaj to przypomnienie jest uzupełniane kojącym psychologicznie (i naukowo poprawnym) stwierdzeniem „kiedy jednak te dwie zmienne są wspólnie normalnie rozmieszczone , wówczas nieskorelacja implikuje niezależność”. Mogę zwiększyć liczbę szczęśliwych wyjątków z jednego do dwóch: kiedy dwie zmienne są rozkładem Bernoulliego , …


1
Artykuł na temat przeprowadzania testów hipotez opartych na wynikach innego testu
Powszechnie wiadomo, że wybór testu statystycznego na podstawie wyników innego testu statystycznego jest problematyczny, ponieważ wartości p są trudne do interpretacji (np. Wybór testu statystycznego na podstawie wyniku innego (np. Normalności) ) . Jest to jednak nadal standardowa praktyka w wielu aplikacjach i zwykle nie wydaje się, że jest zauważana …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.