Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jaka jest najlepsza metoda metaanalizy sieci?
Obecnie istnieje kilka różnych podejść do przeprowadzenia metaanalizy sieci lub porównania leczenia mieszanego. Najczęściej używane i dostępne są prawdopodobnie następujące: w ramach bayesowskich : podejście interakcji projektu przez leczenie w WinBUGS (np. Jackson i in. ); hierarchiczne modelowanie bayesowskie oparte na ramieniu w WinBUGS (np. Zhao i in. ); hierarchiczne …

3
Kodowanie daty / godziny (dane cykliczne) dla sieci neuronowych
Jak zakodować datę i godzinę zdarzenia dla sieci neuronowej? Nie mam ciągłych szeregów czasowych, ale niektóre wydarzenia z datą i godziną, i analizuję pewne zainteresowania. Zainteresowanie to różni się między porankami i wieczorami i różni się między dniami powszednimi oraz między latem a zimą, a także przed Bożym Narodzeniem i …

2
Czy metody bayesowskie są z natury sekwencyjne?
To znaczy, aby wykonać sekwencyjną analizę (nie wiadomo z góry dokładnie, ile danych zostanie zgromadzonych) metodami częstych wymaga szczególnej uwagi; nie można po prostu zbierać danych, dopóki wartość p nie stanie się wystarczająco mała lub przedział ufności nie będzie wystarczająco krótki. Ale czy przy analizie bayesowskiej jest to problem? Czy …

5
Jak analizować trend w nieokresowych szeregach czasowych
Załóżmy, że mam następujące nieokresowe szeregi czasowe. Oczywiście trend maleje i chciałbym to udowodnić jakimś testem (z wartością p ). Nie jestem w stanie zastosować klasycznej regresji liniowej ze względu na silną czasową (szeregową) autokorelację między wartościami. library(forecast) my.ts <- ts(c(10,11,11.5,10,10.1,9,11,10,8,9,9, 6,5,5,4,3,3,2,1,2,4,4,2,1,1,0.5,1), start = 1, end = 27,frequency = 1) …
12 r  time-series 

2
Jak działa operacja DepthConcat w „Zagłębianie się w zwoje”?
Czytając Idąc głębiej ze zwojów natknąłem się DepthConcat warstwie bloku budowlanego proponowanych modułów Incepcja , który łączy wyjście wielu tensorów o różnej wielkości. Autorzy nazywają to „Filter Concatenation”. Wydaje się, że istnieje implementacja Torch , ale tak naprawdę nie rozumiem, co ona robi. Czy ktoś może wyjaśnić prostymi słowami?

4
Uzyskiwanie właściwych wartości początkowych dla modelu nls w języku R
Próbuję dopasować prosty model prawa mocy do zestawu danych, który jest następujący: mydf: rev weeks 17906.4 1 5303.72 2 2700.58 3 1696.77 4 947.53 5 362.03 6 Celem jest przepuszczenie linii energetycznej i wykorzystanie jej do przewidywania revwartości na przyszłe tygodnie. Kilka badań doprowadziło mnie do tej nlsfunkcji, którą wdrożyłem …

1
Scikit przewiduje interpretację wyników wyjściowych
Pracuję z biblioteką scikit-learn w Pythonie. W poniższym kodzie przewiduję prawdopodobieństwo, ale nie wiem, jak odczytać wynik. Testowanie danych from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) Podziel zestaw danych X_train, X_test, y_train, y_test = cross_validation.train_test_split(X, y, test_size=0.5, random_state=0) Oblicz prawdopodobieństwo clf …

2
Dlaczego regresja kalenicy nie może zapewnić lepszej interpretacji niż LASSO?
Mam już pojęcie o zaletach i wadach regresji grzbietu i LASSO. W przypadku LASSO kara karna L1 da rzadki wektor współczynnika, który można postrzegać jako metodę wyboru cech. Istnieją jednak pewne ograniczenia dotyczące LASSO. Jeśli funkcje mają wysoką korelację, LASSO wybierze tylko jedną z nich. Ponadto w przypadku problemów, w …

1
Wybór zakresu i gęstości siatki dla parametru regularyzacji w LASSO
Tymczasem studiuję LASSO ( operator najmniejszego bezwzględnego skurczu i operatora selekcji). Widzę, że optymalną wartość parametru regularyzacji można wybrać poprzez weryfikację krzyżową. Widzę również w regresji grzbietu i wielu metodach, które stosują regularyzację, możemy użyć CV, aby znaleźć optymalny parametr regularyzacji (mówiąc karę). Teraz moje pytanie dotyczy początkowych wartości górnej …


1
Dokładny test Fishera daje niejednolite wartości p
Próbuję zastosować dokładny test Fishera w symulowanym problemie genetycznym, ale wartości p wydają się być przekrzywione po prawej stronie. Będąc biologiem, chyba brakuje mi czegoś oczywistego dla każdego statystyki, więc byłbym bardzo wdzięczny za twoją pomoc. Moja konfiguracja jest następująca: (konfiguracja 1, marginesy nie są ustalone) Dwie próbki 0 i …


1
Należy częściowy
Oto model utworzony z mtcarszestawu danych: > ols(mpg~wt+am+qsec, mtcars) Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination Ratio Test Indexes Obs 32 LR chi2 60.64 R2 0.850 sigma 2.4588 d.f. 3 R2 adj 0.834 d.f. 28 Pr(> chi2) 0.0000 g …

3
Jeffreys Prior dla rozkładu normalnego z nieznaną średnią i wariancją
Czytam wcześniejsze rozkłady i wcześniej obliczyłem Jeffreysa dla próbki normalnie rozmieszczonych zmiennych losowych o nieznanej średniej i nieznanej wariancji. Zgodnie z moimi obliczeniami, dla Jeffreysa przedtem obowiązuje: Tutaj matrycą informacji Fishera.jap ( μ , σ2)) = de t ( I)-----√= de t ( 1 / σ2)001 / ( 2 σ4))------------------√= …

2
Biased bootstrap: czy można wyśrodkować CI wokół obserwowanej statystyki?
Jest to podobne do Bootstrap: oszacowanie jest poza przedziałem ufności Mam pewne dane, które reprezentują liczbę genotypów w populacji. Chcę oszacować różnorodność genetyczną za pomocą indeksu Shannona, a także wygenerować przedział ufności za pomocą ładowania początkowego. Zauważyłem jednak, że oszacowanie za pomocą ładowania początkowego jest zwykle bardzo stronnicze i skutkuje …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.