Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Co to jest próg optymalny F1? Jak to obliczyć?
Użyłem funkcji h2o.glm () w R, która daje tabelę zdarzeń w wyniku wraz z innymi statystykami. Tabela awaryjna nosi tytuł „ Tabulator krzyżowy oparty na optymalnym progu F1 ” Wikipedia definiuje Wynik F1 lub Wynik F jako średnią harmoniczną precyzji i przywołania. Ale nie można znaleźć Precyzji i Przywołania tylko …
13 threshold 

2
Wzór na 95% przedział ufności dla
Poszukałem google i przeszukałem stats.stackexchange, ale nie mogę znaleźć wzoru na obliczenie 95% przedziału ufności dla wartości dla regresji liniowej. Czy ktoś może to zapewnić?R2R2)R^2 Jeszcze lepiej, powiedzmy, że uruchomiłem regresję liniową poniżej w R. Jak obliczyć 95% przedział ufności dla wartości za pomocą kodu R.R2R2)R^2 lm_mtcars <- lm(mpg ~ …

3
Teoretyczne wyniki za sztucznymi sieciami neuronowymi
Właśnie omówiłem Sztuczne sieci neuronowe na kursie Machine Learning Coursera i chciałbym poznać więcej teorii za nimi. Motywacja, którą naśladują biologię, jest dla mnie niezadowalająca. Na powierzchni wydaje się, że na każdym poziomie zastępujemy zmienne towarzyszące ich liniową kombinacją. Robiąc to wielokrotnie, pozwalamy na nieliniowe dopasowanie modelu. Nasuwa się pytanie: …

1
Jaka jest różnica między interpretacją krzywej GINI i AUC?
kiedyś tworzyliśmy krzywą GINI za pomocą wzrostu utworzonego za pomocą procentu dobrego i złego do modelowania karty wyników. Ale to, co badałem, to, że krzywa ROC jest tworzona przy użyciu macierzy konfuzji z Specyficznością (1- True Negative) jako osią x i czułością (true Positive) jako osią Y. Tak więc wynik …
13 roc  gini 

4
Interpretowanie wariancji efektu losowego w blasku
Przeglądam artykuł na temat zapylania, w którym dane są dystrybuowane dwumianowo (owoce dojrzewają lub nie). Użyłem więc glmerz jednym losowym efektem (pojedyncza roślina) i jednym stałym efektem (leczenie). Recenzent chce wiedzieć, czy roślina miała wpływ na zbiór owoców - ale mam problem z interpretacją glmerwyników. Czytałem w Internecie i wydaje …





1
Marginalna wiarygodność na podstawie danych wyjściowych Gibbsa
Odtwarzam od zera wyniki w sekcji 4.2.1 Marginalna wiarygodność na podstawie danych wyjściowych Gibbsa Siddhartha Chib Journal of the American Statistics Association, t. 90, nr 432. (grudzień 1995), s. 1313–1321. Jest to mieszanina modelu normalnego o znanej liczbie k≥1k≥1k\geq 1 składników. f(x∣w,μ,σ2)=∏i=1n∑j=1kN(xi∣μj,σ2j).(∗)f(x∣w,μ,σ2)=∏i=1n∑j=1kN(xi∣μj,σj2).(∗) f(x\mid w,\mu,\sigma^2) =\prod_{i=1}^n\sum_{j=1}^k \mathrm{N}(x_i\mid\mu_j,\sigma_j^2) \, . \qquad (*) …

1
Wyodrębnianie zboczy dla przypadków z modelu efektów mieszanych (Lme4)
Chciałbym wyodrębnić nachylenia dla każdej osoby w modelu z efektem mieszanym, jak opisano w następnym akapicie Modele mieszanych efektów zostały wykorzystane do scharakteryzowania indywidualnych ścieżek zmian w poznawczych miarach podsumowujących, w tym określeń dotyczących wieku, płci i lat edukacji jako efektów stałych (Laird i Ware, 1982; Wilson i in., 2000, …
13 r  mixed-model 

1
Determinant informacji Fishera
(Podobne pytanie zadałem na stronie math.se. ) W geometrii informacji wyznacznikiem macierzy informacji Fishera jest naturalna postać objętości na rozmaitości statystycznej, więc ma dobrą interpretację geometryczną. Na przykład fakt, że pojawia się w definicji Jeffreys przed, jest związany z jej niezmiennością przy reparametryzacjach, która jest (imho) właściwością geometryczną. Ale co …

4
Jaki stosunek niezależnych dystrybucji daje rozkład normalny?
Stosunek dwóch niezależnych rozkładów normalnych daje rozkład Cauchy'ego. Rozkład t jest rozkładem normalnym podzielonym przez niezależny rozkład chi-kwadrat. Stosunek dwóch niezależnych rozkładów chi-kwadrat daje rozkład F. Szukam współczynnika niezależnych ciągłych rozkładów, który daje normalnie rozłożoną zmienną losową o średniej i wariancji σ 2 ?μμ\muσ2σ2)\sigma^2 Prawdopodobnie istnieje nieskończony zestaw możliwych odpowiedzi. …

2
Obliczanie w modelach mieszanych przy użyciu metody R2glmm Nakagawy i Schielzetha (2013)
Czytałem o obliczaniu wartości w modelach mieszanych i po przeczytaniu FAQ R-sig, innych postów na tym forum (zamieściłem kilka, ale nie mam wystarczającej reputacji) i kilku innych odniesień, rozumiem, że używając Wartości w kontekście modeli mieszanych są skomplikowane.R 2R2R2R^2R2R2R^2 Ostatnio jednak natknąłem się na te dwa artykuły poniżej. Chociaż te …

2
Przechwytywanie sezonowości w regresji wielokrotnej dla danych dziennych
Mam codzienne dane dotyczące sprzedaży produktu o dużej sezonowości. Chcę uchwycić sezonowość w modelu regresji. Czytałem, że jeśli masz dane kwartalne lub miesięczne, w takim przypadku możesz utworzyć odpowiednio 3 i 11 zmiennych zastępczych - ale czy mogę sobie poradzić z danymi dziennymi? Mam trzy lata codziennych danych. Zmienne niezależne …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.