Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Prosty przykład pokazujący zalety Bayesian Model Averaging (BMA)
W swoich badaniach włączam podejście Bayesian Model Averaging (BMA) i wkrótce przedstawię kolegom moją prezentację na temat mojej pracy. Jednak BMA nie jest tak dobrze znany w mojej dziedzinie, więc po przedstawieniu im całej teorii i zanim faktycznie zastosuję ją do mojego problemu, chcę przedstawić prosty, ale pouczający przykład, dlaczego …



2
Interpretacja modelu regresji logistycznej z wieloma predyktorami
Przeprowadziłem wielowymiarową regresję logistyczną ze zmienną zależną Ybędącą śmiercią w domu opieki w pewnym okresie wejścia i otrzymałem następujące wyniki (zwróć uwagę, że zmienne zaczynają się w Anim, to ciągła wartość, podczas gdy te rozpoczynające się Bsą kategoryczne): Call: glm(Y ~ A1 + B2 + B3 + B4 + B5 …
12 r  regression  logistic 




2
Początkujący PyMC: jak właściwie pobierać próbki z dopasowanego modelu
Próbuję bardzo prostego modelu: dopasowanie Normalnego, w którym zakładam, że znam precyzję i chcę tylko znaleźć środek. Poniższy kod wydaje się poprawnie pasować do Normalnego. Ale po dopasowaniu chcę próbkować z modelu, tj. Generować nowe dane, które są podobne do mojej datazmiennej. Wiem, że mogę użyć trace("mean")do pobrania próbek dla …
12 mcmc  pymc 

1
Jaka jest optymalna funkcja odległości dla osób, gdy atrybuty są nominalne?
Nie wiem, jakiej funkcji odległości między osobami należy użyć w przypadku nominalnych (nieuporządkowanych atrybutów kategorialnych). Czytałem jakiś podręcznik i sugerują one funkcję Simple Matching, ale niektóre książki sugerują, że powinienem zmienić atrybuty nominalne na binarne i użyć współczynnika Jaccard . Co jednak, jeśli wartości atrybutu nominalnego nie wynoszą 2? co …

2
W jaki sposób wektor zmiennych może reprezentować hiperpłaszczyznę?
Czytam Elementy uczenia statystycznego i na stronie 12 (sekcja 2.3) zapisano model liniowy jako: Yˆ=XTβˆY^=XTβ^\widehat{Y} = X^{T} \widehat{\beta} ... gdzie jest transpozycją wektora kolumnowego predyktorów / zmiennych niezależnych / danych wejściowych. (Stwierdzono wcześniej, że „przyjmuje się, że wszystkie wektory są wektorami kolumnowymi”, więc czy nie byłby wektorem wiersza, a wektorem …

1
Co zrobić, gdy macierz kowariancji próbki nie jest odwracalna?
Pracuję nad niektórymi technikami grupowania, w których dla danej grupy wektorów wymiaru d zakładam wielowymiarowy rozkład normalny i obliczam przykładowy średni wektor d-wymiarowy i macierz kowariancji próbki. Potem, gdy stara się zdecydować, czy nowy, niewidzialny, d-wymiarowy wektor należy do tego klastra ja sprawdzając jego odległość za pośrednictwem tego środka: ( …

1
Jak znaleźć wariancję między punktami wielowymiarowymi?
Załóżmy, że mam macierz X, która jest n przez p, tj. Ma n obserwacji, z każdą obserwacją w przestrzeni p-wymiarowej. Jak znaleźć wariancję tych n obserwacji? W przypadku, gdy p = 1, muszę po prostu użyć formuły regularnej wariancji. Co z przypadkami, w których p> 1.
12 variance 

3
Liczba cyfr znaczących do zgłoszenia
Czy istnieje bardziej naukowy sposób określania liczby cyfr znaczących, które należy zgłosić dla średniej lub przedziału ufności w sytuacji, która jest dość standardowa - np. Klasa pierwszego roku na studiach. Widziałem liczbę znaczących cyfr do umieszczenia w tabeli , dlaczego nie używamy znaczących cyfr i liczbę znaczących cyfr w dopasowaniu …

4
Zaloguj modele liniowe
Czy ktoś może wyjaśnić, dlaczego używamy logarytmicznych modeli liniowych w kategoriach zwykłych ludzi? Pochodzę z wykształcenia inżynierskiego, a to naprawdę okazuje się dla mnie trudnym przedmiotem, to znaczy statystykami. Będę wdzięczny za odpowiedź.

1
Znajdowanie dopasowanych i przewidywanych wartości dla modelu statystycznego
Powiedzmy, że mam następujące dane i korzystam z modelu regresji: df=data.frame(income=c(5,3,47,8,6,5), won=c(0,0,1,1,1,0), age=c(18,18,23,50,19,39), home=c(0,0,1,0,0,1)) Z jednej strony prowadzę model liniowy, aby przewidzieć dochód: md1 = lm(income ~ age + home + home, data=df) Po drugie, uruchamiam model logit, aby przewidzieć wygraną zmienną: md2 = glm(factor(won) ~ age + home, data=df, …
12 r 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.