Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy wielokoliniowość jest ukryta w zmiennych jakościowych?
Zauważyłem, że podczas majstrowania przy modelu regresji wielowymiarowej zaobserwowano niewielki, ale zauważalny efekt wielokoliniowości, mierzony współczynnikami inflacji wariancji, w kategoriach zmiennej jakościowej (oczywiście po wykluczeniu kategorii odniesienia). Załóżmy na przykład, że mamy zestaw danych ze zmienną ciągłą y i jedną nominalną zmienną kategorialną x, która ma k możliwych wzajemnie wykluczających …


1
Korekta dla normalnie rozłożonej precyzji zegara
Mam eksperyment przeprowadzany na setkach komputerów rozmieszczonych na całym świecie, który mierzy występowanie niektórych zdarzeń. Zdarzenia zależą od siebie, więc mogę uporządkować je w kolejności rosnącej, a następnie obliczyć różnicę czasu. Zdarzenia powinny być rozkładane wykładniczo, ale podczas rysowania histogramu otrzymuję to: Niedokładność zegarów na komputerach powoduje, że niektórym zdarzeniom …

2
Proste przybliżenie skumulowanego rozkładu Poissona w długim ogonie?
Chcę zdecydować o pojemności CCC tabeli, aby miała ona szanse resztkowe mniejsze niż na przelanie dla danego , zakładając, że liczba wpisów jest zgodna z prawem Poissona z danym oczekiwana . p ∈ [ 40 … 120 ] E ∈ [ 10 3 … 10 12 ]2−p2−p2^{-p}p∈[40…120]p∈[40…120]p\in[40\dots 120]E∈[103…1012]E∈[103…1012]E\in[10^3\dots 10^{12}] Idealnie …

1
błąd randomForest i zmienna ważność?
Nie dostaję różnicy między rfobject$importancei importance(rfobject)w kolumnie MeanDecreaseAccuracy. Przykład: > data("iris") > fit <- randomForest(Species~., data=iris, importance=TRUE) > fit$importance setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 0.027078501 0.019418330 0.040497602 0.02898837 9.173648 Sepal.Width 0.008553449 0.001962036 0.006951771 0.00575489 2.472105 Petal.Length 0.313303381 0.291818815 0.280981959 0.29216790 41.284869 Petal.Width 0.349686983 0.318527008 0.270975757 0.31054451 46.323415 > importance(fit) …

1
Czy model P (Y | X) można wytrenować za pomocą stochastycznego spadku gradientu z nie-iidowych próbek P (X) i iidowych próbek P (Y | X)?
Podczas uczenia sparametryzowanego modelu (np. W celu zmaksymalizowania prawdopodobieństwa) za pomocą stochastycznego spadku gradientowego na niektórych zbiorach danych, powszechnie przyjmuje się, że próbki szkoleniowe są pobierane z rozkładu danych szkoleniowych. Jeśli więc celem jest modelowanie wspólnego rozkładu , to każda próbka treningowa powinna zostać pobrana z tego rozkładu.( x i …


2
Wykładniczy współczynnik regresji logistycznej inny niż iloraz szans
Jak rozumiem, wykładnicza wartość beta z regresji logistycznej jest ilorazem szans tej zmiennej dla zmiennej zależnej zainteresowania. Jednak wartość nie odpowiada ręcznie obliczonemu współczynnikowi szans. Mój model przewiduje stunting (miarę niedożywienia) przy użyciu, między innymi, ubezpieczenia. // Odds ratio from LR, being done in stata logit stunting insurance age ... …


1
„Twierdzenie o granicy środkowej” dla sumy ważonej skorelowanych zmiennych losowych
Czytam gazetę, która to twierdzi X^k= 1N.--√∑j = 0N.- 1Xjotmi- i 2 πk j / N,X^k=1N.∑jot=0N.-1Xjotmi-ja2)πkjot/N.,\hat{X}_k=\frac{1}{\sqrt{N}}\sum_{j=0}^{N-1}X_je^{-i2\pi kj/N}, (tj. dyskretna transformata Fouriera , DFT) przez CLT ma tendencję do (złożonej) losowej zmiennej gaussowskiej. Wiem jednak, że ogólnie nie jest to prawdą. Po przeczytaniu tego (błędnego) argumentu przeszukałem sieć i znalazłem ten …


2
Gigantyczna kurtoza?
Robię opisowe statystyki dziennych zwrotów z indeksów giełdowych. To jeśli i są poziomami indeksu odpowiednio w dniu 1 i dniu 2, to jest zwrotem, którego używam (całkowicie standardowe w literaturze).P 2 l o g e ( P 2P.1P1P_1P.2)P2P_2l o gmi( P2)P.1)loge(P2P1)log_e (\frac{P_2}{P_1}) Więc kurtoza jest ogromna w niektórych z nich. …



1
O korelacji kopenetycznej dla grupowania dendrogramu
Rozważ kontekst klastrowania dendrogramu. Nazwijmy pierwotne odmienności odległościami między jednostkami. Po skonstruowaniu dendrogramu definiujemy khenetyczną odmienność między dwoma osobami jako odległość między skupieniami, do których te osoby należą. Niektóre osoby uważają, że korelacja między pierwotnymi odmiennościami a kopenetycznymi odmiennościami (zwana korelacją kopenetyczną ) jest „wskaźnikiem przydatności” klasyfikacji. Brzmi dla mnie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.