Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Interpretacja testu zanurzeniowego Hartigansa
Chciałbym znaleźć sposób na oszacowanie intensywności bimodalności niektórych rozkładów, które uzyskałem empirycznie. Z tego, co przeczytałem, wciąż trwa debata na temat sposobu kwantyfikacji bimodalności. Zdecydowałem się na test zanurzeniowy Hartigansa, który wydaje się być jedynym dostępnym na R (oryginalny artykuł: http://www.stat.washington.edu/wxs/Stat593-s03/Literature/hartigan85a.pdf ). Test zanurzeniowy Hartigansa definiuje się jako: „Test zanurzeniowy …
18 r  distributions 

1
Dowód formuły LOOCV
Z An Introduction to Statistical Learning przez James i wsp., Przerwa, jeden z krzyżowego (LOOCV) oszacowanie jest określone przez CV(n)=1n∑i=1nMSEiCV(n)=1n∑i=1nMSEi\text{CV}_{(n)} = \dfrac{1}{n}\sum\limits_{i=1}^{n}\text{MSE}_i gdzieMSEi=(yi−y^i)2MSEi=(yi−y^i)2\text{MSE}_i = (y_i-\hat{y}_i)^2. Bez dowodu równanie (5.2) stwierdza, że ​​dla regresji metodą najmniejszych kwadratów lub wielomianu (to, czy dotyczy to regresji tylko jednej zmiennej, jest dla mnie nieznane), …

2
Wygładzanie - kiedy go używać, a kiedy nie?
Istnieje dość stary post na blogu Williama Briggsa, który analizuje pułapki wygładzania danych i przenoszenia tych wygładzonych danych do analizy. Kluczowym argumentem jest mianowicie: Jeśli w chwili szaleństwa robisz gładkie dane szeregów czasowych i używasz ich jako danych wejściowych do innych analiz, znacznie zwiększasz prawdopodobieństwo oszukiwania się! Wynika to z …

5
Dlaczego warto korzystać z teorii ekstremalnych wartości?
Pochodzę z inżynierii lądowej, w której używamy teorii ekstremalnej wartości , takiej jak rozkład GEV do przewidywania wartości niektórych zdarzeń, takich jak największa prędkość wiatru , tj. Wartość, do której 98,5% prędkości wiatru byłoby niższe. Moje pytanie brzmi: po co stosować tak ekstremalny rozkład wartości ? Czy nie byłoby łatwiej, …

1
Umieszczanie strzałek na biplocie PCA
Szukam zaimplementować biplot do analizy głównych składników (PCA) w JavaScript. Moje pytanie brzmi: jak określić współrzędne strzałek z wyjścia U,V,DU,V,DU,V,D rozkładu pojedynczego wektora (SVD) macierzy danych? Oto przykładowy dwupłat wyprodukowany przez R: biplot(prcomp(iris[,1:4])) Próbowałem to sprawdzić w artykule Wikipedii na temat biplota, ale nie jest to zbyt przydatne. Lub poprawnie. …
18 pca  svd  biplot 

3
Dlaczego statystyki luk dla k-średnich sugerują jeden klaster, chociaż oczywiście są dwa z nich?
Używam K-średnich do klastra moich danych i szukałem sposobu, aby zasugerować „optymalny” numer klastra. Statystyki luk wydają się być powszechnym sposobem na znalezienie dobrego numeru klastra. Z jakiegoś powodu zwraca 1 jako optymalną liczbę klastrów, ale kiedy patrzę na dane, widać, że istnieją 2 klastry: Tak nazywam lukę w R: …

1
Prosty język oznaczeń „zależnych” i „niezależnych” testów w literaturze z wieloma porównaniami?
Zarówno w literaturze dotyczącej wskaźnika błędu rodzinnego (FWER), jak i wskaźnika fałszywego wykrywania (FDR), określone metody kontrolowania FWER lub FDR są odpowiednie do testów zależnych lub niezależnych. Na przykład w artykule z 1979 r. „Prosta sekwencyjnie wielokrotna procedura testowa wielokrotnego testu” Holm napisał, aby skontrastować swoją metodę podwyższania Šidáka z …

2
Wartość p w teście dwustronnym z asymetrycznym rozkładem zerowym
Moja sytuacja jest następująca: chcę, poprzez badanie Monte-Carlo, porównać wartości ppp dwóch różnych testów dla istotności statystycznej szacowanego parametru (zero to „brak efektu - parametr wynosi zero”, a implikowaną alternatywą jest „ parametr nie jest zerem ”). Test A to standardowy „niezależny test t dla dwóch próbek dla równości średnich” …


5
Jaka jest dobra książka o filozofii stojącej za myśleniem bayesowskim?
Jaka jest dobra książka o filozofii bayesowskiej, porównująca subiektywistów z obiektywistami, wyjaśniająca pogląd prawdopodobieństwa jako stanu wiedzy w statystyce bayesowskiej itp.? Może książka Savage'a? Na początku myślałem, że Berger (1986) może działać, ale nie tego szukam. Poszukiwanie takiej książki po prostu nie prowadzi do rezultatów, których szukam.

3
Na dokładnym teście Fishera: jaki test byłby odpowiedni, gdyby kobieta nie znała liczby filiżanek po mleku?
W słynnym eksperymencie z próbowaniem herbaty przez RA Fishera dama jest informowana o tym, ile jest filiżanek z mlekiem / z herbatą (4 na 8 filiżanek). Jest to zgodne z ustalonym marginalnym całkowitym założeniem dokładnego testu Fishera. Wyobraziłam sobie, że przeprowadzę ten test z przyjacielem, ale ta myśl mnie uderzyła. …

2
Ukryty model Markowa kontra model przejściowy Markowa vs model państwowej przestrzeni…?
W ramach mojej pracy magisterskiej pracuję nad opracowaniem modelu statystycznego dla przejść między różnymi stanami, określonego statusem serologicznym. Na razie nie podam zbyt wielu szczegółów w tym kontekście, ponieważ moje pytanie jest bardziej ogólne / teoretyczne. W każdym razie, mam intuicję, że powinienem używać ukrytego modelu Markowa (HMM); Problemem, który …

2
Średnia próbki bootstrap a statystyki próbki
Powiedzmy, że mam próbkę i próbkę bootstrap z tej próbki dla stastitic (np. Średnia). Jak wszyscy wiemy, że ta próbka bootstrap szacuje się podział próbkowania estymatora statystyki.χχ\chi Czy średnia dla tej próby ładowania początkowego jest lepszym oszacowaniem statystyki populacji niż statystyka oryginalnej próbki ? Na jakich warunkach tak by było?


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.