Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Czy istnieje wersja z wieloma próbkami lub alternatywa dla testu Kołmogorowa-Smirnowa?
Porównuję rozkład wielkości drzew na sześciu parach poletek, gdzie jedna poletka została poddana obróbce, a druga kontroli. Używając testu Kołmogorowa-Smirnowa na każdej parze wykresów, stwierdzam, że wynosi od 0,0003707 do 0,75 . Czy istnieją jakieś odpowiednie metody radzenia sobie ze wszystkimi powtórzeniami łącznie, takie jak rozszerzenie próby KS na wiele …

6
Solidna (nieparametryczna) miara, taka jak współczynnik zmienności - IQR / mediana czy alternatywa?
Dla danego zestawu danych spread jest często obliczany albo jako odchylenie standardowe, albo jako IQR (zakres międzykwartylowy). Podczas gdy a standard deviationjest znormalizowane (wyniki Z itp.), A zatem może być użyte do porównania spreadu z dwóch różnych populacji, nie jest tak w przypadku IQR, ponieważ próbki z dwóch różnych populacji …

2
Jaka jest odległość między skończoną mieszanką gaussowską a gaussowską?
Załóżmy, że mam mieszankę skończonej liczby Gaussów ze znanymi wagami, średnimi i standardowymi odchyleniami. Średnie nie są równe. Oczywiście można obliczyć średnią i odchylenie standardowe mieszaniny, ponieważ momenty są ważonymi średnimi momentów składników. Mieszanina nie ma rozkładu normalnego, ale jak daleko jest od normalności? Powyższy obraz pokazuje gęstości prawdopodobieństwa dla …

3
STL w szeregach czasowych z brakującymi wartościami do wykrywania anomalii
Próbuję wykryć anomalne wartości w szeregu czasowym danych klimatycznych z pewnymi brakującymi obserwacjami. Przeszukując sieć znalazłem wiele dostępnych podejść. Spośród nich rozkład stl wydaje się atrakcyjny w sensie usunięcia trendów i składników sezonowych i przestudiowania reszty. Czytając STL: sezonowy-Trend rozkładu procedury opartej na Lessów , stlwydaje się być elastyczni w …


2
Jak oszacować trzeci kwartyl binowanych danych?
Czy istnieje jakaś sztuczka techniczna, aby określić trzeci kwartyl, jeśli należy on do otwartego przedziału, który zawiera więcej niż jedną czwartą populacji (więc nie mogę zamknąć przedziału i użyć standardowej formuły)? Edytować W przypadku, gdy coś źle zrozumiem, podam mniej więcej pełny kontekst. Mam dane ułożone w tabeli z dwiema …



4
Wybór modelu PCA za pomocą AIC (lub BIC)
Chcę użyć Akaike Information Criterion (AIC), aby wybrać odpowiednią liczbę czynników do wyodrębnienia w PCA. Jedynym problemem jest to, że nie jestem pewien, jak określić liczbę parametrów. Rozważmy macierz X , gdzie N reprezentuje liczbę zmiennych, a T liczbę obserwacji, na przykład X \ sim \ mathcal N \ left …

1
hierarchiczne modele bayesowskie a empiryczne bayesowskie
Czy uważasz, że HBM vs EB to dwie alternatywy, w których hiperparametry są „w grze” próbkowania / szacowania / itp.? Istnieje wyraźny związek między tymi dwoma. Czy uważasz, że HBM jest bardziej „w pełni bayesowski” niż EB? Czy jest miejsce, w którym mogę zobaczyć, jakie są różnice między byciem „w …

1
Regresja liniowa z powtarzanymi pomiarami w R
Nie byłem w stanie wymyślić, jak przeprowadzić regresję liniową w R dla projektu z powtarzanymi pomiarami. W poprzednim pytaniu (wciąż bez odpowiedzi) zasugerowano mi, aby nie używać, lmale raczej używać modeli mieszanych. Użyłem lmw następujący sposób: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) (więcej szczegółów na temat zestawu danych można znaleźć pod linkiem …

2
randomForest wybiera regresję zamiast klasyfikacji
Korzystam z pakietu randomForest w R i korzystam z danych tęczówki, generowany losowy las jest klasyfikacją, ale kiedy używam zestawu danych z około 700 funkcjami (każdy z nich to piksel na obrazie 28 x 28 pikseli) i kolumna etykiety jest nazywana label, randomForestgenerowana jest regresja. Korzystam z następującego wiersza: rf …
12 r  random-forest 


1
Dlaczego warto korzystać z rejestrowanych zmiennych?
Prawdopodobnie jest to bardzo podstawowe pytanie, ale wydaje mi się, że nie jestem w stanie znaleźć na to solidnej odpowiedzi. Mam nadzieję, że mogę. Obecnie czytam artykuły jako przygotowanie do pracy magisterskiej. Obecnie czytam artykuł, który bada związek między tweetami a funkcjami giełdy. W jednej ze swoich hipotez sugerują, że …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.