Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak rozpocząć budowanie modelu regresji, gdy najsilniej powiązanym predyktorem jest binarny
Mam zestaw danych zawierający 365 obserwacji trzech zmiennych mianowicie pm, tempi rain. Teraz chcę sprawdzić zachowanie pmw odpowiedzi na zmiany w dwóch pozostałych zmiennych. Moje zmienne to: pm10 = Odpowiedź (zależna) temp = predyktor (niezależny) rain = predyktor (niezależny) Oto macierz korelacji dla moich danych: > cor(air.pollution) pm temp rainy …

3
Szacowanie parametrów bayesowskich czy testowanie hipotez bayesowskich?
Wydaje się, że w społeczności bayesowskiej trwa debata na temat tego, czy powinniśmy przeprowadzać szacowanie parametrów bayesowskich czy testowanie hipotez bayesowskich. Jestem zainteresowany pozyskiwaniem opinii na ten temat. Jakie są względne mocne i słabe strony tych podejść? W jakich kontekstach jedno jest bardziej odpowiednie niż drugie? Czy powinniśmy przeprowadzać zarówno …

1
Obliczanie przedziałów ufności dla trybu?
Szukam referencji dotyczących obliczania przedziałów ufności dla trybu (ogólnie). Bootstrap może wydawać się naturalnym pierwszym wyborem, ale jak omówiono w Romano (1988), standardowy bootstrap nie działa w trybie i nie zapewnia żadnego prostego rozwiązania. Czy coś się zmieniło od czasu tego artykułu? Jaki jest najlepszy sposób obliczania przedziałów ufności dla …


2
Zrozumienie Gelman & Carlin „Beyond Power Calculations:…” (2014)
Czytam Gelman & Carlin „Beyond Power Calculations: Assessment Type S (Sign) and Type M (Magnitude) Errors” (2014). Próbuję zrozumieć główną ideę, główne podejście, ale jestem zdezorientowany. Czy ktoś mógłby pomóc mi wydestylować esencję? Papier wygląda mniej więcej tak (jeśli dobrze to zrozumiałem). Badania statystyczne w psychologii są często nękane przez …

3
Zakres wartości skośności i kurtozy dla rozkładu normalnego
Chcę wiedzieć, jaki jest zakres wartości skośności i kurtozy, dla których dane są uważane za normalnie rozłożone. Przeczytałem wiele argumentów i przeważnie miałem pomieszane odpowiedzi. Niektórzy mówią, że skośność i dla kurtozy jest dopuszczalnym zakresem normalnego rozkładu. Niektórzy mówią że skośność jest dopuszczalnym zakresem. Znalazłem tutaj szczegółową dyskusję: Jaki jest …


3
Niezawodność dopasowanej krzywej?
Chciałbym oszacować niepewność lub wiarygodność dopasowanej krzywej. Celowo nie wymieniam dokładnej wielkości matematycznej, której szukam, ponieważ nie wiem, co to jest. Tutaj (energia) jest zmienną zależną (odpowiedź), a (objętość) jest zmienną niezależną. Chciałbym znaleźć krzywą energia-objętość, , jakiegoś materiału. Wykonałem więc obliczenia za pomocą komputerowego programu chemii kwantowej, aby uzyskać …

4
Jaki jest najbardziej odpowiedni sposób na utworzenie zestawu podtrzymującego: aby usunąć niektóre przedmioty lub usunąć niektóre obserwacje z każdego przedmiotu?
Mam zestaw danych z 26 funkcjami i 31000 wierszami. Jest to zbiór danych 38 podmiotów. To jest dla systemu biometrycznego. Więc chcę być w stanie zidentyfikować podmioty. Aby mieć zestaw testowy, wiem, że muszę usunąć niektóre wartości. Więc co lepiej robić i dlaczego? (a) trzymaj 30 osób jako zestaw szkoleniowy …

1
Dlaczego duży wybór K obniża mój wynik weryfikacji krzyżowej?
Zabawy z Boston Housing zestawem danych i RandomForestRegressor(W / domyślne parametry) w scikit-learn, zauważyłem coś dziwnego: średni wynik walidacji krzyżowej spadła jak zwiększona ilość fałd poza 10. Moja strategia cross-walidacja była następująca: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... gdzie num_cvsbyło zróżnicowane. Ustawić test_sizena 1/num_cvslustro pociągu …

4
Suma niezależnych logarytmicznych zmiennych losowych wydaje się lognormalna?
Próbuję zrozumieć, dlaczego suma dwóch (lub więcej) logarytmicznych zmiennych losowych zbliża się do rozkładu logarytmicznego wraz ze wzrostem liczby obserwacji. Szukałem w Internecie i nie znalazłem żadnych wyników dotyczących tego. Oczywiście, jeśli i są niezależnymi zmiennymi logarytmicznymi, to dzięki właściwościom wykładników i losowych zmiennych gaussowskich jest również logarytmiczny. Nie ma …

3
Jakie są zalety wykładniczego generatora losowego wykorzystującego metodę Ahrensa i Dietera (1972) zamiast transformacji odwrotnej?
Moje pytanie jest inspirowane wbudowanym generatorem wykładniczej liczby losowej R. , funkcją rexp(). Podczas próby generowania wykładniczych liczb losowych rozkładanych wykładniczo wiele podręczników zaleca metodę transformacji odwrotnej opisaną na tej stronie Wikipedii . Wiem, że istnieją inne metody realizacji tego zadania. W szczególności kod źródłowy R korzysta z algorytmu przedstawionego …



1
Wybór modelu Mclust
Pakiet R mclustwykorzystuje BIC jako kryterium wyboru modelu klastra. Z mojego zrozumienia, model z najniższym BIC powinien zostać wybrany w porównaniu z innymi modelami (jeśli zależy ci tylko na BIC). Jednak gdy wszystkie wartości BIC są ujemne, Mclustfunkcja domyślnie przyjmuje model o najwyższej wartości BIC. Moje ogólne zrozumienie z różnych …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.