Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Testowanie hipotez i metoda naukowa
Czytając odpowiedzi na ten wątek , zacząłem się zastanawiać, w jaki sposób testowanie hipotez odnosi się do metody naukowej . Chociaż dobrze je rozumiem, trudno mi jest precyzyjnie powiązać je między sobą. Na wysokim poziomie metoda naukowa sprowadza się do: Twórz domysły i hipotezy (teoria) Dokonuj prognoz na podstawie tej …

3
Wyjaśnienie wzoru na medianę najbliższego punktu początkowego N próbek z kuli jednostkowej
W Elements of Statistics Learning wprowadzono problem podkreślenia problemów z k-nn w przestrzeniach o dużych wymiarach. Istnieje punktów danych, które są równomiernie rozmieszczone w kuli jednostkowej wymiarowej.pNNNppp Mediana odległości od początku do najbliższego punktu danych jest wyrażona przez wyrażenie: d(p,N)=(1−(12)1N)1pd(p,N)=(1−(12)1N)1pd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} Gdy , formuła rozkłada się do połowy promienia …


3
Czy w USA znane są uprzedzenia związane z ankietami telefonicznymi?
Patrzyłem na ankietę WashingtonTimes / ABC, a rozkład wyników, zwłaszcza ze względu na wiek, wydawał mi się zaskakujący. Poszedłem więc szukać uprzedzeń. Stwierdzono: „ankieta została przeprowadzona telefonicznie w dniach 11-14 grudnia 2014 r. Wśród losowej próby 1000 osób dorosłych. Wywiady przeprowadzono w języku angielskim i hiszpańskim na telefonach stacjonarnych i …
11 polling  politics 

1
Jak uzyskać próbkowanie Gibbsa?
W rzeczywistości waham się zadać to pytanie, ponieważ obawiam się, że zostaną skierowane do innych pytań lub Wikipedii na temat pobierania próbek Gibbs, ale nie mam wrażenia, że ​​opisują to, co jest pod ręką. Biorąc pod uwagę prawdopodobieństwo warunkowe : p ( x | y ) y = y 0 …
11 sampling  mcmc  gibbs 

2
Ekonometria bayesowskiego podejścia do metodologii badania zdarzeń
Badania zdarzeń są szeroko rozpowszechnione w ekonomii i finansach w celu ustalenia wpływu zdarzenia na cenę akcji, ale prawie zawsze opierają się na częstych wnioskach. Regresja OLS - w okresie referencyjnym innym niż okno zdarzenia - jest zwykle stosowana do określenia parametrów wymaganych do modelowania normalnego zwrotu z aktywów. Następnie …

2
Jeśli mój histogram pokazuje krzywą w kształcie dzwonu, czy mogę powiedzieć, że moje dane są zwykle dystrybuowane?
Stworzyłem histogram dla wieku respondenta i udało mi się uzyskać bardzo ładną krzywą w kształcie dzwonu, z której doszedłem do wniosku, że rozkład jest normalny. Następnie przeprowadziłem test normalności w SPSS, przy n = 169. p (Sig.) Testu Kołmogorowa-Smirnowa jest mniejsza niż 0,05, a zatem dane naruszyły założenie normalności. Dlaczego …

2
Subtelność wartości p: większa-równa vs. większa
Gdy czytam książkę Wassermanna Wszystkie statystyki, dostrzegam subtelną subtelność w definicji wartości p, której nie mogę zrozumieć. Nieformalnie Wassermann określa wartość p jako [..] prawdopodobieństwo (poniżej ) zaobserwowania wartości statystyki testowej takiej samej lub bardziej ekstremalnej niż rzeczywista obserwowana.H0H0H_0 Podkreślenie dodane. To samo bardziej formalnie (Twierdzenie 10.12): Załóżmy, że test …

1
Co mój wykres ACF mówi mi o moich danych?
Mam dwa zestawy danych: Moim pierwszym zestawem danych jest wartość inwestycji (w miliardach dolarów) w czasie, przy czym każda jednostka stanowi jeden kwartał od pierwszego kwartału 1947 r. Czas ten rozciąga się na trzeci kwartał 2002 r. Mój drugi zestaw danych jest „wynikiem przekształcenia wartości inwestycji w [pierwszy zestaw danych] …

1
Jaka jest różnica między kontrolowaniem zmiennej w modelu regresji a kontrolowaniem zmiennej w projekcie badania?
Wyobrażam sobie, że kontrolowanie zmiennej w projekcie badania jest bardziej skuteczne w zmniejszaniu błędu niż kontrolowanie jej post hoc w modelu regresji. Czy ktoś mógłby wyjaśnić formalnie, czym różnią się te dwa przypadki „kontrolowania”? Jak stosunkowo są skuteczne w zmniejszaniu błędów i uzyskiwaniu dokładniejszych prognoz?

1
Symulacja Monte Carlo w R.
Próbuję rozwiązać następujące ćwiczenie, ale tak naprawdę nie mam pojęcia, jak zacząć to robić. W mojej książce znalazłem kod, który wygląda tak, ale jest to zupełnie inne ćwiczenie i nie wiem, jak je ze sobą powiązać. Jak rozpocząć symulowanie przylotów i skąd mam wiedzieć, kiedy są one ukończone? Wiem, jak …

4
Wykrywanie wartości odstających w szeregach czasowych: jak zmniejszyć liczbę fałszywych trafień?
Próbuję zautomatyzować wykrywanie wartości odstających w szeregach czasowych i użyłem modyfikacji rozwiązania zaproponowanego przez Roba Hyndmana tutaj . Powiedzmy, że mierzę codzienne wizyty na stronie z różnych krajów. W niektórych krajach, w których codzienne wizyty to kilka setek lub tysięcy, moja metoda wydaje się działać rozsądnie. Jednak w przypadkach, gdy …

1
Korzystanie ze standardowych narzędzi uczenia maszynowego na danych ocenzurowanych po lewej stronie
Zajmuję się tworzeniem aplikacji do prognozowania, której celem jest umożliwienie importerowi prognozowania popytu na jego produkty z sieci klientów-dystrybutorów. Dane dotyczące sprzedaży są dość dobrym wskaźnikiem popytu, o ile istnieją odpowiednie zapasy, aby zaspokoić popyt. Kiedy jednak zapasy są zmniejszane do zera (sytuacja, w której staramy się pomóc naszemu klientowi …


2
glmnet: Jak zrozumieć parametryzację wielomianową?
Następujący problem: chcę przewidzieć zmienną jakościową z jedną (lub więcej) zmiennymi jakościowymi za pomocą glmnet (). Nie mogę jednak zrozumieć, jaki wynik daje mi glmnet. Ok, najpierw wygenerujmy dwie powiązane zmienne jakościowe: Generuj dane p <- 2 #number variables mu <- rep(0,p) sigma <- matrix(rep(0,p^2), ncol=p) sigma[1,2] <- .8 #some …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.