Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Regresja szeregów czasowych z nakładającymi się danymi
Widzę model regresji, który regresuje zwroty z indeksu giełdowego z opóźnieniem (12 miesięcy) Rentowność z tego samego indeksu giełdowego, marżę kredytową (różnica między średnią miesięczną wolną od ryzyka obligacją a obligacją korporacyjną) plony), wskaźnik inflacji r / r oraz wskaźnik produkcji przemysłowej r / r. Wygląda to w ten sposób …

3
Potrzebujesz pomocy w identyfikacji rozkładu według jego histogramu
Mam populację próbek zarejestrowanych maksimów amplitudy określonego sygnału. Populacja wynosi około 15 milionów próbek. Stworzyłem histogram populacji, ale nie mogę zgadnąć rozkładu z takim histogramem. EDYCJA 1: Plik z surowymi przykładowymi wartościami jest tutaj: surowe dane Czy ktoś może pomóc oszacować rozkład za pomocą następującego histogramu:

3
Jakie jest prawdopodobieństwo, że rozkład normalny z nieskończoną wariancją ma wartość większą niż jego średnia?
W dzisiejszym wywiadzie zapytano mnie o coś podobnego do tego. Ankieter chciał wiedzieć, jakie jest prawdopodobieństwo, że opcja „za pieniądze” skończy się w pieniądzu, gdy zmienność zmierza do nieskończoności. Powiedziałem 0%, ponieważ rozkłady normalne, które leżą u podstaw modelu Blacka-Scholesa i hipoteza losowego marszu będą miały nieskończoną wariancję. Pomyślałem, że …

1
Regresja logistyczna z danymi kierunkowymi jak IV
Szukam dobrych referencji na temat używania danych kierunkowych (miara kierunku w stopniach) jako niezależnej zmiennej w regresji; idealnie byłoby to również przydatne w przypadku hierarchicznych modeli nieliniowych (dane są zagnieżdżone). Interesują mnie również dane kierunkowe bardziej ogólnie. Znalazłem tekst Mardii, który otrzymam, ale zastanawiałem się, czy są dobre artykuły. Bardziej …

4
Bezstronny estymator dla mniejszej z dwóch zmiennych losowych
Załóżmy, że iY ∼ N ( μ y , σ 2 y )X∼N(μx,σ2x)X∼N(μx,σx2)X \sim \mathcal{N}(\mu_x, \sigma^2_x)Y∼N(μy,σ2y)Y∼N(μy,σy2)Y \sim \mathcal{N}(\mu_y, \sigma^2_y) Interesuje mnie . Czy istnieje obiektywny estymator dla z ?z=min(μx,μy)z=min(μx,μy)z = \min(\mu_x, \mu_y)zzz Prosty estymator min(x¯,y¯)min(x¯,y¯)\min(\bar{x}, \bar{y}) gdzie x¯x¯\bar{x} i y¯y¯\bar{y} są przykładowymi średnimi XXX i YYY , na przykład jest …

1
Metody dopasowania „prostego” modelu błędu pomiaru
Szukam metod, które można wykorzystać do oszacowania modelu błędu pomiaru „OLS”. x i = X i + e x , i Y i = α + β X iyi=Yi+ey,iyi=Yi+ey,iy_{i}=Y_{i}+e_{y,i} xi=Xi+ex,ixi=Xi+ex,ix_{i}=X_{i}+e_{x,i} Yi=α+βXiYi=α+βXiY_{i}=\alpha + \beta X_{i} Gdzie błędy są niezależne normalne z nieznanymi wariancjami i . „Standardowy” OLS nie będzie w tym …


3
Formuła prawdopodobieństwa dla rozkładu wielowymiarowego-bernoulli
Potrzebuję wzoru na prawdopodobieństwo zdarzenia w n-zmiennym rozkładzie Bernoulliego przy danych prawdopodobieństwa dla pojedynczego elementu i dla par elementów . Równoważnie mogę dać średnią i kowariancji .X∈{0,1}nX∈{0,1}nX\in\{0,1\}^n P ( X i = 1 ∧ X j = 1 ) = p i j XP(Xi=1)=piP(Xi=1)=piP(X_i=1)=p_iP(Xi=1∧Xj=1)=pijP(Xi=1∧Xj=1)=pijP(X_i=1 \wedge X_j=1)=p_{ij}XXX Dowiedziałem się już, że …

2
Zrozumienie porównań wyników grupowania
Eksperymentuję z klasyfikowaniem danych do grup. Jestem całkiem nowy w tym temacie i staram się zrozumieć wyniki niektórych analiz. Korzystając z przykładów z Quick-R , Rsugerowanych jest kilka pakietów. Próbowałem użyć dwóch z tych pakietów ( fpcużywając kmeansfunkcji i mclust). Jednym aspektem tej analizy, którego nie rozumiem, jest porównanie wyników. …
13 r  clustering 

3
GLMNET czy LARS do obliczania rozwiązań LASSO?
Chciałbym uzyskać współczynniki dla problemu LASSO | | Y- Xβ| | +λ | | β| |1.||Y−Xβ||+λ||β||1.||Y-X\beta||+\lambda ||\beta||_1. Problem polega na tym, że funkcje glmnet i lars dają różne odpowiedzi. Dla funkcji glmnet proszę o współczynniki λ / | | Y| |λ/||Y||\lambda/||Y||zamiast po prostu λλ\lambda , ale wciąż otrzymuję różne odpowiedzi. …

2
Analiza eksploracyjna błędów prognozy przestrzenno-czasowej
Dane: Niedawno pracowałem nad analizą stochastycznych właściwości przestrzenno-czasowego pola błędów prognozowania produkcji energii wiatrowej. Formalnie można powiedzieć, że jest to proces indeksowane dwukrotnie w czasie (przytih), a raz w miejscu (P), zHoznacza liczbę razy LookAhead (czyli co około24regularnie próbki),toznacza liczbę „czasy prognozy” (tj. czasy, w których prognoza jest wydawana, około …

7
Sens teorii i aplikacji statystycznych
Niedawno ukończyłem studia magisterskie z zakresu modelowania medycznego i biologicznego wraz z matematyką inżynierską jako tłem. Mimo że mój program edukacyjny obejmował znaczną liczbę kursów statystyki matematycznej (lista poniżej), którymi zarządzałem z dość wysokimi ocenami, często kończyłem się całkowitym zagubieniem się zarówno w teorii, jak i zastosowaniach statystyki. Muszę powiedzieć, …


1
Czy iloraz wiarygodności i porównanie modelu Bayesa stanowią doskonałą i wystarczającą alternatywę dla testowania zerowej hipotezy?
W odpowiedzi na rosnącą liczbę statystyk i badaczy krytykujących użyteczność testowania zerowej hipotezy (NHT) dla nauki jako kumulatywnego przedsięwzięcia, grupa zadaniowa American Psychological Association ds. Wnioskowania statystycznego uniknęła całkowitego zakazu NHT, ale zasugerowała, że ​​badacze raportować rozmiary efektów oprócz wartości p pochodzących z NHT. Jednak rozmiary efektów nie są łatwo …

5
Stopniowa regresja logistyczna i pobieranie próbek
Dopasowuję krokową regresję logistyczną dla zestawu danych w SPSS. W procedurze dopasowuję mój model do losowego podzbioru, który jest ok. 60% całej próby, co stanowi około 330 przypadków. Interesujące jest dla mnie to, że za każdym razem, gdy ponownie próbkuję moje dane, pojawiają się różne zmienne w końcowym modelu. Kilka …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.