Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Wariancja rocznego zwrotu na podstawie wariancji miesięcznego zwrotu
Próbuję zrozumieć całą wariancję / błąd standardowy w szeregu czasowym zwrotów finansowych i myślę, że utknąłem. Mam szereg miesięcznych danych o zwrocie zapasów (nazwijmy to ), które mają oczekiwaną wartość 1,00795 i wariancję 0,000228 (standardowe odchylenie to 0,01512). Próbuję obliczyć najgorszy przypadek rocznego zwrotu (powiedzmy, że oczekiwana wartość minus dwukrotność …

1
Jak interpretować ujemny współczynnik regresji liniowej dla zarejestrowanej zmiennej wyniku?
Mam model regresji liniowej, w którym zmienna zależna jest rejestrowana, a zmienna niezależna jest liniowa. Współczynnik nachylenia dla kluczowej zmiennej niezależnej jest ujemny: . Nie jestem pewien, jak interpretować.- .0564-.0564-.0564 Czy używam wartości bezwzględnej, a następnie zmieniam ją na ujemną w następujący sposób: ( exp( 0,0564 ) - 1 ) …

5
Podstawy matematyczne dla sieci neuronowych
Nie jestem pewien, czy jest to odpowiednie dla tej witryny, ale rozpoczynam studia magisterskie z informatyki (BS w matematyce stosowanej) i chcę uzyskać solidne doświadczenie w uczeniu maszynowym (najprawdopodobniej zamierzam doktorat). Jednym z moich sub-zainteresowań są sieci neuronowe. Jakie jest dobre podłoże matematyczne dla ANN? Podobnie jak w innych obszarach …



1
Wieloręki bandyta do ogólnej dystrybucji nagród
Pracuję nad problemem wielorękiego bandyty, w którym nie mamy żadnych informacji na temat dystrybucji nagród. Znalazłem wiele artykułów, które gwarantują żal granice dla rozkładu o znanym wiązaniu i dla ogólnych rozkładów ze wsparciem w [0,1]. Chciałbym dowiedzieć się, czy istnieje sposób na dobre wyniki w środowisku, w którym dystrybucja nagród …

2
Metryki macierzy kowariancji: wady i zalety
Jakie są „najlepsze” wskaźniki dla macierzy kowariancji i dlaczego? Jest dla mnie jasne, że Frobenius i c nie są odpowiednie, a parametryzacje kątów również mają swoje problemy. Intuicyjnie można chcieć kompromisu między tymi dwoma, ale chciałbym również wiedzieć, czy istnieją inne aspekty, o których należy pamiętać i być może dobrze …

1
Obliczanie wielomianowych zmiennych kontrastowych
Daj mi pomysł, jak efektywnie przekodować zmienną kategorialną (czynnik) do zestawu ortogonalnych wielomianowych zmiennych kontrastowych. W przypadku wielu typów zmiennych kontrastu (np. Odchylenie, prosty, Helmert itp.) Przejście jest następujące: Skomponuj macierz współczynników kontrastu odpowiadającą typowi. Odwróć lub uogólnij-odwróć, aby uzyskać macierz kodów. Na przykład: Suppose there is 3-group factor and …

3
Przedział ufności dla iloczynu dwóch parametrów
Załóżmy, że mamy dwa parametry, i . Mamy również dwa estymatory maksymalnego prawdopodobieństwa i oraz dwa przedziały ufności dla tych parametrów. Czy istnieje sposób na zbudowanie przedziału ufności dla ?p 2 ^ p 1 ^ p 2 p 1 p 2p1p1p_1p2)p2p_2p1^p1^\hat{p_1}p2)^p2^\hat{p_2}p1p2)p1p2p_1p_2

2
Jakie są odległości między zmiennymi tworzącymi macierz kowariancji?
Mam macierzy kowariancji i chcę podzielić zmienne na klastrów za pomocą hierarchicznego grupowania (na przykład, aby posortować macierz kowariancji).kn × nn×nn \times nkkk Czy istnieje typowa funkcja odległości między zmiennymi (tj. Między kolumnami / rzędami kwadratowej macierzy kowariancji)? A jeśli jest ich więcej, czy istnieje dobre odniesienie do tematu?


1
Rozkład próbkowania współczynników regresji
Wcześniej dowiedziałem się o rozkładach próbkowania, które dały wyniki, które były dla estymatora, pod względem nieznanego parametru. Na przykład dla rozkładów próbkowania i w modelu regresji liniowejβ^0β^0\hat\beta_0β^1β^1\hat\beta_1Yi=βo+β1Xi+εiYi=βo+β1Xi+εiY_i = \beta_o + \beta_1 X_i + \varepsilon_i β^0∼N(β0, σ2(1n+x¯2Sxx))β^0∼N(β0, σ2(1n+x¯2Sxx)) \hat{\beta}_0 \sim \mathcal N \left(\beta_0,~\sigma^2\left(\frac{1}{n}+\frac{\bar{x}^2}{S_{xx}}\right)\right) i β^1∼N(β1, σ2Sxx)β^1∼N(β1, σ2Sxx) \hat{\beta}_1 \sim \mathcal N …

1
Metryka oceny prognozy dla danych panelowych / podłużnych
Chciałbym ocenić kilka różnych modeli, które przewidują zachowanie na poziomie miesięcznym. Dane są zbilansowane, a 100 000, a 12. Rezultatem jest udział w koncercie w danym miesiącu, więc wynosi około 80% ludzi w dowolnym miesiącu, ale długi ogon dużych użytkowników jest długi. Przewidywane przeze mnie przewidywania wydają się nie szanować …

2
Jak dokładny jest IQR w wykrywaniu wartości odstających
Piszę skrypt analizujący czasy uruchamiania procesów. Nie jestem pewien ich dystrybucji, ale chcę wiedzieć, czy proces działa „za długo”. Do tej pory korzystałem z 3 standardowych odchyleń czasów ostatniego uruchomienia (n> 30), ale powiedziano mi, że nie zapewnia to niczego użytecznego, jeśli dane nie są normalne (co nie wydaje się …

2
Czy test t i jednokierunkowa ANOVA są testami Walda?
Test t do testowania, czy średnia normalnie rozłożonej próbki jest równa stałej, jest testem Walda, poprzez oszacowanie standardowego odchylenia średniej próbki na podstawie informacji Fishera o rozkładzie normalnym w średniej próbki. Ale statystyka testu w teście t ma rozkład t-studenta, podczas gdy test staistyczny w teście Walda asymptotycznie ma rozkład …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.