Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Resztkowa autokorelacja vs. opóźniona zmienna zależna
Podczas modelowania szeregów czasowych można (1) modelować strukturę korelacyjną terminów błędów, ponieważ np. Proces AR (1) (2) obejmuje zmienną zależną opóźnioną jako zmienną objaśniającą (po prawej stronie) Rozumiem, że są to czasem istotne powody, dla których warto (2). Jakie są jednak metodologiczne powody, aby zrobić (1) lub (2), a nawet …

1
Integracja empirycznego CDF
Mam rozkład empiryczny . Obliczam to w następujący sposóbG(x)G(x)G(x) x <- seq(0, 1000, 0.1) g <- ecdf(var1) G <- g(x) Mam na myśli , tzn. to pdf, a to cdf.h Gh(x)=dG/dxh(x)=dG/dxh(x) = dG/dxhhhGGG Chcę teraz rozwiązać równanie dla górnej granicy całkowania (powiedzmy ), tak że oczekiwana wartość wynosi jakieś .x …
13 r  integral  ecdf 


1
Zrozumienie testu chi-kwadrat i rozkładu chi-kwadrat
Próbuję zrozumieć logikę testu chi-kwadrat. Test chi-kwadrat to . jest następnie porównywany z rozkładem chi-kwadrat, aby znaleźć wartość p. w celu odrzucenia lub nie hipotezy zerowej. : obserwacje pochodzą z rozkładu, którego użyliśmy do stworzenia naszych oczekiwanych wartości. Na przykład moglibyśmy sprawdzić, czy prawdopodobieństwo uzyskania jest podane przez tak jak …

2
Szacowanie online kwartyli bez przechowywania obserwacji
Muszę obliczyć kwartyle (Q1, mediana i Q3) w czasie rzeczywistym na dużym zestawie danych bez zapisywania obserwacji. Najpierw wypróbowałem algorytm P-kwadrat (Jain / Chlamtac), ale nie byłem z niego zadowolony (nieco za dużo procesora i nie przekonałem się precyzją przynajmniej w moim zestawie danych). Używam teraz algorytmu FAME ( Feldman …

4
Model regresji, którego zmienną odpowiedzi jest dzień w roku, w którym zdarzenie roczne (zwykle) ma miejsce
W tym konkretnym przypadku mam na myśli dzień, w którym jezioro zamarza. Ta data „zalania” występuje tylko raz w roku, ale czasami wcale nie występuje (jeśli zima jest ciepła). Tak więc w ciągu jednego roku jezioro może zamarznąć w dniu 20 (20 stycznia), a w innym roku może wcale nie …



1
Poszukiwanie teoretycznego zrozumienia regresji logistycznej Firtha
Próbuję zrozumieć regresję logistyczną Firtha (metodę obsługi idealnego / pełnego lub quasi-pełnego rozdzielenia w regresji logistycznej), aby móc wyjaśnić to innym w uproszczony sposób. Czy ktoś ma ogólne wyjaśnienie, jakie modyfikacje wprowadza szacunek Firth w MLE? Przeczytałem, najlepiej jak potrafiłem, Firth (1993) i rozumiem, że do funkcji partytury stosowana jest …

2
Wykorzystanie BIC do oszacowania liczby k w KMEANS
Obecnie próbuję obliczyć BIC dla mojego zestawu danych zabawek (ofc iris (:). Chcę odtworzyć wyniki, jak pokazano tutaj (ryc. 5). Ten papier jest również moim źródłem dla formuł BIC. Mam z tym 2 problemy: Notacja: ninin_i I = liczba elementów w klastrzeiii CiCiC_i i = współrzędne środkowe klastraiii xjxjx_j i …

1
Wykorzystanie wzajemnych informacji do oszacowania korelacji między zmienną ciągłą a zmienną kategorialną
Jeśli chodzi o tytuł, chodzi o wykorzystanie wzajemnej informacji, tu i po MI, do oszacowania „korelacji” (zdefiniowanej jako „ile wiem o A, gdy znam B”) między zmienną ciągłą a zmienną kategorialną. Za chwilę opowiem o moich przemyśleniach na ten temat, ale zanim doradzę, przeczytajcie inne pytanie / odpowiedź na CrossValidated, …

1
Wyjaśnić kroki algorytmu LLE (lokalne osadzanie liniowe)?
Rozumiem, że podstawowa zasada algorytmu dla LLE składa się z trzech kroków. Znajdowanie sąsiedztwa każdego punktu danych za pomocą niektórych miar, takich jak k-nn. Znajdź wagi dla każdego sąsiada, które oznaczają wpływ sąsiada na punkt danych. Skonstruuj osadzanie danych w małych wymiarach na podstawie obliczonych wag. Ale matematyczne wyjaśnienie kroków …

3
Bayesian vs MLE, problem przeuczenia
W książce Bishopa PRML mówi, że nadmierne dopasowanie jest problemem związanym z oszacowaniem maksymalnej wiarygodności (MLE), a Bayesian może tego uniknąć. Ale myślę, że nadmierne dopasowanie to problem bardziej związany z wyborem modelu, a nie z metodą stosowaną do oszacowania parametrów. To znaczy, załóżmy, że mam zestaw danych , który …

4
Czy krawędzie na ukierunkowanym wykresie acyklicznym reprezentują związek przyczynowy?
Studiuję probabilistyczne modele graficzne , książkę do samodzielnej nauki. Czy krawędzie na ukierunkowanym wykresie acyklicznym (DAG) reprezentują relacje przyczynowe? Co jeśli chcę zbudować sieć bayesowską , ale nie jestem pewien co do kierunku strzałek? Wszystkie dane pokażą mi, że zaobserwowano korelacje, a nie wzajemne powiązania między nimi. Wiem, że pytam …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.