Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Co oznacza ujemne R-kwadrat?
Powiedzmy, że mam jakieś dane, a następnie dopasowuję dane do modelu (regresja nieliniowa). Następnie obliczam R-kwadrat ( ).R2R2R^2 Kiedy R-kwadrat jest ujemny, co to oznacza? Czy to znaczy, że mój model jest zły? Wiem, że zakres może wynosić [-1,1]. Kiedy wynosi 0, co to oznacza?R2R2R^2R2R2R^2

3
Regresja logistyczna czy test T?
Grupa osób odpowiada na jedno pytanie. Odpowiedź może brzmieć „tak” lub „nie”. Badacz chce wiedzieć, czy wiek jest związany z rodzajem odpowiedzi. Powiązanie oceniono za pomocą regresji logistycznej, w której wiek jest zmienną objaśniającą, a typ odpowiedzi (tak, nie) jest zmienną zależną. Rozwiązano to osobno, obliczając średni wiek grup, które …

2
Reprezentowanie efektów interakcji na ukierunkowanych wykresach acyklicznych
Wyreżyserowane wykresy acykliczne (DAG; np. Greenland i in., 1999) są częścią formalizmu wnioskowania przyczynowego na podstawie kontrfaktycznej interpretacji obozu przyczynowego. Na tych wykresach obecność strzałki ze zmiennej AAA do zmiennej BBB potwierdza, że ​​zmienna AAA bezpośrednio powoduje (pewną zmianę ryzyka) zmienną BBB , a brak takiej strzałki potwierdza, że ​​zmienna …


2
Jak interpretować wykres QQ wartości p
Robię badania stowarzyszenia GWAS SNP na temat chorób przy użyciu oprogramowania o nazwie plink ( http://pngu.mgh.harvard.edu/~purcell/plink/download.shtml ). Z wynikami asocjacji otrzymuję wartości p dla wszystkich analizowanych SNP. Teraz używam wykresu QQ tych wartości p, aby pokazać, czy bardzo niska wartość p różni się od oczekiwanego rozkładu wartości p (rozkład równomierny). …
17 qq-plot 


1
Czy rozkłady z tymi samymi momentami są identyczne
Poniższe są podobne, ale różnią się od poprzednich postów tutaj i tutaj Biorąc pod uwagę dwa rozkłady, które dopuszczają momenty wszystkich zamówień, jeśli wszystkie momenty dwóch rozkładów są takie same, to czy są to identyczne rozkłady? Biorąc pod uwagę dwa rozkłady, które dopuszczają funkcje generujące moment, jeśli mają takie same …

2
Czy warto stosować zmienną daty w regresji?
Nie jestem przyzwyczajony do używania zmiennych w formacie daty w R. Zastanawiam się tylko, czy można dodać zmienną daty jako zmienną objaśniającą w modelu regresji liniowej. Jeśli to możliwe, jak możemy interpretować współczynnik? Czy to wpływ jednego dnia na zmienną wyniku? Zobacz moją istotę z przykładem tego, co próbuję zrobić.

4
Intuicja dla skumulowanej funkcji hazardu (analiza przeżycia)
Próbuję uzyskać intuicję dla każdej z głównych funkcji w nauce aktuarialnej (szczególnie dla modelu proporcjonalnych zagrożeń Coxa). Oto co mam do tej pory: f(x)f(x)f(x) : począwszy od godziny rozpoczęcia, rozkład prawdopodobieństwa, kiedy umrzesz. F(x)F(x)F(x) : tylko rozkład skumulowany. W chwili jaki procent populacji będzie martwy?TTT S(x)S(x)S(x) : . W chwili …


3
Który test Dickeya-Fullera dla szeregu czasowego modelowanego za pomocą przecięcia / dryfu i trendu liniowego?
Krótka wersja: Mam szereg danych klimatycznych, które testuję pod kątem stacjonarności. Na podstawie wcześniejszych badań spodziewam się, że model leżący u podstaw (lub, że tak powiem, „generowania” danych) będzie miał wyraz przechwytujący i pozytywny liniowy trend czasu. Aby przetestować te dane pod kątem stacjonarności, czy powinienem użyć testu Dickeya-Fullera, który …

4
Normalizacja przed walidacją krzyżową
Czy dane normalizujące (mające zerową średnią i odchylenie standardowe jedności) przed powtórzeniem k-krotnej walidacji krzyżowej mają jakieś negatywne konsekwencje, takie jak nadmierne dopasowanie? Uwaga: dotyczy to sytuacji, gdy # skrzynki> łączna liczba funkcji Przekształcam niektóre moje dane za pomocą transformacji dziennika, a następnie normalizuję wszystkie dane jak wyżej. Następnie dokonuję …

6
Jak znaleźć lokalne szczyty / doliny w szeregu danych?
Oto mój eksperyment: Korzystam z findPeaksfunkcji w pakiecie quantmod : Chcę wykryć „lokalne” piki w granicach tolerancji 5, tj. Pierwsze lokalizacje po spadku szeregów czasowych od lokalnych pików o 5: aa=100:1 bb=sin(aa/3) cc=aa*bb plot(cc, type="l") p=findPeaks(cc, 5) points(p, cc[p]) p Dane wyjściowe to [1] 3 22 41 Wydaje się nie …
17 r  time-series 

2
Jak powinienem zorganizować prezentację mojego plakatu?
Obecnie przygotowuję prezentację plakatu i chciałbym uzyskać porady (lub odniesienia do porad) na temat niektórych aspektów grafiki. Przykłady plakatów, o których mówię, można znaleźć w materiale uzupełniającym do artykułów ASA Data Expo w tomie 20 wydanie 2 Journal of Computational and Graphical Statistics (inny przykład znajduje się tutaj ( Hendrix …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.