Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Czy rząd zmiennej ma znaczenie w regresji liniowej
Badam wzajemne oddziaływanie dwóch zmiennych ( i ). Istnieje duża korelacja liniowa między tymi zmiennymi przy . Ze względu na naturę problemu nie mogę nic powiedzieć o związku przyczynowym (czy powoduje czy na odwrót). Chciałbym zbadać odchylenia od linii regresji, aby wykryć wartości odstające. Aby to zrobić, mogę albo zbudować …

2
Dystrybucja „niezmieszanych” części na podstawie kolejności mieszania
Załóżmy, że mam sparowane obserwacje, takie jak dla . Niech i oznaczają od p największa obserwowana wartość . Jaka jest (warunkowa) dystrybucja ? (lub równoważnie z )Xi∼N(0,σ2x),Yi∼N(0,σ2y),Xi∼N(0,σx2),Yi∼N(0,σy2),X_i \sim \mathcal{N}\left(0,\sigma_x^2\right), Y_i \sim \mathcal{N}\left(0,\sigma_y^2\right),i=1,2,…,ni=1,2,…,ni=1,2,\ldots,nZi=Xi+Yi,Zi=Xi+Yi,Z_i = X_i + Y_i,ZijZijZ_{i_j}jjjZZZXijXijX_{i_j}YijYijY_{i_j} To znaczy, jaki jest rozkład , pod że jest tą największą spośród obserwowanych wartości …

2
Zalety podejścia do problemu poprzez sformułowanie funkcji kosztu, którą można zoptymalizować globalnie
To dość ogólne pytanie (tj. Niekoniecznie specyficzne dla statystyki), ale zauważyłem trend w uczeniu maszynowym i literaturze statystycznej, w którym autorzy wolą stosować następujące podejście: Podejście 1 : uzyskanie rozwiązania praktycznego problemu poprzez sformułowanie funkcji kosztu, dla której możliwe jest (np. Z obliczeniowego punktu widzenia) znalezienie globalnie optymalnego rozwiązania (np. …


1
Jak interpretować wyniki redukcji wymiarowości / skalowania wielowymiarowego?
Przeprowadziłem zarówno dekompozycję SVD, jak i wielowymiarowe skalowanie 6-wymiarowej macierzy danych, aby lepiej zrozumieć strukturę danych. Niestety, wszystkie wartości w liczbie pojedynczej są tego samego rzędu, co oznacza, że ​​wymiarowość danych rzeczywiście wynosi 6. Chciałbym jednak móc interpretować wartości wektorów w liczbie pojedynczej. Na przykład pierwszy wydaje się być mniej …

5
Automatyczne określanie progu dla wykrywania anomalii
Pracuję z szeregiem czasowym wyników anomalii (tłem jest wykrywanie anomalii w sieciach komputerowych). Co minutę otrzymuję wynik anomalii który mówi mi, jak „nieoczekiwany” lub nienormalny jest obecny stan sieci. Im wyższy wynik, tym bardziej nienormalny jest obecny stan. Wyniki bliskie 5 są teoretycznie możliwe, ale prawie nigdy nie występują.xt∈ [ …

3
Cykl w algorytmie k-średnich
Według wiki najczęściej stosowanym kryterium konwergencji jest „przypisanie się nie zmieniło”. Zastanawiałem się, czy może wystąpić cykl, jeśli zastosujemy takie kryterium konwergencji? Byłbym zadowolony, gdyby ktokolwiek wskazał odniesienie do artykułu, który podaje przykład jazdy na rowerze lub dowodzi, że jest to niemożliwe.

3
Klastry zajmujące mało miejsca
Większość algorytmów grupowania, jakie widziałem, zaczyna się od tworzenia odległości między poszczególnymi punktami, co staje się problematyczne w przypadku większych zestawów danych. Czy jest taki, który tego nie robi? Czy może jest to podejście częściowe / przybliżone / naprzemienne? Który algorytm / implementacja klastrowania zajmuje mniej niż O (n ^ …


3
Traktowanie poziomów zmiennych kategorialnych „Nie wiem / Odmówiono”
Modeluję prognozę cukrzycy za pomocą regresji logistycznej. Wykorzystanym zestawem danych jest behawioralny system monitorowania czynników ryzyka (BRFSS) Centrum Kontroli Chorób (CDC). Jedną z niezależnych zmiennych jest wysokie ciśnienie krwi. Jest podzielony na kategorie z następującymi poziomami: „Tak”, „Nie”, „Nie wiem / Odmowa”. Czy podczas usuwania modelu należy usunąć te wiersze …

4
Jak przeprowadzić wiele testów chi-kwadrat post-hoc na stole 2 X 3?
Mój zestaw danych obejmuje zarówno całkowitą śmiertelność, jak i przeżycie organizmu w trzech typach miejsc: przybrzeżnym, śródokanałowym i przybrzeżnym. Liczby w poniższej tabeli reprezentują liczbę witryn. 100% Mortality 100% Survival Inshore 30 31 Midchannel 10 20 Offshore 1 10 Chciałbym wiedzieć, czy liczba witryn, w których wystąpiła 100% śmiertelność, jest …

4
Analityczne rozwiązanie szacunków współczynnika regresji liniowej
Próbuję zrozumieć notację macierzową i pracuję z wektorami i macierzami. W tej chwili chciałbym zrozumieć, jak obliczany jest wektor współczynników szacunkowych w regresji wielokrotnej.β^β^\hat{\beta} Wydaje się, że podstawowe równanie ddβ(y−Xβ)′(y−Xβ)=0.ddβ(y−Xβ)′(y−Xβ)=0. \frac{d}{d\boldsymbol{\beta}} (\boldsymbol{y}-\boldsymbol{X\beta})'(\boldsymbol{y}-\boldsymbol{X\beta}) = 0 \>. Jak mam rozwiązać tutaj wektor ββ\beta ? Edycja : Czekaj, utknąłem. Jestem tu teraz i …

2
Istotność statystyczna zmian w czasie dla 5-punktowej pozycji Likerta
Kontekst: Mam dwa zestawy danych z tego samego kwestionariusza przeprowadzonego przez dwa lata. Każde pytanie mierzone jest za pomocą 5-stopniowej skali. Q1: Schemat kodowania W tej chwili zakodowałem swoje odpowiedzi w przedziale [0, 1], gdzie 0 oznacza „najbardziej negatywną odpowiedź”, 1 oznacza „najbardziej pozytywną odpowiedź”, a inne odpowiedzi są rozmieszczone …

4
Jak obliczyć przedziały ufności dla połączonych wskaźników nieparzystych w metaanalizie?
Mam dwa zestawy danych z badań asocjacyjnych całego genomu. Jedynymi dostępnymi informacjami są współczynniki nieparzyste i przedziały ufności (95%) dla każdego genotypowanego SNP. Chcę wygenerować działkę leśną porównującą te dwa współczynniki szans, ale nie mogę znaleźć sposobu na obliczenie łączonych przedziałów ufności w celu wizualizacji efektów podsumowania. Użyłem programu PLINK …

1
Czy istnieje odpowiednik ARiMR dla korelacji rang?
Patrzę na wyjątkowo nieliniowe dane, dla których modele ARMA / ARIMA nie działają dobrze. Chociaż widzę trochę autokorelacji i podejrzewam, że mam lepsze wyniki dla nieliniowej autokorelacji. 1 / czy istnieje odpowiednik PACF dla korelacji rang? (w R?) 2 / czy istnieje odpowiednik modelu ARMA dla korelacji nieliniowej / rangowej …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.