Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Ciekawe wyprowadzenie R do kwadratu
Wiele lat temu odkryłem tę tożsamość poprzez eksperymenty z danymi i transformacjami. Po wyjaśnieniu tego mojemu profesorowi statystyki przyszedł do następnej klasy z jednostronicowym dowodem przy użyciu notacji wektorowej i macierzowej. Niestety zgubiłem papier, który mi dał. (To było w 2007 roku) Czy ktoś jest w stanie zrekonstruować dowód? Niech …

2
Generuj symetryczną dodatnią określoną macierz z wcześniej określonym wzorcem sparsity
Próbuję wygenerować macierz korelacji p×pp×pp\times p (symetryczny psd) z wcześniej określoną strukturą sparsity (określoną przez wykres na pppwęzły). Węzły połączone na wykresie mają korelacjęρ∼U(0,1)ρ∼U(0,1)\rho \sim U(0,1), reszta to 0, a przekątna to 1. Próbowałem wygenerować tę macierz kilka razy, ale rzadko otrzymuję prawidłową macierz korelacji. Czy istnieje sposób, aby zapewnić …

1
Jak interpretować wariancję efektu losowego w uogólnionym liniowym modelu mieszanym
W logistycznym uogólnionym liniowym modelu mieszanym (rodzina = dwumianowy) nie wiem, jak interpretować wariancję efektów losowych: Random effects: Groups Name Variance Std.Dev. HOSPITAL (Intercept) 0.4295 0.6554 Number of obs: 2275, groups: HOSPITAL, 14 Jak interpretować ten wynik liczbowy? Mam próbkę pacjentów po transplantacji nerki w wieloośrodkowym badaniu. Testowałem, czy prawdopodobieństwo …
9 r  lme4-nlme 

3
Wymiar VC prostokąta
Książka „Wprowadzenie do uczenia maszynowego” autorstwa Ethem Alpaydın stwierdza, że ​​wymiar VC prostokąta wyrównanego do osi wynosi 4. Ale jak prostokąt może zniszczyć zestaw czterech punktów współliniowych z naprzemiennymi dodatnimi i ujemnymi punktami? Czy ktoś może wyjaśnić i udowodnić wymiar VC prostokąta?



2
W jaki sposób wartości rezydualne odnoszą się do podstawowych zakłóceń?
W metodzie najmniejszych kwadratów chcemy oszacować nieznane parametry w modelu: Yj=α+βxj+εj(j=1...n)Yj=α+βxj+εj(j=1...n)Y_j = \alpha + \beta x_j + \varepsilon_j \enspace (j=1...n) Gdy to zrobimy (dla niektórych obserwowanych wartości), otrzymamy dopasowaną linię regresji: Yj=α^+β^x+ej(j=1,...n)Yj=α^+β^x+ej(j=1,...n)Y_j = \hat{\alpha} + \hat{\beta}x +e_j \enspace (j =1,...n) Teraz oczywiście chcemy sprawdzić niektóre wykresy, aby upewnić się, że …

2
Sprawdzenie założenia proporcjonalności szans zachodzi w regresji logistycznej porządkowej za pomocą funkcji polr
Użyłem funkcji „polr” w pakiecie MASS do uruchomienia porządkowej regresji logistycznej dla porządkowej zmiennej jakościowej z 15 ciągłymi zmiennymi objaśniającymi. Użyłem kodu (pokazanego poniżej), aby sprawdzić, czy mój model spełnia założenia proporcjonalnego prawdopodobieństwa zgodnie z poradami zawartymi w przewodniku UCLA . Jednak trochę martwię się o wynik sugerujący, że nie …

1
Jakie kryteria zastosować do podziału zmiennych na zmienne objaśniające i odpowiedzi na metody święceń w ekologii?
Mam różne zmienne, które oddziałują w obrębie populacji. Zasadniczo robiłem inwentaryzację krocionogów i mierzyłem inne wartości terenu, takie jak: Gatunek i ilość zebranych okazów Różne środowiska, w których przebywają zwierzęta pH Procent materiału organicznego ilość P, K, Mg, Ca, Mn, Fe, Zn, Cu Relacja Ca + Mg / K Zasadniczo …

1
Co PCA robi z danymi autokorelowanymi?
Właśnie dlatego, że jakiś korespondent postawił interesujące pytanie dotyczące metod obliczania autokorelacji, zacząłem się nim bawić, prawie bez wiedzy o szeregach czasowych i autokorelacji. Korespondent uporządkował swoje dane (323232 punkty danych szeregu czasowego) przesunięte dodatkowo o jedno opóźnienie czasowe tak, że miał macierz 32×3232×3232\times32 dane (tak jak go zrozumiałem), gdzie …

1
Czy oszacowania punktu przecięcia i nachylenia w prostej regresji liniowej są niezależne?
Rozważ model liniowy yja= α + βxja+ϵjayja=α+βxja+ϵjay_i= \alpha + \beta x_i + \epsilon_i oraz oszacowania nachylenia i przecięcia i przy użyciu zwykłych najmniejszych kwadratów. To odniesienie do statystyki matematycznej sprawia, że ​​stwierdzenie, że i są niezależne (na dowód ich twierdzenia).α^α^\hat{\alpha}β^β^\hat{\beta}α^α^\hat{\alpha}β^β^\hat{\beta} Nie jestem pewien, czy rozumiem dlaczego. Od α^=y¯-β^x¯α^=y¯-β^x¯\hat{\alpha}=\bar{y}-\hat{\beta} \bar{x} Czy …

3
Funkcja przenoszenia w modelach prognostycznych - interpretacja
Zajmuję się modelowaniem ARIMA wzbogaconym o zmienne egzogeniczne do celów modelowania promocyjnego i trudno mi to wytłumaczyć użytkownikom biznesowym. W niektórych przypadkach pakiety oprogramowania kończą się prostą funkcją przesyłania, tj. Parametrem * Zmienna egzogeniczna. W tym przypadku interpretacja jest łatwa, tzn. Działanie promocyjne X (reprezentowane przez egzogenną zmienną binarną) wpływa …

1
Efektywny splot (w R)
Chcę obliczyć / ocenić splot g(x)=∫Df(x−t)ϕ(t)dt,g(x)=∫Df(x−t)ϕ(t)dt,g(x)=\int_D f(x-t) \phi(t) dt, gdzie oznacza gęstość i jest gładka funkcja o zwartym nośniku . Splot nie jest dostępny w formie zamkniętej i muszę go zintegrować numerycznie. Moje pytanie brzmi: czy jest na to skuteczny sposób? Chcę zaimplementować go w języku R, więc chciałbym sprawdzić, …
9 r  convolution 


1
Jakich wskazówek należy przestrzegać przy korzystaniu z sieci neuronowych o rzadkich wejściach
Mam bardzo rzadkie dane wejściowe, np. Lokalizacje niektórych funkcji na obrazie wejściowym. Co więcej, każda funkcja może mieć wiele detekcji (nie jestem pewien, czy będzie to miało wpływ na projekt systemu). Będę to przedstawiał jako obraz binarny kanału k z pikselami ON reprezentującymi obecność tej cechy i odwrotnie. Widzimy, że …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.