Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



3
Najlepszy algorytm do klasyfikacji danych silnika szeregów czasowych
Pracuję nad projektem sterowania maszyną. Możemy zmierzyć prąd silnika podczas pracy. Przykładowe dane z dwóch silników wykonujących operację pomyślnie znajdują się poniżej. Czerwony ślad pokazuje prąd z jednego silnika, niebieski ślad prądu z drugiego. Chciałbym spróbować opracować algorytm identyfikujący problemy z zachowaniem maszyny. Problemami mogą być nadmiernie wysoki prąd silnika, …

6
Jak grupować / standaryzować zmienne w R?
Zablokowana . To pytanie i odpowiedzi są zablokowane, ponieważ pytanie jest nie na temat, ale ma znaczenie historyczne. Obecnie nie akceptuje nowych odpowiedzi ani interakcji. Znane mi funkcje obejmują skalowanie od podstawy R, przeskalowanie od ARM. Być może najlepszym sposobem byłoby użycie jakiegoś wariantu zastosowania, określając jedną lub więcej zmiennych …

3
Jak mogę zasymulować mikrodane ze spisu ludności dla małych obszarów za pomocą 1% próbki mikrodanych w dużej skali i zagregować statystyki w małej skali?
Chciałbym przeprowadzić analizę wielowymiarową na poziomie indywidualnym na małych poziomach agregacji geograficznej (dystrykty gromadzenia australijskiego spisu powszechnego). Oczywiście spis ludności nie jest dostępny na tych małych poziomach agregacji ze względu na prywatność, więc badam inne alternatywy. Prawie wszystkie zmienne będące przedmiotem zainteresowania są kategoryczne. Mam do dyspozycji dwa zestawy danych: …

3
Czy efekty losowe mogą mieć zastosowanie tylko do zmiennych jakościowych?
To pytanie może wydawać się głupie, ale ... czy to prawda, że ​​losowe efekty mogą mieć zastosowanie tylko do zmiennych kategorialnych (takich jak indywidualny identyfikator, identyfikator populacji, ...), np. Powiedzxixix_i jest zmienną kategoryczną: yiyiy_i ~ βxiβxi\beta_{x_i} βxiβxi\beta_{x_i} ~ Norm(μ,δ2)Norm(μ,δ2)Norm(\mu, \delta^2) ale z zasady efekt losowy nie może mieć zastosowania do …

1
Jak interpretować p-wartości 0 lub 1?
Przeprowadziłem analizę ANOVA, na przykład stwierdzając interakcję między płcią a klasą, niż chcę wiedzieć, w których klasach różnią się chłopcy i dziewczęta, ale w wielu przypadkach znajduję (skorygowane) wartości p wynoszące 0 i 1. Jak / dlaczego to możliwe? Nie wydaje się właściwe ... as.factor(gender) 1 16 16.2 2.6377 0.104396 …
9 r 



1
Czy różnicę między kontrolą a leczeniem należy modelować w sposób jawny czy dorozumiany?
Biorąc pod uwagę następującą konfigurację eksperymentalną: Od pacjenta pobiera się wiele próbek, a każda próbka jest traktowana na wiele sposobów (w tym leczenie kontrolne). Najbardziej interesująca jest różnica między kontrolą a każdym leczeniem. Mogę wymyślić dwa proste modele tych danych. Gdy próbka , leczenie , leczenie 0 jest kontrolą, niech …


1
Wnioskowanie w modelu liniowym z warunkową heteroskedastycznością
Załóżmy, że obserwuję wektory zmiennych niezależnych i i zmienną zależną . Chciałbym dopasować model o postaci: gdzie jest jakąś podwójnie różniczkowalną funkcją o dodatniej wartości, jest nieznanym parametrem skalowania, a jest średnią losową zmienną Gaussa o wariancji jednostkowej (zakładaną jako niezależną od i ). Jest to zasadniczo konfiguracja testu heteroskedastyczności …


2
Regresja logistyczna ważona wielkością sprawy
Patrzę na kilka problemów z regresją logistyczną. („zwykłe” i „warunkowe”). Idealnie, chciałbym wyważyć każdą z wejściowych spraw, aby glm skupił się bardziej na prawidłowym przewidywaniu wyższych ważonych przypadków kosztem ewentualnego błędnego sklasyfikowania mniej ważonych przypadków. Z pewnością zostało to już zrobione wcześniej. Czy ktoś może skierować mnie w stronę odpowiedniej …
9 logistic 

2
Czy ta dystrybucja ma nazwę? Lub jaki jest proces stochastyczny, który mógłby go wygenerować?
Dyskretny rozkład z funkcją masy p(x;k)=k(x+k)(x+k−1),x=1,2,…p(x;k)=k(x+k)(x+k-1),x=1,2),…p(x;k) = \frac{k}{(x+k)(x+k-1)},\quad x = 1,2,\ldots pojawia się na stronie 9 tego artykułu . Dla k=1k=1k=1jest to dystrybucja Yule-Simon zρ=1ρ=1\rho=1, ale nie znalazłem żadnych innych przykładów. Czy to ma imię? Czy pojawia się w innych kontekstach? Czy istnieje prosty proces stochastyczny, który mógłby go wygenerować?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.