Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Wybierz poziom czynnika jako podstawa manekina w lm () w R
Powiedzmy, że regresuję Y na X1 i X2, gdzie X1 jest zmienną numeryczną, a X2 jest czynnikiem o czterech poziomach (A: D). Czy jest jakiś sposób na zapisanie funkcji regresji liniowej lm(Y ~ X1 + as.factor(X2)), abym mógł wybrać konkretny poziom X2 - powiedzmy B - jako linię bazową?
10 r 

2
Jak mogę określić parametry Weibull na podstawie danych?
Mam histogram danych prędkości wiatru, który jest często przedstawiany za pomocą rozkładu Weibulla. Chciałbym obliczyć kształt Weibulla i współczynniki skali, które najlepiej pasują do histogramu. Potrzebuję rozwiązania numerycznego (w przeciwieństwie do rozwiązań graficznych ), ponieważ celem jest programowe określenie formy Weibulla. Edycja: Próbki są pobierane co 10 minut, prędkość wiatru …

1
Jak zdefiniować macierz jako dodatnią?
Próbuję zaimplementować algorytm EM dla następującego modelu analizy czynnikowej; W.jot= μ + B ajot+ ejotdlaj = 1 , … , nWj=μ+Baj+ejforj=1,…,nW_j = \mu+B a_j+e_j \quad\text{for}\quad j=1,\ldots,n gdzie oznacza p-wymiarowy wektor losowej, J jest P-wymiarowy wektor zmiennych utajonych i B jest macierzą PxQ parametrów.W.jotWjW_jzajotaja_jbBB W wyniku innych założeń zastosowanych w modelu …


2
Porównanie modelu mieszanego (podmiot jako efekt losowy) z prostym modelem liniowym (przedmiot jako efekt stały)
Kończę analizę dużej grupy danych. Chciałbym wziąć model liniowy zastosowany w pierwszej części pracy i ponownie go dopasować za pomocą liniowego modelu mieszanego (LME). LME byłby bardzo podobny, z tym wyjątkiem, że jedna ze zmiennych zastosowanych w modelu byłaby zastosowana jako efekt losowy. Te dane pochodzą z wielu obserwacji (> …

1
Generowanie losowych wektorów z ograniczeniami
Muszę utworzyć losowe wektory liczb rzeczywistych, spełniające następujące ograniczenia: abs(a_i) < c_i; sum(a_i)< A; # sum of elements smaller than A sum(b_i * a_i) < B; # weighted sum is smaller than B aT*A*a < D # quadratic multiplication with A smaller than D where c_i, b_i, A, B, D …


1
Leczenie wartości odstających wytwarzanych przez Kurtosis
Zastanawiałem się, czy ktoś może mi pomóc z informacjami na temat Kurtozy (tj. Czy istnieje sposób na przekształcenie danych w celu ich zmniejszenia?) Mam zestaw danych kwestionariusza z dużą liczbą przypadków i zmiennych. W przypadku niektórych moich zmiennych dane pokazują dość wysokie wartości kurtozy (tj. Rozkład leptokurtyczny), co wynika z …

2
Wykryj wzory kołowe w danych chmury punktów
W przypadku niektórych algorytmów rekonstrukcji objętości, nad którymi pracuję, muszę wykryć dowolną liczbę wzorów kołowych w danych punktów 3d (pochodzących z urządzenia LIDAR). Wzory mogą być dowolnie zorientowane w przestrzeni i można założyć, że leżą (choć nie idealnie) w cienkich płaszczyznach 2D. Oto przykład z dwoma okręgami na tej samej …

3
Jak rozpoznać, czy dobre wyniki występują w seriach?
Rozwiązuję kostki Rubika jako hobby. Rejestruję czas, jaki zajęło mi rozwiązanie kostki za pomocą jakiegoś oprogramowania, więc teraz mam dane z tysięcy rozwiązań. Dane są w zasadzie długą listą liczb reprezentujących czas potrzebny na każde kolejne rozwiązanie (np. 22.11, 20.66, 21.00, 18.74, ...) Czas potrzebny na rozwiązanie kostki w naturalny …


4
Łączenie prawdopodobieństw awarii jądrowych
Ostatnie wydarzenia w Japonii skłoniły mnie do przemyślenia następujących kwestii. Instalacje nuklearne są zwykle zaprojektowane tak, aby ograniczyć ryzyko poważnych wypadków do „prawdopodobieństwa podstawy projektu”, na przykład 10E-6 / rok. To są kryteria dla jednego zakładu. Jednakże, gdy jest populacja setek reaktorów, w jaki sposób łączymy indywidualne prawdopodobieństwa poważnego wypadku? …

1
Metaanaliza w R przy użyciu pakietu metafor
Jak powinienem złożyć składnię rmafunkcji z pakietu metafor , aby uzyskać wyniki w następującym prawdziwym przykładzie małej metaanalizy? (statystyczny efekt SMD z efektem losowym) study, mean1, sd1, n1, mean2, sd2, n2 Foo2000, 0.78, 0.05, 20, 0.82, 0.07, 25 Sun2003, 0.74, 0.08, 30, 0.72, 0.05, 19 Pric2005, 0.75, 0.12, 20, 0.74, …
10 r  meta-analysis 


2
Wykres regresji złożonej w R.
Muszę narysować złożoną grafikę do wizualnej analizy danych. Mam 2 zmienne i dużą liczbę przypadków (> 1000). Na przykład (liczba wynosi 100, jeśli dyspersja jest mniej „normalna”): x <- rnorm(100,mean=95,sd=50) y <- rnorm(100,mean=35,sd=20) d <- data.frame(x=x,y=y) 1) Muszę wykreślić surowe dane z rozmiarem punktu, odpowiadającym względnej częstotliwości zbieżności, więc plot(x,y)nie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.