Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jakiej dystrybucji użyć do modelowania czasu odczytu strony internetowej?
Mam funkcję, która zwraca średni czas oczekiwania dla użytkownika sieci. Oznacza to, że daje średni czas, w którym przeciętny użytkownik może pozostać na stronie internetowej, biorąc pod uwagę długość zasobu internetowego w słowach. Chcę użyć tej funkcji (i wynikowej średniej) w połączeniu z rozkładem do modelowania „przeciętnego użytkownika sieci” przeglądającego …

3
Niezrozumienie oszacowania Monte Carlo Pi
Jestem całkiem pewien, że rozumiem, jak działa integracja Monte Carlo, ale nie rozumiem sformułowania, w jaki sposób jest ona używana do oszacowania Pi. Postępuję zgodnie z procedurą opisaną na 5. slajdzie tej prezentacji http://homepages.inf.ed.ac.uk/imurray2/teaching/09mlss/slides.pdf Rozumiem wstępne kroki. Pi jest równe 4-krotności pola jednej czwartej okręgu jednostki. A obszar prawej górnej …

3
Jak dołączyć
Chcę zawrzeć termin i jego kwadrat (zmienne predykcyjne) w regresji, ponieważ zakładam, że niskie wartości mają pozytywny wpływ na zmienną zależną, a wysokie wartości mają negatywny wpływ. powinien obejmować działanie wyższych wartości. Oczekuję zatem, że współczynnik będzie dodatni, a współczynnik będzie ujemny. Oprócz uwzględniam także inne zmienne predykcyjne.xxxx2x2x^2xxxx2x2x^2xxxx2x2x^2xxx Czytałem w …

2
Oszacowanie parametrów za pomocą uogólnionych modeli liniowych
Domyślnie, gdy używamy glmfunkcji w R, używa iteracyjnie przeważonej metody najmniejszych kwadratów (IWLS) w celu znalezienia parametrów maksymalnego prawdopodobieństwa. Teraz mam dwa pytania. Czy szacunki IWLS gwarantują globalne maksimum funkcji wiarygodności? Na podstawie ostatniego slajdu w tej prezentacji, myślę, że nie! Chciałem się tylko upewnić. Czy możemy powiedzieć, że przyczyną …

2
Dlaczego reszty Pearsona z ujemnej regresji dwumianowej są mniejsze niż z regresji Poissona?
Mam te dane: set.seed(1) predictor <- rnorm(20) set.seed(1) counts <- c(sample(1:1000, 20)) df <- data.frame(counts, predictor) Przeprowadziłem regresję Poissona poisson_counts <- glm(counts ~ predictor, data = df, family = "poisson") I ujemna regresja dwumianowa: require(MASS) nb_counts <- glm.nb(counts ~ predictor, data = df) Następnie obliczyłem statystyki dyspersji dla regresji Poissona: …

3
Czy ICA wymaga najpierw uruchomienia PCA?
Przejrzałem artykuł oparty na aplikacji, mówiąc, że zastosowanie PCA przed zastosowaniem ICA (przy użyciu pakietu fastICA). Moje pytanie brzmi: czy ICA (fastICA) wymaga uruchomienia PCA w pierwszej kolejności? W artykule wspomniano o tym ... argumentuje się również, że wstępne zastosowanie PCA poprawia wydajność ICA poprzez (1) odrzucenie małych końcowych wartości …

2
Algorytm EM Praktyka Problem
Jest to problem praktyczny podczas egzaminu śródokresowego. Problemem jest przykład algorytmu EM. Mam problem z częścią (f). Podaję części (a) - (e) do uzupełnienia i na wypadek, gdyby wcześniej popełniłem błąd. Niech będą niezależnymi wykładniczymi zmiennymi losowymi o współczynniku . Niestety rzeczywiste wartości nie są przestrzegane i obserwujemy tylko, czy …


4
Technika nieortogonalna analogiczna do PCA
Załóżmy, że mam zestaw danych punktów 2D i chcę wykryć kierunki wszystkich lokalnych maksimów wariancji w danych, na przykład: PCA nie pomaga w tej sytuacji, ponieważ jest to rozkład ortogonalny i dlatego nie może wykryć obu linii wskazanych przeze mnie na niebiesko, a raczej jego wynik może wyglądać jak ten …


4
Jak przeprowadzić wielowymiarowe uczenie maszynowe? (przewidywanie wielu zmiennych zależnych)
Chcę przewidzieć grupy przedmiotów, które ktoś kupi ... tzn. Mam wiele zmiennych zależnych od linii. Zamiast budować około 7 niezależnych modeli w celu przewidzenia prawdopodobieństwa, że ​​ktoś kupi każdy z 7 przedmiotów, a następnie łącząc wyniki, jakie metody powinienem sprawdzić, aby mieć jeden model uwzględniający relacje między 7 powiązanymi zmiennymi …

3
Wybór węzłów w splajnie wygładzającym regresję odpowiadającym k zmiennych kategorialnych?
Pracuję nad modelem kosztów predykcyjnych, w którym wiek pacjenta (liczba całkowita mierzona w latach) jest jedną ze zmiennych predykcyjnych. Widoczny jest silny nieliniowy związek między wiekiem a ryzykiem hospitalizacji: Rozważam spline wygładzenie regresji wygładzającej dla wieku pacjenta. Według The Elements of Statistics Learning (Hastie i in., 2009, s. 151) optymalne …


3
Jeśli ,
Załóżmy następującą konfigurację: Niech Zi=min{ki,Xi},i=1,...,nZi=min{ki,Xi},i=1,...,nZ_i = \min\{k_i, X_i\}, i=1,...,n . Również Xi∼U[ai,bi],ai,bi>0Xi∼U[ai,bi],ai,bi>0X_i \sim U[a_i, b_i], \; a_i, b_i >0 . Ponadto ki=cai+(1−c)bi,0<c<1ki=cai+(1−c)bi,0<c<1k_i = ca_i + (1-c)b_i,\;\; 0 k_i) = 1- \Pr(X_i \le k_i) =1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c=1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c= 1- \frac {k_i - a_i}{b_i-a_i} = 1-\frac {(1-c)(b_i-a_i)}{b_i-a_i} =c Więc we wszystkich faZja(zja) =⎧⎩⎨⎪⎪⎪⎪⎪⎪⎪⎪⎪⎪0zja<zajazja-zajabja-zajazaja≤zja<kja1kja≤zjafaZja(zja)={0zja<zajazja-zajabja-zajazaja≤zja<kja1kja≤zjaF_{Z_i}(z_i) = \begin{cases} …

2
Czy wąski przedział ufności wokół nieistotnego efektu może dostarczyć dowodów na wartość zerową?
Oczywiście błędne jest założenie, że brak odrzucenia wartości null oznacza, że ​​wartość null jest prawdziwa. Ale w przypadku, gdy wartość zerowa nie jest odrzucana, a odpowiadający jej przedział ufności (CI) jest wąski i wyśrodkowany wokół zera, czy nie dostarcza to dowodów na wartość zerową? Mam dwa zdania: tak, w praktyce …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.