Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jakiego rozkładu użyć do modelowania czasu przed przybyciem pociągu?
Próbuję modelować niektóre dane dotyczące czasu przyjazdu pociągu. Chciałbym użyć dystrybucji, która przechwytuje „im dłużej czekam, tym bardziej prawdopodobne jest, że pociąg się pojawi” . Wydaje się, że taka dystrybucja powinna wyglądać jak CDF, więc P (przyjazd pociągu | czekał 60 minut) jest bliski 1. Jakiej dystrybucji należy tutaj zastosować?

1
Stan
Przeglądałem dokumentację Stana, którą można pobrać stąd . Byłem szczególnie zainteresowany ich wdrożeniem diagnostyki Gelmana-Rubina. Oryginalny artykuł Gelman i Rubin (1992) definiuje potencjalny współczynnik redukcji skali (PSRF) w następujący sposób: Niech Xi,1,…,Xi,NXi,1,…,Xi,NX_{i,1}, \dots , X_{i,N} będą iii -tym łańcuchem Markowa, z którego pobrano próbkę, i niech będzie próbka z całych …

1
Regresja wielowymiarowa: dlaczego wyjątkowy?
Próbuję przeczytać o badaniach w dziedzinie regresji wielowymiarowej; gdy jest większe niż , to znaczy p >> n . Wydaje się, że termin \ log p / n pojawia się często w odniesieniu do wskaźnika konwergencji dla estymatorów regresji.pppnnnp>>np>>np >> nlogp/nlog⁡p/n\log p/n Na przykład tutaj równanie (17) mówi, że dopasowanie …

3
Perceptron wielowarstwowy a głęboka sieć neuronowa
To kwestia terminologii. Czasami widzę, że ludzie określają głębokie sieci neuronowe jako „wielowarstwowe perceptrony”, dlaczego tak jest? Nauczono mnie, że perceptron to klasyfikator jednowarstwowy (lub regresor) z wyjściowym progiem binarnym, wykorzystujący określony sposób szkolenia wag (nie z powrotem). Jeśli wynik działania perceptronu nie jest zgodny z wynikiem docelowym, dodajemy lub …



3
Jaki jest związek między rozkładem Beta a modelem regresji logistycznej?
Moje pytanie brzmi: jaki jest matematyczny związek między rozkładem Beta a współczynnikami modelu regresji logistycznej ? Aby zilustrować: funkcję logistyczną (sigmoid) podano przez f(x)=11+exp(−x)f(x)=11+exp⁡(−x)f(x) = \frac{1}{1+\exp(-x)} i służy do modelowania prawdopodobieństw w modelu regresji logistycznej. Niech AAA będzie wynikiem dychotomicznym (0,1)(0,1)(0,1) a XXX macierzą projektową. Model regresji logistycznej podano przez …

1
Wyprowadzenie zmiany zmiennych funkcji gęstości prawdopodobieństwa?
W rozpoznawaniu wzorów książek i uczeniu maszynowym (wzór 1.27) daje py(y)=px(x)∣∣∣dxdy∣∣∣=px(g(y))|g′(y)|py(y)=px(x)|dxdy|=px(g(y))|g′(y)|p_y(y)=p_x(x) \left | \frac{d x}{d y} \right |=p_x(g(y)) | g'(y) | gdziex=g(y)x=g(y)x=g(y),to pdf, który odpowiadaw odniesieniu do zmiany zmiennej.p y ( y )px(x)px(x)p_x(x)py(y)py(y)p_y(y) Książki mówią, że dzieje się tak, ponieważ obserwacje mieszczące się w zakresie (x,x+δx)(x,x+δx)(x, x + \delta x) …

1
Jak stochastyczne obniżanie gradientu może zaoszczędzić czas w porównaniu ze standardowym spadkiem gradientu?
Standardowe zejście gradientu obliczałoby gradient dla całego zestawu danych treningowych. for i in range(nb_epochs): params_grad = evaluate_gradient(loss_function, data, params) params = params - learning_rate * params_grad Dla wstępnie zdefiniowanej liczby epok najpierw obliczamy wektor gradientu wagi_grad funkcji straty dla całego zestawu danych w stosunku do naszych parametrów wektora parametru. Natomiast …

2
Dokładność vs. pole pod krzywą ROC
Skonstruowałem krzywą ROC dla systemu diagnostycznego. Pole pod krzywą zostało następnie oszacowane nieparametrycznie na AUC = 0,89. Kiedy próbowałem obliczyć dokładność przy optymalnym ustawieniu progu (punkt najbliższy punktowi (0, 1)), dostałem dokładność układu diagnostycznego na 0,8, czyli mniej niż AUC! Kiedy sprawdziłem dokładność przy innym ustawieniu progu, który jest daleki …

1
Jaki jest związek między częściową najmniejszą liczbą kwadratów, regresją zredukowaną i regresją składowych głównych?
Czy regresja zredukowana rangi i regresja głównych składników to tylko szczególne przypadki częściowych najmniejszych kwadratów? Ten samouczek (strona 6, „Porównanie celów”) stwierdza, że ​​kiedy wykonujemy częściowe najmniejsze kwadraty bez rzutowania X lub Y (tj. „Nie częściowy”), staje się odpowiednio regresją zmniejszoną rangą lub regresją składowych głównych. Podobne oświadczenie znajduje się …




1
Jak modelować nieujemne dane ciągłe z zerowym napompowaniem?
Obecnie próbuję zastosować model liniowy ( family = gaussian) do wskaźnika różnorodności biologicznej, który nie może przyjmować wartości niższych niż zero, jest zawyżony i ciągły. Wartości mieszczą się w zakresie od 0 do nieco ponad 0,25. W rezultacie w resztkach modelu istnieje oczywisty wzorzec, którego nie udało mi się pozbyć: …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.