Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Co znaczą statystycy, gdy mówią, że tak naprawdę nie rozumiemy, jak działa LASSO (regularyzacja)?
Byłem ostatnio na kilku rozmowach statystycznych na temat Lasso (regularyzacja), a kwestią, która wciąż się pojawia, jest to, że tak naprawdę nie rozumiemy, dlaczego Lasso działa lub dlaczego działa tak dobrze. Zastanawiam się, do czego odnosi się to oświadczenie. Oczywiście rozumiem, dlaczego Lasso działa technicznie, zapobiegając nadmiernemu dopasowaniu poprzez kurczenie …

2
Skutecznie próbkuje progową dystrybucję Beta
Jak powinienem efektywnie próbkować z następującej dystrybucji? x∼B(α,β), x>kx∼B(α,β), x>k x \sim B(\alpha, \beta),\space x > k Jeśli kkk nie jest zbyt duże, próbowanie odrzucenia może być najlepszym podejściem, ale nie jestem pewien, jak postępować, gdy kkk jest duże. Być może istnieje jakieś asymptotyczne przybliżenie, które można zastosować?


1
Regresja losowa lasu dla prognoz szeregów czasowych
Próbuję wykorzystać regresję RF do prognozowania wydajności papierni. Mam dane minut po minucie dla danych wejściowych (szybkość i ilość miazgi drzewnej wchodzącej itp.), A także dla wydajności maszyny (wyprodukowany papier, moc pobierana przez maszynę) i szukam prognoz 10 minut wyprzedzić zmienne wydajności. Mam 12 miesięcy danych, więc podzieliłem je na …

2
W jaki sposób Tensorflow `tf.train.Optimizer` oblicza gradienty?
Postępuję zgodnie z samouczkiem mens Tensorflow ( https://github.com/tensorflow/tensorflow/blob/master/tensorflow/examples/tutorials/mnist/mnist_softmax.py ). Samouczek używa tf.train.Optimizer.minimize(konkretnie tf.train.GradientDescentOptimizer). Nigdzie nie widzę żadnych argumentów do zdefiniowania gradientów. Czy przepływ Tensor jest domyślnie domyślnie różnicowany numerycznie? Czy istnieje sposób, aby przejść w gradienty, jak można z scipy.optimize.minimize?


1
Co uzasadnia to obliczenie pochodnej funkcji macierzowej?
W kursie uczenia maszynowego Andrew Nga używa tej formuły: ∇Atr(ABATC)=CAB+CTABT∇Atr(ABATC)=CAB+CTABT\nabla_A tr(ABA^TC) = CAB + C^TAB^T i robi szybki dowód, który pokazano poniżej: ∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB\nabla_A tr(ABA^TC) \\ = \nabla_A tr(f(A)A^TC) \\ = \nabla_{\circ} tr(f(\circ)A^TC) + \nabla_{\circ}tr(f(A)\circ^T C)\\ =(A^TC)^Tf'(\circ) + (\nabla_{\circ^T}tr(f(A)\circ^T C)^T \\ = C^TAB^T + (\nabla_{\circ^T}tr(\circ^T)Cf(A))^T \\ =C^TAB^T + ((Cf(A))^T)^T \\ = …



2
Czy splotowa sieć neuronowa może przyjmować jako obrazy wejściowe o różnych rozmiarach?
Pracuję w sieci splotowej do rozpoznawania obrazów i zastanawiałem się, czy mogę wprowadzić obrazy o różnych rozmiarach (choć nie tak bardzo różnych). W sprawie tego projektu: https://github.com/harvardnlp/im2markup Mówią: and group images of similar sizes to facilitate batching Więc nawet po wstępnym przetwarzaniu obrazy są nadal różnych rozmiarów, co ma sens, …

2
Rozkłady na posortowane listy
Powiedzmy, że mamy uporządkowaną listę przedmiotów [a, b, c, ... x, y, z, ...] Szukam rodziny dystrybucji z obsługą na powyższej liście, regulowanej przez niektóre parametry alfa, dzięki czemu: Dla alfa = 0 przypisuje prawdopodobieństwo 1 do pierwszego elementu, a powyżej, i 0 do reszty. Oznacza to, że jeśli próbkujemy …

1
W jakiej sytuacji test podpisania rang Wilcoxona byłby lepszy od testu t lub testu znaku?
Po krótkiej dyskusji (poniżej) mam teraz jaśniejszy obraz skoncentrowanego pytania, więc oto poprawione pytanie, chociaż niektóre komentarze mogą wydawać się niezwiązane z pierwotnym pytaniem. Wydaje się, że testy t zbiegają się szybko dla rozkładów symetrycznych , że test rangi ze znakiem zakłada symetrię i że dla rozkładu symetrycznego nie ma …


2
Testowanie istotności współczynników w regresji logistycznej Lasso
[Podobne pytanie zostało zadane tutaj bez odpowiedzi] Dopasowałem model regresji logistycznej z regularyzacją L1 (regresja logistyczna Lasso) i chciałbym przetestować dopasowane współczynniki pod kątem istotności i uzyskać ich wartości p. Wiem, że testy Walda (na przykład) są opcją testowania znaczenia poszczególnych współczynników w pełnej regresji bez regularyzacji, ale w przypadku …

3
Zmienna wskaźnikowa dla danych binarnych: {-1,1} vs {0,1}
Ja zainteresowany interakcji leczeniem współzmienną w kontekście doświadczeń / randomizacją z binarnego przypisywania traktowania wskaźnik TTT . W zależności od konkretnej metody / źródła widziałem zarówno T={1,0}T={1,0}T=\{1,0\} i dla leczonych i nieleczonych pacjentów.T={1,−1}T={1,−1}T=\{1, -1\} Czy jest jakaś reguła, kiedy używać lub ?{1,0}{1,0}\{1,0\}{1,−1}{1,−1}\{1, -1\} Czym różni się interpretacja?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.