To pytanie zwalidowane krzyżowo z pytaniem o symulację próbki uwarunkowanej ustaloną sumą przypomniało mi o problemie postawionym mi przez George'a Casellę . fa(x|θ)f(x|θ)f(x|\theta)(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n)θθ\thetaθ^(x1,…,xn)=argmin∑i=1nlogf(xi|θ)θ^(x1,…,xn)=argmin∑i=1nlogf(xi|θ)\hat{\theta}(x_1,\ldots,x_n)=\arg\min \sum_{i=1}^n \log f(x_i|\theta)θθ\theta θ (X1,...,xn)(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n)θ^(X1,…,Xn)θ^(X1,…,Xn)\hat{\theta}(X_1,\ldots,X_n) Weźmy na przykład rozkład , z parametrem lokalizacji , którego gęstość wynosi If jak możemy symulować uwarunkowane na ? W tym przykładzie …
Jaki jest wymiar VC drzewa decyzyjnego z podziałem k na dwa wymiary? Powiedzmy, że modelem jest CART, a jedyne dozwolone podziały są równoległe do osi. Tak więc dla jednego podziału możemy zamówić 3 punkty w trójkącie, a następnie dla dowolnego oznaczenia punktów możemy uzyskać doskonałą prognozę (tj. Strzaskane punkty) Ale …
W przypadku normy wektorowej powszechnie stosowaną i intuicyjną definicją jest norma L2 lub „odległość euklidesowa”. Ale dlaczego „najczęściej stosowana” lub „domyślna” definicja normy dla macierzy jest normą spektralną , a nie normą Frobeniusa (która jest podobna do normy L2 dla wektorów)? Czy ma to coś wspólnego z iteracyjnymi algorytmami / …
Rozumiem, co to jest „klątwa wymiarowości”, i zrobiłem kilka problemów związanych z optymalizacją wymiarów i znam wyzwanie możliwości wykładniczych. Wątpię jednak, czy „przekleństwo wymiarowości” istnieje w większości danych rzeczywistych (odłóżmy na chwilę zdjęcia lub filmy, myślę o danych takich jak dane demograficzne klientów i dane dotyczące zachowań zakupowych). Możemy gromadzić …
Używam LASSO, który ma pewne predyktory zmiennych jakościowych i niektóre ciągłe. Mam pytanie dotyczące zmiennych kategorialnych. Pierwszym krokiem, jaki rozumiem, jest rozbicie każdego z nich na atrapy, ujednolicenie ich pod kątem uczciwej kary, a następnie regres. Pojawia się kilka opcji traktowania zmiennych fikcyjnych: Uwzględnij wszystkie manekiny oprócz jednego dla każdego …
Czytałem o przeorze Jeffreysa na wikipedii: Jeffreys Prior i zobaczyłem, że po każdym przykładzie opisuje, jak transformacja stabilizująca wariancję zamienia Jeffreysa przed mundurem. Jako przykład w przypadku Bernoulliego stwierdza się, że dla monety, która jest główką z prawdopodobieństwem γ∈[0,1]γ∈[0,1]\gamma \in [0,1] , model próbny Bernoulliego daje, że Jeffreys przed parametrem …
To pytanie jest kontynuacją lub próbą wyjaśnienia możliwych nieporozumień dotyczących tematu, który ja i wiele innych osób uważam za nieco trudny, jeśli chodzi o różnicę między AIC i BIC. W bardzo ładnej odpowiedzi @Dave Kellen na ten temat ( /stats//a/767/30589 ) czytamy: Twoje pytanie sugeruje, że AIC i BIC próbują …
Zbudowałem klasyfikator regresji logistycznej, który jest bardzo dokładny na moich danych. Teraz chcę lepiej zrozumieć, dlaczego tak dobrze działa. W szczególności chciałbym uszeregować, które funkcje mają największy udział (które cechy są najważniejsze) i, najlepiej, obliczyć, ile każda cecha przyczynia się do dokładności całego modelu (lub czegoś w tym stylu). Jak …
Można wykonać regresję logit w R przy użyciu takiego kodu: > library(MASS) > data(menarche) > glm.out = glm(cbind(Menarche, Total-Menarche) ~ Age, + family=binomial(logit), data=menarche) > coefficients(glm.out) (Intercept) Age -21.226395 1.631968 Wygląda na to, że algorytm optymalizacji jest zbiegnięty - jest informacja o liczbie kroków algorytmu oceniania Fishera: Call: glm(formula = …
Załóżmy, że mam gęstą macierz o rozmiarze m × n , z rozkładem SVD A = U S V ⊤ . W mogę obliczyć SVD w następujący sposób: .AA \textbf{A}m×nm×nm \times nA=USV⊤.A=USV⊤.\mathbf{A}=\mathbf{USV}^\top.Rsvd(A) Jeśli nowy -ty wiersz zostanie dodany do A , czy można obliczyć nowy rozkład SVD na podstawie starego …
Pytanie Wariancja ujemnego rozkładu dwumianowego (NB) jest zawsze większa niż jego średnia. Gdy średnia próbki jest większa niż jej wariancja, próba dopasowania parametrów NB z maksymalnym prawdopodobieństwem lub oszacowaniem momentu zakończy się niepowodzeniem (nie ma rozwiązania z parametrami skończonymi). Jednak możliwe jest, że próbka pobrana z rozkładu NB ma wartość …
Zastanawiałem się nad napisaniem posta na blogu na temat tej ciekawej analizy Kleinberga (2002), która bada trudność tworzenia klastrów. Kleinberg przedstawia trzy pozornie intuicyjne desiderata funkcji klastrowania, a następnie udowadnia, że taka funkcja nie istnieje. Istnieje wiele algorytmów grupowania, które spełniają dwa z trzech kryteriów; jednak żadna funkcja nie może …
Tendencję centralną, rozprzestrzenianie się i skośność można określić stosunkowo dobrze, przynajmniej intuicyjnie; standardowe matematyczne miary tych rzeczy również stosunkowo dobrze odpowiadają naszym intuicyjnym pojęciom. Ale kurtoza wydaje się inna. Jest to bardzo mylące i nie pasuje do żadnej intuicji dotyczącej kształtu dystrybucji. Typowym wyjaśnieniem kurtozy w zastosowanym ustawieniu byłby ten …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.