Jeśli mam splotową sieć neuronową (CNN), która ma około 1 000 000 parametrów, ile danych treningowych jest potrzebnych (zakładam, że wykonuję stochastyczne obniżanie gradientu)? Czy jest jakaś reguła? Dodatkowe uwagi: Kiedy wykonałem stochastyczne opadanie gradientu (np. 64 łaty na 1 iterację), po ~ 10000 iteracjach dokładność klasyfikatora może osiągnąć z …
Wykonałem 5-krotne CV, aby wybrać optymalną K dla KNN. I wydaje się, że im większy K, tym mniejszy błąd ... Niestety nie miałem legendy, ale różne kolory reprezentują różne próby. Jest ich łącznie 5 i wygląda na to, że między nimi jest niewielka różnorodność. Błąd zawsze wydaje się zmniejszać, gdy …
To pytanie może być bardzo naiwne, ale sposób, w jaki uczę się ekonometrii, jestem bardzo zdezorientowany, jeśli istnieje różnica między szeregami czasowymi a metodą danych panelowych. Jeśli chodzi o szeregi czasowe, omówiłem takie tematy jak stacjonarne kowariancje, AR, MA itp. Jeśli chodzi o dane panelowe, widziałem tylko dyskusje w postaci …
Procedura t-testu SPSS zgłasza 2 analizy przy porównywaniu 2 niezależnych średnich, jedną analizę przy założeniu równych wariancji i jedną przy założeniu równych wariancji. Stopnie swobody (df) przy założeniu równych wariancji są zawsze wartościami całkowitymi (i równymi n-2). Df, gdy nie zakłada się równych wariancji, nie są liczbami całkowitymi (np. 11,467) …
Próbuję zrozumieć modele faktoryzacji macierzy dla systemów rekomendujących i zawsze czytam „ukryte funkcje”, ale co to znaczy? Wiem, co oznacza funkcja dla zestawu danych szkoleniowych, ale nie jestem w stanie zrozumieć idei ukrytych funkcji. Każdy artykuł na ten temat, który mogę znaleźć, jest po prostu zbyt płytki. Edytować: jeśli przynajmniej …
Używam KL Divergence jako miary odmienności między 2 p.m.f.p.m.f.p.m.f. PPP i QQQ . DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) Jeśli to możemy łatwo obliczyć, że P ( X i ) l n ( Q ( X i ) ) = 0 P ( …
Mam dane na temat pracowników dużej włoskiej firmy w ciągu dziesięciu lat i chciałbym zobaczyć, jak zmieniła się z czasem różnica między płciami w zarobkach kobiet i mężczyzn. W tym celu uruchamiam połączone OLS: yi t= X′i tβ+ δm a l eja+ ∑t = 110γtret+ εi tyjat=Xjat′β+δmzalmija+∑t=110γtret+εjat y_{it} = X'_{it}\beta …
Więc bawiłem się SVM i zastanawiam się, czy to dobra rzecz: Mam zestaw funkcji ciągłych (od 0 do 1) i zestaw cech kategorycznych, które przekonwertowałem na zmienne obojętne. W tym konkretnym przypadku koduję datę pomiaru w zmiennej zastępczej: Są 3 okresy, z których mam dane i zarezerwowałem dla nich 3 …
Mam wielowymiarowy zestaw danych szeregów czasowych, w tym oddziałujące zmienne biologiczne i środowiskowe (oraz ewentualnie niektóre zmienne egzogeniczne). Oprócz sezonowości w danych nie ma wyraźnego trendu długoterminowego. Moim celem jest sprawdzenie, które zmienne są ze sobą powiązane. Tak naprawdę nie szuka się prognozowania. Będąc nowym w analizie szeregów czasowych, przeczytałem …
To pytanie podaje ilościową definicję entropii krzyżowej pod względem jej wzoru. Szukam bardziej hipotetycznej definicji, wikipedia mówi: W teorii informacji entropia krzyżowa między dwoma rozkładami prawdopodobieństwa mierzy średnią liczbę bitów potrzebną do zidentyfikowania zdarzenia z zestawu możliwości, jeśli stosuje się schemat kodowania oparty na danym rozkładzie prawdopodobieństwa q, a nie …
Chciałbym dopasować wyjścia lmera (naprawdę blasku) do dwumianowego przykładu zabawki. Przeczytałem winiety i wierzę, że rozumiem, co się dzieje. Ale najwyraźniej nie. Po utknięciu, naprawiłem „prawdę” w kategoriach efektów losowych i poszedłem po ocenie samych ustalonych efektów. Podaję ten kod poniżej. Aby zobaczyć, że jest to uzasadnione, możesz skomentować + …
Aby CLT mógł się utrzymać, potrzebujemy rozkładu, który chcemy w przybliżeniu mieć średnią i wariancję skończoną σ 2 . Czy prawdą byłoby stwierdzenie, że w przypadku rozkładu Cauchy'ego, którego średnia i wariancja są niezdefiniowane, Centralne Twierdzenie Graniczne nie zapewnia dobrego przybliżenia nawet asymptotycznie?μμ\muσ2)σ2)\sigma^2
Mam model liniowy z około 6 predyktorami i zamierzam prezentować szacunki, wartości F, wartości p itd. Zastanawiałem się jednak, jaki byłby najlepszy wykres wizualny reprezentujący indywidualny wpływ pojedynczego predyktora na zmienna odpowiedzi? Wykres punktowy? Fabuła warunkowa? Fabuła efektów? itp? Jak interpretowałbym ten wątek? Będę robił to w R, więc możesz …
W programie Libre Office Calc rand()dostępna jest funkcja, która wybiera losową wartość od 0 do 1 z jednolitego rozkładu. Prawdopodobnie jestem trochę zardzewiały, więc kiedy zobaczyłem następujące zachowanie, byłem zaskoczony: A = 200 x 1 kolumna z rand()^2 B = 200 x 1 kolumna z rand()*rand() mean(A) = 1/3 mean(B) …
Mam trudności z wyprowadzeniem Hesji funkcji celu, , w regresji logistycznej, gdzie wynosi: l(θ)l(θ)l(\theta)l(θ)l(θ)l(\theta)l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))]l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] hθ(x)hθ(x)h_\theta(x) to funkcja logistyczna. Hessian to . Próbowałem to wyliczyć, obliczając , ale wtedy nie było dla mnie oczywiste, jak dostać się do notacji macierzowej z …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.