Natknąłem się na ten wątek, patrząc na różnice między ładowaniem początkowym a weryfikacją krzyżową - przy okazji, świetna odpowiedź i referencje. Zastanawiam się teraz, czy gdybym powtórzył 10-krotne CV, aby obliczyć dokładność klasyfikatora, ile razy n powinienem to powtórzyć? Czy n zależy od liczby fałd? Na wielkości próbki? Czy jest …
Mam ramkę danych, która zawiera dwie serie czasowe: daty i numery wersji wydań Emacs i Firefox. Za pomocą jednego polecenia ggplot2 łatwo jest utworzyć wykres, który używa less (w sposób, który wygląda nieco zabawnie, co nie mam nic przeciwko), aby zamieniać punkty w linie. Jak mogę przedłużyć linie w przyszłości? …
Dlaczego dywergencja KL nie jest ujemna? Z punktu widzenia teorii informacji rozumiem tak intuicyjnie: Powiedzmy, że istnieją dwa zespoły AAA i BBB które składają się z tego samego zestawu elementów oznaczonych xxx . p(x)p(x)p(x) i q(x)q(x)q(x) są różne rozkłady prawdopodobieństwa ponad zespołem AAA i BBB , odpowiednio. Z punktu widzenia …
Próbuję zrozumieć, w jaki sposób mogę uzyskać znaczenie funkcji zmiennej jakościowej, która została podzielona na zmienne fikcyjne. Używam scikit-learn, który nie obsługuje zmiennych kategorialnych tak jak R lub H2O. Jeśli podzielę zmienną kategorialną na zmienne pozorne, otrzymam osobne importy cech dla każdej klasy w tej zmiennej. Moje pytanie brzmi: czy …
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Do tej pory usunąłem zmienne współliniowe w ramach procesu przygotowania danych, patrząc na tabele korelacji i eliminując zmienne, które przekraczają pewien …
Chcę zaimplementować algorytm w dokumencie, który używa jądra SVD do dekompozycji macierzy danych. Czytałem więc materiały na temat metod jądra i PCA jądra itp. Ale wciąż jest to dla mnie bardzo niejasne, szczególnie jeśli chodzi o szczegóły matematyczne, i mam kilka pytań. Dlaczego metody jądra? Lub jakie są zalety metod …
Właśnie skończyłem czytać tę dyskusję. Twierdzą, że PR AUC jest lepszy niż ROC AUC w niezrównoważonym zbiorze danych. Na przykład mamy 10 próbek w zestawie danych testowych. 9 próbek jest pozytywnych, a 1 ujemna. Mamy okropny model, który przewiduje wszystko pozytywnie. Będziemy zatem mieć miarę, że TP = 9, FP …
Widziałem wykresy błędu testu / treningu nagle spadające kilka razy w pewnej epoce (ach) podczas treningu sieci neuronowej i zastanawiam się, co powoduje te skoki wydajności: To zdjęcie pochodzi z Kaiming Jest Githubem, ale podobne wątki pojawiają się w wielu artykułach.
Napisałem program, który generuje losowe dane. Jeśli program działa poprawnie, dane powinny mieć określony, znany rozkład prawdopodobieństwa. Chciałbym uruchomić program, wykonać obliczenia wyniku i podać wartość p. Zanim ktokolwiek to powie: rozumiem, że testowanie hipotez nie może wykryć, kiedy program działa poprawnie. Może wykryć tylko, gdy działa nieprawidłowo w określony …
Mam zmienną numeryczną, która okazuje się nieistotna w wielowymiarowym modelu regresji logistycznej. Kiedy jednak podzielę go na grupy, nagle staje się znaczący. Jest to dla mnie bardzo sprzeczne z intuicją: kategoryzując zmienną, podajemy pewne informacje. Jak to może być?
Kontekst: W 8-szkolnym przykładzie Gelmana (analiza danych bayesowskich, wydanie 3, rozdz. 5.5) istnieje osiem równoległych eksperymentów w 8 szkołach testujących efekt coachingu. Każdy eksperyment daje oszacowanie skuteczności coachingu i związanego z nim błędu standardowego. Następnie autorzy budują model hierarchiczny dla 8 punktów danych efektu coachingu w następujący sposób: yi∼N(θi,sei)θi∼N(μ,τ)yi∼N(θi,sei)θi∼N(μ,τ) y_i …
Przeczytałem niezliczoną liczbę postów na tej stronie, które są niezwykle przeciwne stosowaniu stopniowego wyboru zmiennych przy użyciu dowolnego kryterium, niezależnie od tego, czy będzie to oparte na wartościach p, AIC, BIC itp. Rozumiem, dlaczego te procedury są ogólnie dość kiepskie w doborze zmiennych. Prawdopodobnie słynny post Gunga jasno ilustruje dlaczego; …
Dlaczego litera Q została wybrana w imieniu Q-learningu? Większość liter jest wybieranych jako skrót, na przykład oznacza ππ\pistrategię, a vvv oznacza wartość. Ale nie sądzę, że Q jest skrótem dowolnego słowa.
Przeszkoliłem model regresji liniowej, używając zestawu zmiennych / cech. A model ma dobrą wydajność. Zrozumiałem jednak, że nie ma zmiennej o dobrej korelacji z przewidywaną zmienną. Jak to jest możliwe?
Mówi się, że estymatory regresji karnej, takie jak LASSO i kalenica, odpowiadają estymatorom bayesowskim z pewnymi priorytetami. Wydaje mi się (ponieważ nie wiem wystarczająco dużo na temat statystyki bayesowskiej), że dla ustalonego parametru strojenia istnieje konkretny wcześniejszy odpowiednik. Teraz częsty optymalizowałby parametr strojenia poprzez krzyżową weryfikację. Czy istnieje odpowiednik bayesowski …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.