Regresja LASSO zmniejsza współczynniki do zera, zapewniając w ten sposób efektywny wybór modelu. Uważam, że w moich danych występują znaczące interakcje między zmiennymi nominalnymi i ciągłymi zmiennymi towarzyszącymi. Jednak niekoniecznie „główne efekty” prawdziwego modelu są znaczące (niezerowe). Oczywiście tego nie wiem, ponieważ prawdziwy model jest nieznany. Moim celem jest znalezienie …
Zamknięte . To pytanie jest oparte na opiniach . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby można było na nie odpowiedzieć faktami i cytatami, edytując ten post . Zamknięte 2 lata temu . Podstawowy problem z głębokim uczeniem się i ogólnie sieciami neuronowymi. Rozwiązania pasujące do …
W całym założeniu nasza statystyka jest funkcją niektórych danych która jest pobierana z funkcji dystrybucyjnej ; funkcja rozkładu empirycznego naszej próbki to . Więc to statystyka postrzegana jako zmienna losowa, a to wersja statystyki ładowania początkowego. Używamy jako odległości KSθ(⋅)θ(⋅)\theta(\cdot)X1,…XnX1,…XnX_1, \ldots X_nF θ ( F ) θ ( M ) …
Jakie są zalety, dlaczego warto korzystać z wielu LSTM, ułożonych jeden obok drugiego, w sieci głębokiej? Używam LSTM do reprezentowania sekwencji danych wejściowych jako pojedynczego wejścia. Więc kiedy mam tę pojedynczą reprezentację - dlaczego miałbym ją powtórzyć? Pytam o to, ponieważ widziałem to w programie generowania języka naturalnego.
Dlaczego funkcje aktywacji rektyfikowanych jednostek liniowych (ReLU) są uważane za nieliniowe? f(x)=max(0,x)f(x)=max(0,x) f(x) = \max(0,x) Są one liniowe, gdy dane wejściowe są dodatnie i z mojego zrozumienia, aby odblokować reprezentatywną moc głębokich sieci, nieliniowe aktywacje są koniecznością, w przeciwnym razie cała sieć mogłaby być reprezentowana przez pojedynczą warstwę.
Próbuję opracować model predykcyjny z wykorzystaniem wielowymiarowych danych klinicznych, w tym wartości laboratoryjnych. Przestrzeń danych jest rzadka z 5k próbkami i 200 zmiennymi. Chodzi o to, aby uszeregować zmienne przy użyciu metody wyboru cech (IG, RF itp.) I użyć funkcji o najwyższym rankingu do opracowania modelu predykcyjnego. Podczas gdy wybór …
Czy twierdzenie, że funkcje niezależnych zmiennych losowych są same w sobie niezależne, prawda? Widziałem ten wynik często używany pośrednio w niektórych dowodach, na przykład w dowodzie niezależności między średnią próbki a wariancją próby rozkładu normalnego, ale nie byłem w stanie znaleźć uzasadnienia. Wydaje się, że niektórzy autorzy uważają to za …
Załóżmy, że mamy rozkład Dirichleta z parametrem wektora wymiarowego . Jak narysować próbkę ( wektor wymiarowy) z tego rozkładu? Potrzebuję (możliwie) prostego wyjaśnienia.KKKα⃗ =[α1,α2,...,αK]α→=[α1,α2,...,αK]\vec\alpha = [\alpha_1, \alpha_2,...,\alpha_K]KKK
Ostatnio zacząłem studiować uczenie maszynowe, jednak nie rozumiałem intuicji stojącej za regresją logistyczną . Oto fakty dotyczące regresji logistycznej, które rozumiem. Jako podstawę hipotezy wykorzystujemy funkcję sigmoidalną . Rozumiem, dlaczego to poprawny wybór, ale dlaczego jest to tylko wybór nie rozumiem. Hipoteza reprezentuje prawdopodobieństwo, że odpowiednia wartość wyjściowa wynosi 1 …
Myślę więc, że dobrze rozumiem podstawy prawdopodobieństwa częstokroć i analizy statystycznej (i tego, jak bardzo można je wykorzystać). W świecie częstokroć sensowne jest zadawanie takiego pytania, jak: „czy ten rozkład różni się od tego rozkładu”, ponieważ zakłada się, że rozkłady są rzeczywiste, obiektywne i niezmienne (przynajmniej dla danej sytuacji), i …
Mam zestaw danych z zestawem funkcji. Niektóre z nich są binarne aktywne lub zwolnione, nieaktywne lub nieaktywne), a reszta ma wartość rzeczywistą, np . .(1=(1=(1=0=0=0=4564.3424564.3424564.342 Chcę nakarmić te dane do algorytmu uczenia maszynowego, więc zzz -score wszystkie wartościach rzeczywistych możliwości. Dostaję je w przybliżeniu między zakresem 333 a −2−2-2 . …
Mam zestaw danych z przykładowymi obserwacjami, przechowywanymi jako liczby w przedziałach zakresu. na przykład: min/max count 40/44 1 45/49 2 50/54 3 55/59 4 70/74 1 Teraz oszacowanie średniej z tego jest dość proste. Po prostu użyj średniej (lub mediany) każdego przedziału zakresu jako obserwacji i zliczenia jako wagi i …
W dyskusji: jak wygenerować krzywą roc do klasyfikacji binarnej , myślę, że zamieszanie polegało na tym, że „klasyfikator binarny” (który jest dowolnym klasyfikatorem, który oddziela 2 klasy) był dla Yang tak zwany „dyskretny klasyfikator” (który produkuje wyjścia dyskretne 0/1 jak SVM), a nie ciągłe dane wyjściowe, takie jak klasyfikatory ANN …
Mam trochę danych i chcę zbudować model (powiedzmy model regresji liniowej) z tych danych. W następnym kroku chcę zastosować weryfikację krzyżową Leave-One-Out (LOOCV) na modelu, aby zobaczyć, jak dobrze sobie radzi. Jeśli dobrze zrozumiałem LOOCV, buduję nowy model dla każdej z moich próbek (zestaw testowy), używając każdej próbki oprócz tej …
Muszę wygenerować losowe macierze nie kwadratowe z wierszami i kolumnami C , elementy losowo rozmieszczone ze średnią = 0 i ograniczone tak, że długość (norma L2) każdego wiersza wynosi 1, a długość każdej kolumny wynosi √RRRCCC111 . Odpowiednio suma wartości kwadratowych wynosi 1 dla każdego wiersza iR.RC−−√RC\sqrt{\frac{R}{C}}RCRC\frac{R}{C} dla każdej kolumny. …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.