Algorytmy uczenia maszynowego budują model danych szkoleniowych. Termin „uczenie maszynowe” jest niejasno zdefiniowany; obejmuje to tak zwane uczenie statystyczne, uczenie wzmacniające, uczenie bez nadzoru itp. ZAWSZE DODAJ SZCZEGÓŁOWĄ TAGĘ.
Jest to często cytowane, gdy wspomina się o przekleństwie wymiarowości i odchodzi (formuła z prawej strony zwana kontrastem względnym) limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxkd−DminkdDminkd→0limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxdk−DmindkDmindk→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 Wynik twierdzenia pokazuje, że różnica między maksymalnymi i minimalnymi odległościami do danego punktu zapytania nie rośnie tak …
Próbuję przetestować zdolność losowego lasu do klasyfikowania próbek między dwiema grupami; Do klasyfikacji zastosowano 54 próbki i różną liczbę zmiennych. Zastanawiałem się, dlaczego szacunki braku w torbie (OOB) mogą się różnić nawet o 5%, nawet gdy używam 50 tys. Drzew? Czy jest to coś, w czym może pomóc bootstrapping?
Byłem ostatnio na kilku rozmowach statystycznych na temat Lasso (regularyzacja), a kwestią, która wciąż się pojawia, jest to, że tak naprawdę nie rozumiemy, dlaczego Lasso działa lub dlaczego działa tak dobrze. Zastanawiam się, do czego odnosi się to oświadczenie. Oczywiście rozumiem, dlaczego Lasso działa technicznie, zapobiegając nadmiernemu dopasowaniu poprzez kurczenie …
Jeśli chodzi o różnicę między siecią neuronową a głębokim uczeniem się, możemy wymienić kilka elementów, takich jak więcej warstw, ogromny zestaw danych, potężny sprzęt komputerowy, aby uczynić szkolenie skomplikowanym modelem. Poza tym, czy są jakieś bardziej szczegółowe wyjaśnienia dotyczące różnicy między NN i DL?
Podczas gdy faktycznie programowałem na maszynach Boltzmanna na zajęciach z fizyki, nie znam ich teoretycznej charakterystyki. W przeciwieństwie do tego znam skromną wiedzę na temat teorii modeli graficznych (o kilku pierwszych rozdziałach książki Lauritzen Modele graficzne ). Pytanie: Czy istnieje jakiś znaczący związek między modelami graficznymi a maszyną Boltzmanna? Czy …
To jest wynik F beta: faβ= ( 1 + β2)) ⋅ p r e c i s i o n ⋅ r e c a l l( β2)⋅ p r e c i s i o n ) + r e c a l lFβ=(1+β2)⋅precision⋅recall(β2⋅precision)+recallF_\beta = (1 + \beta^2) \cdot …
Czy można trenować sieć neuronową, aby rysować obraz w określonym stylu? (Więc pobiera obraz i przerysowuje w stylu, dla którego został wytrenowany). Czy istnieje zatwierdzona technologia dla tego rodzaju rzeczy? Wiem o algorytmie DeepArt. Dobrze jest wypełnić główny obraz pewnym wzorem (na przykład obraz vangoghify), ale szukam czegoś innego - …
Czy w PCA robi to różnicę, jeśli wybieramy główne składniki odwrotnej macierzy kowariancji LUB jeśli upuszczamy wektory własne macierzy kowariancji odpowiadające dużym wartościom własnym? Jest to związane z dyskusją w tym poście .
Niedawno zacząłem używać wygładzania ważności Pareto z pominięciem krzyżowej walidacji (PSIS-LOO), opisanej w tych artykułach: Vehtari, A., i Gelman, A. (2015). Pareto wygładził próbkowanie ważności. prefiks arXiv ( link ). Vehicletari, A., Gelman, A., i Gabry, J. (2016). Praktyczna ocena modelu Bayesa przy użyciu krzyżowej weryfikacji typu „out-one-out” i WAIC. …
Obsługiwane maszyny wektorowe z jądrem funkcji podstawy radialnej to nadzorowany klasyfikator ogólnego przeznaczenia. Chociaż znam teoretyczne podstawy tych maszyn wirtualnych i ich mocne strony, nie znam przypadków, w których są one preferowaną metodą. Czy istnieje klasa problemów, dla których SVM RBF są lepsze od innych technik ML? (Pod względem punktacji …
W literaturze dotyczącej uczenia maszynowego, aby przedstawić rozkład prawdopodobieństwa, często używana jest funkcja softmax. Czy jest tego powód? Dlaczego nie jest używana inna funkcja?
Obecnie czytam technikę wizualizacji t-SNE i wspomniano, że jedną z wad stosowania analizy głównych składników (PCA) do wizualizacji danych wielowymiarowych jest to, że zachowuje ona jedynie duże parowe odległości między punktami. Znaczące punkty, które są daleko od siebie w przestrzeni wielowymiarowej, również pojawią się daleko od siebie w niskiej przestrzeni …
Czytałem: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition Ale nie potrafię zrozumieć, dlaczego formuła została zbudowana w taki sposób. Co robię Rozumiem: iDF powinien na pewnym poziomie zmierzyć, jak często termin S pojawia się w każdym z dokumentów, zmniejszając jego wartość, ponieważ termin pojawia się częściej. Z tej perspektywy iDF(S)=# of Documents# of Documents containing SiDF(S)=# …
W części 7 artykułu Random Forests (Breiman, 1999) autor stwierdza następującą hipotezę: „Adaboost to las losowy”. Czy ktoś to udowodnił lub obalił? Co zrobiono, aby udowodnić lub obalić ten post po 1999 roku?
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.