Po co budować model predykcyjny przy użyciu technik uczenia maszynowego, po co przeprowadzać eksploracyjną analizę danych (EDA)? Czy można przejść od razu do generowania obiektów i budowania modeli? Jak ważne są statystyki opisowe stosowane w EDA?
Załóżmy, że chcę stworzyć model regresji logistycznej, który może oszacować prawdopodobieństwo wystąpienia niektórych gatunków zwierząt żyjących na drzewach w oparciu o cechy drzew (np. Wysokość). Jak zawsze mój czas i pieniądze są ograniczone, dlatego jestem w stanie zebrać tylko ograniczoną liczbę próbek. Mam następujące pytania: Czy stosunek 1 do 0 …
Dużo czytałem o algorytmie sne do redukcji wymiarów. Jestem pod wielkim wrażeniem wydajności „klasycznych” zestawów danych, takich jak MNIST, w których osiąga wyraźne rozdzielenie cyfr ( patrz oryginalny artykuł ):ttt Użyłem go również do wizualizacji funkcji poznanych przez sieć neuronową, którą trenuję i byłem bardzo zadowolony z wyników. Tak więc, …
Chciałbym dowiedzieć się, jak opracować przybliżenie geograficzne pewnego rodzaju epicentrum na podstawie danych z epidemii choroby John Snow Cholera. Jakie modelowanie statystyczne można zastosować do rozwiązania takiego problemu bez uprzedniej wiedzy o tym, gdzie znajdują się studnie. Jako ogólny problem miałbyś do dyspozycji czas, lokalizację znanych punktów i ścieżkę spacerową …
Piszę przykład i stworzyłem trochę danych. Chcę, aby czytelnik zrozumiał, że to nie są prawdziwe dane, ale nie chcę też sprawiać wrażenia złośliwości, ponieważ służy to jedynie za przykład. Nie ma (pseudo) losowego składnika tych konkretnych danych, więc wydaje mi się, że „symulowane” nie jest właściwe. Jeśli nazywam to fikcyjnym …
W pytaniu, które zadałem niedawno , powiedziano mi, że ekstrapolacja za pomocą lessa była dużym „nie-nie”. Ale w najnowszym artykule Nate'a Silvera na FiveThirtyEight.com omówił wykorzystanie lessu do prognozowania wyborów. Z lesssem omawiał specyfikę agresywnych i konserwatywnych prognoz z lesssem, ale jestem ciekawy, czy trafne jest przewidywanie przyszłych prognoz z …
Zwykle używamy PCA jako techniki redukcji wymiarów dla danych, w których zakłada się, że przypadki są identyczne Pytanie: Jakie są typowe niuanse w stosowaniu PCA w odniesieniu do zależnych danych innych niż iid? Jakie miłe / użyteczne właściwości PCA, które przechowują dane ID, są zagrożone (lub całkowicie utracone)? Na przykład …
Monty doskonale wiedział, czy za drzwiami stoi koza (czy była pusta). Ten fakt pozwala Graczowi podwoić swój wskaźnik sukcesu w czasie, przełączając „domysły” na inne Drzwi. Co jeśli wiedza Monty'ego nie była doskonała? Co się stanie, jeśli czasami Nagroda rzeczywiście będzie w tej samej Bramie co Kozioł? Ale nie mogłeś …
Niedawno biegałem i uczyłem się przepływu tensora i otrzymałem kilka histogramów, których nie umiałem interpretować. Zazwyczaj myślę o wysokości słupków jako o częstotliwości (lub częstotliwości względnej / zliczeniach). Jednak fakt, że nie ma pasków jak na zwykłym histogramie oraz fakt, że rzeczy są zacienione, myli mnie. wydaje się, że jednocześnie …
Jeśli spojrzysz na dokumentację http://keras.io/optimizers/, w SGD znajduje się parametr rozpadu. Wiem, że to zmniejsza szybkość uczenia się w miarę upływu czasu. Nie mogę jednak dowiedzieć się, jak to dokładnie działa. Czy jest to wartość pomnożona przez współczynnik uczenia się, np. Czy lr = lr * (1 - decay) jest …
I zostały pominie ten przegląd lm / lmer formuł R od @conjugateprior i irytować się według następującego wpisu: Załóżmy teraz, że A jest losowy, ale B jest stały, a B jest zagnieżdżony w A. aov(Y ~ B + Error(A/B), data=d) Poniżej przedstawiono analogiczną formułę modelu mieszanego lmer(Y ~ B + …
Prowadzę badania nad technikami optymalizacji w uczeniu maszynowym, ale jestem zaskoczony, że duża liczba algorytmów optymalizacji jest definiowana pod kątem innych problemów z optymalizacją. Poniżej zilustruję kilka przykładów. Na przykład https://arxiv.org/pdf/1511.05133v1.pdf Wszystko wygląda ładnie i dobrze, ale jest to w aktualizacji .... więc jaki algorytm rozwiązuje dla ? Nie wiemy …
Po długim przeszukiwaniu Cross Validated nadal nie czuję, że jestem bliżej zrozumienia dywergencji KL poza sferą teorii informacji. To dość dziwne, gdy ktoś z wykształceniem matematycznym łatwiej jest zrozumieć wyjaśnienie teorii informacji. Podsumowując moje rozumienie na podstawie teorii informacji: jeśli mamy zmienną losową o skończonej liczbie wyników, istnieje optymalne kodowanie, …
Załóżmy, że trenowałem kilka modeli na zestawie treningowym, wybierz najlepszy, używając zestawu do krzyżowej weryfikacji i mierzonej wydajności na zestawie testowym. Więc teraz mam jeden ostateczny najlepszy model. Czy powinienem przekwalifikować je na wszystkie dostępne dane lub wysłać rozwiązanie szkolone tylko na zestawie szkoleniowym? Jeśli to drugie, to dlaczego? AKTUALIZACJA: …
Przyszło mi dziś do głowy, że rozkład może być postrzegany jako kompromis między gaussowskim a Laplace'em dystrybucje, dla iCzy taka dystrybucja ma nazwę? I czy ma ona wyraz swojej stałej normalizacji? Rachunek mnie zaskakuje, ponieważ nie wiem, jak nawet rozpocząć rozwiązywanie dla w całce f(x)∝exp(−|x−μ|pβ)f(x)∝exp(−|x−μ|pβ) f(x)\propto\exp\left(-\frac{|x-\mu|^p}{\beta}\right) x∈R,p∈[1,2]x∈R,p∈[1,2]x\in\mathbb{R}, p\in[1,2]β>0.β>0.\beta>0.CCC1=C⋅∫∞−∞exp(−|x−μ|pβ)dx1=C⋅∫−∞∞exp(−|x−μ|pβ)dx 1=C\cdot \int_{-\infty}^\infty …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.