Zastanawiam się, dlaczego metody wyboru modeli LASSO i LARS są tak popularne, mimo że są to po prostu warianty stopniowego wybierania do przodu (a zatem cierpią na zależność od ścieżki)? Podobnie, dlaczego metody Ogólnego do Specyficznego (GETS) wyboru modelu są w większości ignorowane, nawet jeśli działają lepiej niż LARS / …
Pracuję z zestawem danych o wartości N około 200 000. W regresjach widzę bardzo małe wartości istotności << 0,001 związane z bardzo małymi wielkościami efektów, np. R = 0,028. Chciałbym wiedzieć, czy istnieje zasadniczy sposób decydowania o odpowiednim progu istotności w odniesieniu do wielkości próby? Czy istnieją inne ważne uwagi …
Załóżmy, że zbudowałem model predykcyjny dla wystąpienia określonej choroby w jednym zestawie danych (zestaw danych budowania modelu) i teraz chcę sprawdzić, jak dobrze model działa w nowym zestawie danych (zestaw danych sprawdzania poprawności). Dla modelu zbudowanego z regresją logistyczną obliczałbym przewidywane prawdopodobieństwo dla każdej osoby w zbiorze danych sprawdzania poprawności …
Minęło trochę czasu, odkąd spojrzałem na dzielenie drzew. Ostatnim razem, gdy robiłem takie rzeczy, lubię imprezę w R (stworzoną przez Hothorn). Idea wnioskowania warunkowego za pomocą próbkowania ma dla mnie sens. Ale rpart również miał apelację. W obecnej aplikacji (nie mogę podać szczegółów, ale wiąże się to z próbą ustalenia, …
Właściwie piszę implementację Losowych Lasów, ale uważam, że pytanie dotyczy drzew decyzyjnych (niezależnych od RF). Zatem kontekst polega na tym, że tworzę węzeł w drzewie decyzyjnym, a zmienne predykcyjne i docelowe są ciągłe. Węzeł ma podzielony próg podziału danych na dwa zestawy i tworzę nową prognozę dla każdego podzbioru na …
Było kilka dobrych pytań i zestawów odpowiedzi na temat książek wprowadzających lub podejść do nauki R np. Tu i tutaj . Ale mam nieco inny problem - najlepszy sposób na przeprowadzenie godzinnej sesji (lub kilku takich sesji) w pracowni komputerowej, w której ludzie zaczną pracę w R, zapoznając się z …
Jedną z rzeczy, która sprawia, że ekonometria jest wyjątkowa, jest zastosowanie techniki ogólnej metody momentów. Jakie rodzaje problemów sprawiają, że GMM jest bardziej odpowiedni niż inne techniki szacowania? Co kupuje GMM pod względem wydajności, mniejszej stronniczości lub bardziej szczegółowych oszacowań parametrów? I odwrotnie, co tracisz, używając GMM nad MLE itp.?
Powiedzmy, że mam duży zestaw wartości , które czasem się powtarzają. Chciałbym oszacować całkowitą liczbę unikalnych wartości w dużym zestawie.S.S.S Jeśli wezmę losową próbkę wartości, a także określić, że zawiera T Ü unikalne wartości, mogę to wykorzystać, aby oszacować liczbę unikatowych wartości w dużym zestawie?T.T.TT.uT.uT_u
Pytanie, które chcę zadać, brzmi: w jaki sposób odsetek próbek w granicach 1 SD od średniej rozkładu normalnego zmienia się wraz ze wzrostem liczby zmiennych? (Prawie) każdy wie, że w 1-wymiarowym rozkładzie normalnym 68% próbek można znaleźć w granicach 1 odchylenia standardowego od średniej. A co z wymiarami 2, 3, …
Jak rozumiem, możemy uzyskać korelację poprzez normalizację kowariancji za pomocą równania ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} gdzie to odchylenie standardowe . Xiσi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XiXiX_i Moje obawy dotyczą tego, czy odchylenie standardowe wynosi zero? Czy jest jakiś warunek, który gwarantuje, że nie może wynosić zero? Dzięki.
Jestem nowy w uczeniu maszynowym. W tej chwili używam klasyfikatora Naive Bayes (NB) do klasyfikowania małych tekstów w 3 klasach jako pozytywne, negatywne lub neutralne, używając NLTK i python. Po przeprowadzeniu niektórych testów z zestawem danych złożonym z 300 000 instancji (16 924 pozytywów 7 477 negatywów i 275 599 …
Mam nadzieję, że jest to właściwe miejsce do opublikowania tego. Rozważyłem opublikowanie go sceptykom, ale sądzę, że po prostu powiedzieliby, że badanie było statystycznie nieprawidłowe. Jestem ciekaw drugiej strony pytania, jak to zrobić dobrze. Na stronie internetowej Quantified Self autor opublikował wyniki eksperymentu pewnej miary wydajności mierzonej na sobie w …
Mam kilka trójkątnych siatek 3D. Statystyki dla obszarów trójkąta to: Min. 0,000 Maks. 2341.141 Średni 56,317 Std dev 98,720 Czy to oznacza coś szczególnie przydatnego w odchyleniu standardowym, czy sugeruje, że istnieją błędy w jego obliczaniu, gdy liczby działają tak jak powyżej? Obszary z pewnością są dalekie od normalnej dystrybucji. …
Jaki jest najlepszy gotowy do użycia klasyfikator 2 klas? Tak, myślę, że to pytanie za milion dolarów i tak, jestem świadomy twierdzenia o braku darmowego lunchu , a także przeczytałem poprzednie pytania: Jaki jest najlepszy gotowy do użycia 2-klasowy klasyfikator dla Twojej aplikacji? i najgorszy klasyfikator Nadal jestem zainteresowany czytaniem …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.