Dzisiaj zauważyłem na to pytanie , a ja pomyślałem, że byłoby pomocne, jeśli mieliśmy wątek, że wymienione środki, które ludzie mogli wygodnie dostęp do analizy zasilania / przykładowych obliczeń wielkości, może analogiczny do tego wątku: Zasoby do nauki R .
Mam zestaw danych z dziesiątkami tysięcy obserwacji danych o kosztach medycznych. Te dane są mocno przekrzywione w prawo i mają dużo zer. Wygląda to tak dla dwóch grup osób (w tym przypadku dwa przedziały wiekowe z> 3000 obs każda): Min. 1st Qu. Median Mean 3rd Qu. Max. 0.0 0.0 0.0 …
Mam przestrzeń 35 wymiarów (atrybutów). Mój problem analityczny jest prosty. Spośród 35 wymiarów ponad 25 ma charakter kategoryczny, a każdy atrybut przyjmuje ponad 50 typów wartości. W tym scenariuszu wprowadzenie zmiennej zastępczej również nie będzie dla mnie działać. Jak mogę uruchomić SVM na przestrzeni, która ma wiele atrybutów jakościowych?
Chcę wykonać bardzo prostą regresję liniową w R. Formuła jest tak prosta, jak . Chciałbym jednak, aby nachylenie ( ) znajdowało się w przedziale, powiedzmy, między 1,4 a 1,6.y= a x + by=zax+by = ax + bzazaa Jak można to zrobić?
Jestem programistą pracującym nad systemami testowymi A / B. Nie mam solidnych statystyk, ale zbierałem wiedzę w ciągu ostatnich kilku miesięcy. Typowy scenariusz testowy polega na porównaniu dwóch adresów URL na stronie internetowej. Odwiedzający odwiedza, LANDING_URLa następnie jest losowo przekazywany do jednego URL_CONTROLlub jednego URL_EXPERIMENTAL. Odwiedzający stanowi próbkę, a warunek …
Prawie wszystko, co czytam o regresji liniowej i GLM sprowadza się do tego: gdzie f ( x , β ) jest nie rosnącą lub nie malejącą funkcją x, a β jest parametrem, który oceniasz i testujesz hipotezy na temat. Istnieją dziesiątki funkcji łączenia i przekształceń y i x, dzięki którym …
Aby zrobić ten wykres, wygenerowałem losowe próbki o różnej wielkości z rozkładu normalnego ze średnią = 0 i sd = 1. Przedziały ufności zostały następnie obliczone przy użyciu wartości odcięcia alfa w zakresie od 0,001 do .999 (czerwona linia) za pomocą funkcji t.test (), prawdopodobieństwo profilu zostało obliczone przy użyciu …
Wiem, że jedną z zalet modeli mieszanych jest to, że pozwalają one określić macierz wariancji-kowariancji dla danych (symetria złożona, autoregresja, nieustrukturyzowana itp.). Jednak lmerfunkcja w R nie pozwala na łatwą specyfikację tej macierzy. Czy ktoś wie, która struktura lmerużywa domyślnie i dlaczego nie ma sposobu, aby ją łatwo określić?
Czy ER jest bardziej wydajne w realizacji (może Extreme Gradient Boostingto być zwiększenie gradientu) - czy różnica jest ważna z praktycznego punktu widzenia? Istnieje pakiet R, który je implementuje. Czy to nowy algorytm, który pokonuje implementację „ogólną” (pakiet RandomForest od R) nie tylko pod względem wydajności, czy też w niektórych …
Rozumiem, że używamy modeli efektów losowych (lub efektów mieszanych), gdy uważamy, że niektóre parametry modelu zmieniają się losowo w zależności od czynnika grupującego. Chcę dopasować model, w którym odpowiedź została znormalizowana i wyśrodkowana (nie idealnie, ale całkiem blisko) w obrębie czynnika grupującego, ale zmienna niezależna xnie została w żaden sposób …
Mam pytanie od bardzo początkującego dotyczące centralnego twierdzenia granicznego (CLT): Wiem, że CLT stwierdza, że średnia iid zmiennych losowych ma w przybliżeniu rozkład normalny (dla , gdzie n jest indeksem sum) lub że znormalizowana zmienna losowa miałaby standardowy rozkład normalny.n → ∞n→∞n \to \inftynnn Teraz prawo dużej liczby mówi z …
Załóżmy, że masz torbę z płytkami, z których każda zawiera literę. Są kafelki z literą „A”, z „B” itd. , „symbole wieloznaczne” (mamy ). Załóżmy, że masz słownik ze skończoną liczbą słów.n A n B n ∗ n = n A + n B + … + n Z + …
Muszę obliczyć przykładową odległość Mahalanobisa w R pomiędzy każdą parą obserwacji w macierzy współzmiennych . Potrzebuję rozwiązania, które jest wydajne, tj. Obliczane są tylko odległości, a najlepiej realizowane w C / RCpp / Fortran itp. Zakładam, że , macierz kowariancji populacyjnej, jest nieznana i wykorzystuję próbkę macierz kowariancji na swoim …
Znalazłem odniesienie w artykule, który brzmi: Według Tabachnick i Fidell (1996) zmienne niezależne o korelacji dwuwymiarowej większej niż 0,70 nie powinny być uwzględniane w analizie regresji wielokrotnej. Problem: Użyłem w układzie regresji wielokrotnej 3 zmiennych skorelowanych> .80, VIF na poziomie około .2 - .3, Tolerancja ~ 4- 5. Nie mogę …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.