Trenuję model klasyfikacyjny z Random Forest, aby rozróżnić 6 kategorii. Moje dane transakcyjne zawierają około 60 000 obserwacji i 35 zmiennych. Oto przykład, jak to w przybliżeniu wygląda. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | 2013-04-12 | 6 | PNG …
Mam próbkę 100 punktów, które są ciągłe i jednowymiarowe. Oszacowałem jego nieparametryczną gęstość za pomocą metod jądra. Jak narysować losowe próbki z tego szacunkowego rozkładu?
Przeglądam artykuł w czasopiśmie akademickim, a autorzy napisali następujące uzasadnienie dla nieprzekazywania żadnych wnioskowania statystycznego (zidentyfikowałem charakter obu grup): W sumie, 25 2349 (1,1%) respondentów X . Właściwie powstrzymujemy się od przedstawiania analiz, które statystycznie porównują grupę X do grupy Y (pozostałych 2324 uczestników), ponieważ wyniki te mogą być silnie …
Wiem, że to może być trochę ryzykowne statystycznie, ale to mój problem. Mam wiele danych zakresu, to znaczy minimalną, maksymalną i wielkość próbki zmiennej. Dla niektórych z tych danych mam również średnią, ale nie wiele. Chcę porównać te zakresy ze sobą, aby obliczyć zmienność każdego zakresu, a także porównać średnie. …
Losowe lasy pracują, tworząc zestaw drzew decyzyjnych, w których każde drzewo jest tworzone przy użyciu próbki początkowej oryginalnych danych treningowych (próbka zmiennych wejściowych i obserwacji). Czy podobny proces można zastosować do regresji liniowej? Utwórz k modeli regresji liniowej za pomocą losowej próbki bootstrap dla każdej z k regresji Z jakich …
Chcę opracować model prognostyczny (Cox PH) dla śmiertelności z jakiejkolwiek przyczyny w zbiorze danych uczestników, z których (prawie) wszyscy zmarli pod koniec okresu obserwacji (np. 1 rok). Zamiast przewidywać bezwzględne ryzyko śmierci w określonym punkcie czasowym, chciałbym przewidzieć czas przeżycia (w miesiącach) dla każdej osoby. Czy możliwe jest uzyskanie takich …
Dzisiaj zapytano mnie, czy wartość p wynosząca 0,05 (dokładnie) jest uważana za znaczącą (biorąc pod uwagę alfa = 5%), czy nie. Nie znałem odpowiedzi i Google podniosło obie odpowiedzi: (a) wynik jest znaczący, jeśli p jest mniejsze niż 5% i (b) jeśli p jest mniejsze niż 5% lub równe 5%. …
Próbuję zrozumieć wynik, który widzę na poniższym wykresie. Zwykle używam Excela i otrzymuję linię regresji liniowej, ale w poniższym przypadku używam R i otrzymuję regresję wielomianową z poleceniem: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() Więc moje pytania sprowadzają się do tego: Co to jest szary obszar (strzałka nr 1) wokół …
Chciałbym oszacować korelację między: Zmienna porządkowa: badani proszeni są o ocenę swoich preferencji dla 6 rodzajów owoców w skali 1-5 (od bardzo obrzydliwych do bardzo smacznych) Średnio badani używają tylko 3 punktów skali. Ciągła zmienna: ci sami badani proszeni są o szybką identyfikację tych owoców, co daje średnią dokładność dla …
Wersja skrócona: szukam pakietu R, który może budować drzewa decyzyjne, podczas gdy każdy liść w drzewie decyzyjnym jest pełnym modelem regresji liniowej. AFAIK, biblioteka rparttworzy drzewa decyzyjne, w których zmienna zależna jest stała w każdym liściu. Czy istnieje inna biblioteka (lub rpartustawienie, którego nie znam), która może budować takie drzewa? …
Wydaje się dość powszechne opisywanie wartości alfa Cronbacha w następujący sposób: α ≥ 0,9 Znakomity 0,7 ≤ α <0,9 Dobra 0,6 ≤ α <0,7 Dopuszczalne 0,5 ≤ α <0,6 Zły α <0,5 Niedopuszczalne Skąd pochodzą te wartości? Nie mogę znaleźć oryginalnego artykułu badawczego opisującego je. Edycja: Jestem w 90% pewien, …
Dostałem dane do analizy w celu zbadania wpływu leczenia na poziomy żelaza w czterech różnych punktach czasowych (przed leczeniem, dzień zakończenia leczenia, 4 tygodnie po leczeniu i 2-4 miesiące po leczeniu). Nie ma grupy kontrolnej. Chcą sprawdzić, czy występuje znaczny wzrost poziomu żelaza w każdym z 3 punktów czasowych po …
W artykule znalazłem wzór na standardowe odchylenie wielkości próbyNNN σ=R¯¯¯¯2.534σ=R¯2.534\sigma=\frac{\overline{R}}{2.534} gdzie to średni zakres podpróbek (rozmiar ) z próbki głównej. Jak obliczana jest liczba ? To jest poprawny numer? 62,534R¯¯¯¯R¯\overline{R}6662.5342.5342.534
Dane, które chcemy wykorzystać jako zmienną zależną, wyglądają tak (są to dane zliczające). Obawiamy się, że skoro ma ona składową cykliczną i strukturę trendu, regresja okazuje się w jakiś sposób stronnicza. W razie potrzeby zastosujemy ujemną regresję dwumianową. Dane to zrównoważony panel, jeden manekin na osobę (stany). Pokazany obraz pokazuje …
Wiem, że k-średnie jest zwykle optymalizowane przy użyciu Maksymalizacji oczekiwań . Jednak moglibyśmy zoptymalizować jego funkcję utraty w ten sam sposób, w jaki zoptymalizowaliśmy każdy inny! Znalazłem kilka artykułów, które faktycznie używają stochastycznego spadku gradientu dla dużych k-średnich, ale nie mogłem uzyskać odpowiedzi na moje pytanie. Czy ktoś wie, dlaczego …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.