Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Ważenie najnowszych danych w modelu Losowy las
Trenuję model klasyfikacyjny z Random Forest, aby rozróżnić 6 kategorii. Moje dane transakcyjne zawierają około 60 000 obserwacji i 35 zmiennych. Oto przykład, jak to w przybliżeniu wygląda. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | 2013-04-12 | 6 | PNG …


2
Nierówne rozmiary próbek: kiedy to nazwać, kończy się
Przeglądam artykuł w czasopiśmie akademickim, a autorzy napisali następujące uzasadnienie dla nieprzekazywania żadnych wnioskowania statystycznego (zidentyfikowałem charakter obu grup): W sumie, 25 2349 (1,1%) respondentów X . Właściwie powstrzymujemy się od przedstawiania analiz, które statystycznie porównują grupę X do grupy Y (pozostałych 2324 uczestników), ponieważ wyniki te mogą być silnie …

3
Czy mogę zrekonstruować rozkład normalny na podstawie wielkości próbki oraz wartości minimalnych i maksymalnych? Mogę użyć punktu środkowego do określenia średniej
Wiem, że to może być trochę ryzykowne statystycznie, ale to mój problem. Mam wiele danych zakresu, to znaczy minimalną, maksymalną i wielkość próbki zmiennej. Dla niektórych z tych danych mam również średnią, ale nie wiele. Chcę porównać te zakresy ze sobą, aby obliczyć zmienność każdego zakresu, a także porównać średnie. …

4
Czy do regresji liniowych można zastosować metodologię losowego lasu?
Losowe lasy pracują, tworząc zestaw drzew decyzyjnych, w których każde drzewo jest tworzone przy użyciu próbki początkowej oryginalnych danych treningowych (próbka zmiennych wejściowych i obserwacji). Czy podobny proces można zastosować do regresji liniowej? Utwórz k modeli regresji liniowej za pomocą losowej próbki bootstrap dla każdej z k regresji Z jakich …

3
Jak uzyskać prognozy dotyczące czasu przeżycia z modelu PH Coxa?
Chcę opracować model prognostyczny (Cox PH) dla śmiertelności z jakiejkolwiek przyczyny w zbiorze danych uczestników, z których (prawie) wszyscy zmarli pod koniec okresu obserwacji (np. 1 rok). Zamiast przewidywać bezwzględne ryzyko śmierci w określonym punkcie czasowym, chciałbym przewidzieć czas przeżycia (w miesiącach) dla każdej osoby. Czy możliwe jest uzyskanie takich …

3
Czy p = 5,0% jest znaczące?
Dzisiaj zapytano mnie, czy wartość p wynosząca 0,05 (dokładnie) jest uważana za znaczącą (biorąc pod uwagę alfa = 5%), czy nie. Nie znałem odpowiedzi i Google podniosło obie odpowiedzi: (a) wynik jest znaczący, jeśli p jest mniejsze niż 5% i (b) jeśli p jest mniejsze niż 5% lub równe 5%. …

3
Zrozumienie pasma ufności z regresji wielomianowej
Próbuję zrozumieć wynik, który widzę na poniższym wykresie. Zwykle używam Excela i otrzymuję linię regresji liniowej, ale w poniższym przypadku używam R i otrzymuję regresję wielomianową z poleceniem: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() Więc moje pytania sprowadzają się do tego: Co to jest szary obszar (strzałka nr 1) wokół …

1
Jak poprawnie ocenić korelację między zmienną porządkową a zmienną ciągłą?
Chciałbym oszacować korelację między: Zmienna porządkowa: badani proszeni są o ocenę swoich preferencji dla 6 rodzajów owoców w skali 1-5 (od bardzo obrzydliwych do bardzo smacznych) Średnio badani używają tylko 3 punktów skali. Ciągła zmienna: ci sami badani proszeni są o szybką identyfikację tych owoców, co daje średnią dokładność dla …

3
Algorytm drzewa regresji z liniowymi modelami regresji w każdym liściu
Wersja skrócona: szukam pakietu R, który może budować drzewa decyzyjne, podczas gdy każdy liść w drzewie decyzyjnym jest pełnym modelem regresji liniowej. AFAIK, biblioteka rparttworzy drzewa decyzyjne, w których zmienna zależna jest stała w każdym liściu. Czy istnieje inna biblioteka (lub rpartustawienie, którego nie znam), która może budować takie drzewa? …
14 r  regression  rpart  cart 




1
Kiedy konieczne jest uwzględnienie opóźnienia zmiennej zależnej w modelu regresji, a które to opóźnienie?
Dane, które chcemy wykorzystać jako zmienną zależną, wyglądają tak (są to dane zliczające). Obawiamy się, że skoro ma ona składową cykliczną i strukturę trendu, regresja okazuje się w jakiś sposób stronnicza. W razie potrzeby zastosujemy ujemną regresję dwumianową. Dane to zrównoważony panel, jeden manekin na osobę (stany). Pokazany obraz pokazuje …

2
Dlaczego wartość k-średnich nie jest zoptymalizowana przy użyciu opadania gradientu?
Wiem, że k-średnie jest zwykle optymalizowane przy użyciu Maksymalizacji oczekiwań . Jednak moglibyśmy zoptymalizować jego funkcję utraty w ten sam sposób, w jaki zoptymalizowaliśmy każdy inny! Znalazłem kilka artykułów, które faktycznie używają stochastycznego spadku gradientu dla dużych k-średnich, ale nie mogłem uzyskać odpowiedzi na moje pytanie. Czy ktoś wie, dlaczego …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.