Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Radzenie sobie z regresją niezwykle ograniczonej zmiennej odpowiedzi
Próbuję modelować zmienną odpowiedzi, która teoretycznie jest ograniczona między -225 a +225. Zmienna to łączny wynik uzyskany przez badanych podczas gry. Chociaż teoretycznie możliwe jest zdobycie przez uczestników +225 punktów. Pomimo tego, ponieważ wynik zależał nie tylko od działań podmiotów, ale także działań innych działań, maksymalna liczba zdobytych punktów wyniosła …

2
Ważenie wyniku skłonności w analizie PH Coxa i selekcji współzmiennej
W odniesieniu do ważenia wyniku skłonności (IPTW) podczas modelowania proporcjonalnego hazardu Coxa danych dotyczących przeżycia czasu do zdarzenia: Mam potencjalne dane rejestru, w których jesteśmy zainteresowani spojrzeniem na efekt leczenia lekiem, który w większości przypadków pacjenci przyjmowali już na początku. Dlatego nie jestem pewien, jak najlepiej analizować dane. Potencjalnie pewne …

1
Ocena klasyfikatorów: krzywe uczenia się vs krzywe ROC
Chciałbym porównać 2 różne klasyfikatory dla problemu klasyfikacji tekstów wieloklasowych, które wykorzystują duże zestawy danych szkoleniowych. Wątpię, czy powinienem użyć krzywych ROC, czy krzywych uczenia się, aby porównać 2 klasyfikatory. Z jednej strony krzywe uczenia się są przydatne do decydowania o wielkości zbioru danych szkoleniowych, ponieważ można znaleźć rozmiar zbioru …

3
Zmierz jednorodność rozkładu punktów w kwadracie 2D
Mam kwadrat 2D i mam w nim zestaw punktów, powiedzmy 1000 punktów. Potrzebuję sposobu, aby sprawdzić, czy rozkład punktów wewnątrz kwadratu jest rozłożony (lub bardziej lub mniej równomiernie rozmieszczony), czy też mają tendencję do gromadzenia się w jakimś miejscu wewnątrz kwadratu. Potrzebuję matematycznego / statystycznego (nie programistycznego) sposobu, aby to …

2
Przekształć zmienne ciągłe dla regresji logistycznej
Mam duże dane ankietowe, binarną zmienną wyniku i wiele zmiennych objaśniających, w tym binarną i ciągłą. Buduję zestawy modeli (eksperymentuję zarówno z GLM, jak i mieszanym GLM) i wykorzystuję podejścia teoretyczne do wyboru najlepszego modelu. Dokładnie przeanalizowałem wyjaśnienia (zarówno ciągłe, jak i kategoryczne) pod kątem korelacji i używam tylko tych …


1
Log-Cauchy Generowanie liczb losowych
Muszę narysować liczby losowe z rozkładu log-cauchy'ego, który ma gęstość: Czy ktoś może mi pomóc lub wskazać mi książkę / artykuł, który mógłby mi pokazać, w jaki sposób?fa( x ; μ , σ) = 1x πσ[ 1 + ( l n ( x ) - μσ)2)].fa(x;μ,σ)=1xπσ[1+(ln(x)-μσ)2)].f(x;\mu,\sigma)=\frac{1}{x\pi\sigma\left[1+\left(\frac{ln(x)-\mu}{\sigma}\right)^2\right]}.

2
Jak „inteligentnie” skumulować zbiór posortowanych danych?
Staram się inteligentnie bin posortować kolekcję. Mam kolekcję fragmentów danych. Ale wiem, że te dane wpisuje się nierówno wielkości pojemników. Nie wiem, jak inteligentnie wybrać punkty końcowe, aby odpowiednio dopasować dane. na przykład:nnnmmm Powiedzmy, że mam w mojej kolekcji 12 produktów i wiem, że dane zmieszczą się w 3 pojemnikach: …

4
Ukośne linie proste w wartościach resztkowych względem dopasowanych wartości dla regresji wielokrotnej
W moich danych obserwuję dziwne wzorce w resztkach: [EDYCJA] Oto wykresy częściowej regresji dla dwóch zmiennych: [EDIT2] Dodano wykres PP Wygląda na to, że dystrybucja jest w porządku (patrz poniżej), ale nie mam pojęcia, skąd ta prosta może pochodzić. Jakieś pomysły? [AKTUALIZACJA 31.07] Okazuje się, że miałeś całkowitą rację, miałem …

1
Znalezienie porównywalnej grupy kontrolnej dla grupy terapeutycznej?
Mam grupę terapeutyczną o wielkości 30 (30 szkół w Kalifornii), która korzystała z dodatkowego oprogramowania matematycznego. W prostej analizie chciałbym porównać średni wzrost matematyki uczniów między naszą grupą leczoną a porównywalną grupą kontrolną. W CA jest wiele szkół, które nie korzystały z oprogramowania. Chciałbym, aby grupa kontrolna obejmowała szkoły o …



2
Jak oszacować dokładność całki?
Niezwykle częstą sytuacją w grafice komputerowej jest to, że kolor niektórych pikseli jest równy całce funkcji o wartościach rzeczywistych. Często funkcja jest zbyt skomplikowana, aby ją rozwiązać analitycznie, więc pozostaje nam przybliżenie numeryczne. Ale funkcja ta jest również często bardzo droga do obliczenia, dlatego jesteśmy bardzo ograniczeni liczbą próbek, które …


6
Identyfikacja wartości odstających dla regresji nieliniowej
Prowadzę badania w dziedzinie odpowiedzi funkcjonalnej roztoczy. Chciałbym zrobić regresję, aby oszacować parametry (szybkość ataku i czas obsługi) funkcji Rogers typu II. Mam zestaw danych z pomiarami. Jak mogę najlepiej określić wartości odstające? Do mojej regresji używam następującego skryptu w R (regresja nieliniowa): (zestaw danych to prosty 2-kolumnowy plik tekstowy …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.