Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Sprawdzanie poprawności kwestionariuszy
Projektuję kwestionariusz do mojej rozprawy. Jestem w trakcie sprawdzania poprawności kwestionariusza. Zastosowałem test alfa Cronbacha do początkowej grupy próbek. Odpowiedzi na kwestionariusz są w skali Likerta; może ktoś zasugerować jakiekolwiek dalsze testy, które należy zastosować, aby pomóc przetestować jego ważność. Nie jestem ekspertem w dziedzinie statystyki, więc każda pomoc byłaby …

5
Lepsza klasyfikacja domyślna w regresji logistycznej
Pełne ujawnienie: To zadanie domowe. Zamieściłem link do zestawu danych ( http://www.bertelsen.ca/R/logistic-regression.sav ) Moim celem jest zmaksymalizowanie prognozy osób spłacających zaległości kredytowe w tym zbiorze danych. Każdy model, który do tej pory wymyśliłem, przewiduje> 90% domyślnych, ale <40% domyślnych, co daje ogólną skuteczność klasyfikacji ~ 80%. Zastanawiam się więc, czy …
12 r  logistic  spss  self-study 

2
Analiza przedmiotu dla początkującego R.
Próbuję ocenić 20-elementowy test wielokrotnego wyboru. Chcę przeprowadzić analizę przedmiotu, taką jak w tym przykładzie . Tak więc dla każdego pytania chcę wartość P i korelację z sumą oraz rozkład wybranych opcji. Nie wiem nic o różnych pakietach oprogramowania statystycznego, ale chciałbym używać R, ponieważ czuję się swobodnie w programowaniu, …

1
Aktualizacja dopasowania lasso o nowe obserwacje
Dopasowuję regresję liniową regulowaną przez L1 do bardzo dużego zestawu danych (z n >> p.) Zmienne są znane z góry, ale obserwacje pojawiają się w małych porcjach. Chciałbym utrzymać dopasowanie lasso po każdym kawałku. Mogę oczywiście dopasować cały model po obejrzeniu każdego nowego zestawu obserwacji. Byłoby to jednak dość nieefektywne, …
12 regression  lasso 

3
Adaptacyjne estymatory gęstości jądra?
Czy ktoś może poinformować o swoich doświadczeniach z adaptacyjnym estymatorem gęstości jądra? (Istnieje wiele synonimów: adaptacyjny | zmienny | zmienna szerokość, KDE | histogram | interpolator ...) Zmienne oszacowanie gęstości jądra mówi: „zmieniamy szerokość jądra w różnych regionach przestrzeni próbki. Istnieją dwie metody ...” w rzeczywistości więcej: sąsiedzi w pewnym …

2
Jak sparametryzować stosunek dwóch normalnie rozłożonych zmiennych lub odwrotność jednej?
Problem: Parametryzuję rozkłady do wykorzystania jako priorytety i dane w metaanalizie bayesowskiej. Dane są przedstawione w literaturze jako statystyki podsumowujące, prawie wyłącznie zakłada się, że są normalnie rozłożone (chociaż żadna ze zmiennych nie może być <0, niektóre są stosunkami, niektóre są masą itp.). Natknąłem się na dwa przypadki, dla których …

2
Obliczanie wielkości próbki parametrycznej i analiza nieparametryczna
Jestem ciekawy, czy ktoś ma określone odniesienie (tekst lub artykuł w czasopiśmie), aby poprzeć powszechną praktykę w literaturze medycznej wykonywania obliczeń wielkości próby przy użyciu metod parametrycznych (tj. Zakładając normalny rozkład i pewną wariancję pomiarów) kiedy analiza pierwotnego wyniku próby zostanie przeprowadzona przy użyciu metod nieparametrycznych. Przykład: głównym rezultatem jest …

4
Jak zastosować do modelu LASSO metodę Iterative Reweighted Least Squares (IRLS)?
Zaprogramowałem regresję logistyczną przy użyciu algorytmu IRLS . Chciałbym zastosować karę LASSO , aby automatycznie wybrać odpowiednie funkcje. Przy każdej iteracji rozwiązuje się następujące kwestie: (XTWX)δβ^=XT(y−p)(XTWX)δβ^=XT(y−p)\mathbf{\left(X^TWX\right) \delta\hat\beta=X^T\left(y-p\right)} Niech będzie nieujemną liczbą rzeczywistą. Nie penalizuję przechwytywania, jak sugerowano w The Elements of. Nauka statystyczna . To samo dotyczy już zerowych współczynników. …



3
Czy możesz wyjaśnić, dlaczego powiązanie statystyczne nie jest naiwnie odrzucane, gdy ?
Potrzebuję pomocy w wyjaśnianiu i cytowaniu podstawowych statystyk, tekstów lub innych odniesień, dlaczego generalnie niewłaściwe jest używanie statystyki marginesu błędu (MOE) zgłoszonej podczas głosowania w celu naiwnego zadeklarowania powiązania statystycznego. Przykład: kandydat A prowadzi kandydata B w ankiecie, procent, margines błędu dla ankietowanych wyborców.4,5 % 50039 - 3139−3139 - 314,5 …
12 polling 

3
Techniki postępowania z niekompletnymi / brakującymi danymi
Moje pytanie dotyczy technik radzenia sobie z niekompletnymi danymi podczas szkolenia / dopasowania / klasyfikacji klasyfikatora / modelu. Na przykład w zestawie danych zawierającym kilkaset wierszy, z których każdy ma powiedzmy pięć wymiarów i etykietę klasy jako ostatni element, większość punktów danych będzie wyglądać następująco: [0,74, 0,39, 0,14, 0,33, 0,34, …

5
Co krzywe ROC mówią ci, że tradycyjne wnioskowanie nie byłoby?
Kiedy miałbyś tendencję do używania krzywych ROC w niektórych innych testach w celu określenia zdolności prognostycznej niektórych pomiarów wyniku? Kiedy mamy do czynienia z dyskretnymi wynikami (żywy / martwy, obecny / nieobecny), co sprawia, że ​​krzywe ROC są mniej lub bardziej potężne niż coś w rodzaju chi-kwadrat?
12 regression  roc 

3
Dokładny test Fishera z wagami?
Czy ktoś zna odmianę dokładnego testu Fishera, który uwzględnia wagi? Na przykład wagi próbkowania . Dlatego zamiast zwykłej tabeli krzyżowej 2x2 każdy punkt danych ma wartość „masa” lub „rozmiar” ważącą punkt. Przykładowe dane: A B weight N N 1 N N 3 Y N 1 Y N 2 N Y …

2
Test statystyczny dla tabel kontyngencji nxm
Mam zestaw danych złożony z elementów z trzech grup, nazwijmy je G1, G2 i G3. Przeanalizowałem niektóre cechy tych elementów i podzieliłem je na 3 rodzaje „zachowania” T1, T2 i T3 (w tym celu wykorzystałem analizę skupień). Więc teraz mam taką tabelę zdarzeń 3 x 3 z liczbą elementów w …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.