Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Co oznacza wynik Akaike Information Criterion (AIC) modelu?
Widziałem tu kilka pytań na temat tego, co to znaczy dla laików, ale są one dla mnie zbyt laikalne. Próbuję matematycznie zrozumieć, co oznacza wynik AIC. Ale jednocześnie nie chcę rygorystycznego dowodu, który sprawiłby, że nie widziałbym ważniejszych punktów. Na przykład, jeśli byłby to rachunek różniczkowy, byłbym szczęśliwy z nieskończenie …

2
Interpretacja wykresu reszt i dopasowanych wartości w celu weryfikacji założeń modelu liniowego
Rozważ następującą liczbę z modeli liniowych Faraway z R (2005, s. 59). Pierwszy wykres wydaje się wskazywać, że reszty i dopasowane wartości są nieskorelowane, ponieważ powinny być w homoscedastycznym modelu liniowym z błędami o rozkładzie normalnym. Dlatego drugi i trzeci wykres, które wydają się wskazywać na zależność między wartościami resztkowymi …


5
Propagacja wsteczna a algorytm genetyczny dla szkolenia w sieci neuronowej
Przeczytałem kilka artykułów omawiających zalety i wady każdej metody, niektórzy twierdzą, że GA nie daje żadnej poprawy w znalezieniu optymalnego rozwiązania, podczas gdy inni pokazują, że jest on bardziej skuteczny. Wydaje się, że GA jest ogólnie preferowane w literaturze (chociaż większość ludzi modyfikuje ją w jakiś sposób, aby osiągnąć pożądane …

3
Dlaczego macierz korelacji musi być dodatnia półokreślona i co to znaczy być dodatnim półokreślonym?
Badałem znaczenie dodatnich półokreślonych właściwości macierzy korelacji lub kowariancji. Szukam jakichkolwiek informacji na temat Definicja dodatniej półokreśloności; Jego ważne właściwości, praktyczne implikacje; Konsekwencja negatywnego wyznacznika, wpływ na analizę wielowymiarową lub wyniki symulacji itp.

2
Jakie są praktyczne różnice między procedurami fałszywego wykrywania Benjamini i Hochberg (1995) a Benjamini i Yekutieli (2001)?
Mój program statystyczny wdraża zarówno procedury fałszywego wykrywania Benjamini i Hochberg (1995), jak i Benjamini i Yekutieli (2001). Zrobiłem co w mojej mocy, aby przeczytać późniejszy artykuł, ale jest on dość matematycznie gęsty i nie jestem pewien, czy rozumiem różnicę między procedurami. Widzę z podstawowego kodu w moim programie statystycznym, …


2
Wybór modelu i walidacja krzyżowa: właściwa droga
W CrossValidated znajduje się wiele wątków na temat wyboru modelu i weryfikacji krzyżowej. Tu jest kilka: Walidacja wewnętrzna i zewnętrzna oraz wybór modelu @ DikranMarsupial w górę odpowiedzi do wyboru funkcji i walidacji krzyżowej Jednak odpowiedzi na te wątki są dość ogólne i głównie podkreślają problemy ze szczególnym podejściem do …


3
Dopasowywanie wyniku skłonności po wielokrotnym przypisaniu
Odnoszę się do tego artykułu: Hayes JR, Groner JI. „Korzystanie z wielu ocen imputacji i skłonności do testowania wpływu używania fotelików samochodowych i pasów bezpieczeństwa na stopień obrażeń na podstawie danych rejestru urazów”. J Pediatr Surg. 2008 maja; 43 (5): 924–7. W tym badaniu przeprowadzono wielokrotną imputację w celu uzyskania …


5
Czy potrafisz się dopasować, trenując algorytmy uczenia maszynowego za pomocą CV / Bootstrap?
To pytanie może być zbyt otwarte, aby uzyskać ostateczną odpowiedź, ale mam nadzieję, że nie. Algorytmy uczenia maszynowego, takie jak SVM, GBM, Random Forest itp., Generalnie mają pewne wolne parametry, które poza pewną wskazówką praktyczną, muszą być dostosowane do każdego zestawu danych. Zazwyczaj odbywa się to za pomocą pewnego rodzaju …

4
Dane mają dwa trendy; jak wydobywać niezależne linie trendów?
Mam zestaw danych, które nie są uporządkowane w żaden szczególny sposób, ale kiedy są wyraźnie przedstawione, mają dwa wyraźne trendy. Prosta regresja liniowa nie byłaby w tym przypadku wystarczająca ze względu na wyraźne rozróżnienie między dwiema seriami. Czy istnieje prosty sposób na uzyskanie dwóch niezależnych liniowych linii trendu? Dla przypomnienia …


3
Różnica między uogólnionymi modelami liniowymi a uogólnionymi liniowymi modelami mieszanymi
Zastanawiam się, jakie są różnice między mieszanymi i niezmieszanymi GLM. Na przykład w SPSS menu rozwijane umożliwia użytkownikom dopasowanie: analyze-> generalized linear models-> generalized linear models I analyze-> mixed models-> generalized linear Czy inaczej radzą sobie z brakującymi wartościami? Moja zmienna zależna jest binarna i mam kilka kategorycznych i ciągłych …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.