Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Używanie LASSO w losowym lesie
Chciałbym utworzyć losowy las przy użyciu następującego procesu: Zbuduj drzewo na losowych próbkach danych i funkcji, używając przyrostu informacji do określania podziałów Zakończ węzeł liścia, jeśli przekracza on z góry określoną głębokość LUB jakiekolwiek rozszczepienie spowodowałoby, że liczba liści byłaby mniejsza niż z góry określone minimum Zamiast przypisywać etykietę klasy …


1
Prognozowanie wydajności zależy bardziej od wiedzy analityka danych niż od metody?
Natknąłem się na pogłoskę, że niektóre badania wykazały, że wydajność modeli predykcyjnych zależy bardziej od wiedzy specjalisty analityka danych w zakresie wybranej metody niż od wyboru metody. Innymi słowy, twierdzenie jest takie, że ważniejsze jest, aby analityk danych znał wybraną metodę, niż to, jak „odpowiednia” metoda wydaje się dla problemu …


1
Jak przewidzieć jeden szereg czasowy z innego szeregu czasowego, jeśli są one powiązane
Od ponad roku próbuję rozwiązać ten problem bez większych postępów. Jest to część projektu badawczego, który realizuję, ale zilustruję go przykładem, który wymyśliłem, ponieważ rzeczywista dziedzina problemu jest nieco myląca (śledzenie wzroku). Jesteś samolotem śledzącym wrogi statek, który płynie przez ocean, więc zebrałeś serię współrzędnych statku (x, y, czas). Wiesz, …

2
Przestrzenna autokorelacja a przestrzenna stacjonarność
Załóżmy, że mamy punkty w przestrzeni dwuwymiarowej i chcemy zmierzyć wpływ atrybutów na atrybut y . Typowym modelem regresji liniowej jest oczywiście y = X βXXXyyyy=Xβ+ϵy=Xβ+ϵy= X\beta + \epsilon Są tutaj dwa problemy: pierwszy to, że ϵϵ\epsilon warunki mogą być skorelowane przestrzennie (naruszając założenie niezależnych i identycznych błędów), a drugi …

2
Nieregularnie rozmieszczone szeregi czasowe w badaniach finansów / ekonomii
W badaniach ekonometrii finansowej bardzo często badane są relacje między szeregami czasowymi finansów, które przyjmują formę danych dziennych . Zmienną często będzie , biorąc na przykład różnicę logarytmiczną; ln ( P t ) - ln ( P t - 1 ) .ja( 0 )ja(0)I(0)ln( Pt) - ln( Pt - 1)ln⁡(P.t)-ln⁡(P.t-1)\ln(P_t)-\ln(P_{t-1}) …

3
Pytania dotyczące parametrycznego i nieparametrycznego bootstrapu
Czytam rozdział o częstych statystykach z książki Kevina Murphy'ego „ Machine Learning - A Probabilistic Perspective ”. Sekcja na temat bootstrap brzmi: Bootstrap to prosta technika Monte Carlo do przybliżenia rozkładu próbkowania. Jest to szczególnie przydatne w przypadkach, gdy estymator jest złożoną funkcją prawdziwych parametrów. Pomysł jest prosty. Gdybyśmy znali …

3
Jak byś zrobił ANOVA Bayesa i regresję w R? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Mam dość prosty zestaw danych składający się z jednej zmiennej niezależnej, jednej zmiennej zależnej i zmiennej kategorialnej. Mam duże doświadczenie w …

3
Jaka jest funkcja kosztu w cv.glm w pakiecie rozruchowym R.
Przeprowadzam weryfikację krzyżową przy użyciu metody „zostaw-jeden-out”. Mam odpowiedź binarną i używam pakietu rozruchowego dla R oraz funkcji cv.glm . Mój problem polega na tym, że nie do końca rozumiem część „kosztu” w tej funkcji. Z tego, co rozumiem, jest to funkcja, która decyduje, czy wartość szacunkową należy zaklasyfikować jako …

2
Instrukcje: przewidywanie interwałów regresji liniowej za pomocą ładowania początkowego
Mam problem ze zrozumieniem, jak używać ładowania początkowego do obliczania przedziałów predykcji dla modelu regresji liniowej. Czy ktoś może nakreślić procedurę krok po kroku? Szukałem przez Google, ale nic tak naprawdę nie ma dla mnie sensu. Rozumiem, jak używać ładowania początkowego do obliczania przedziałów ufności dla parametrów modelu.



2
Błąd LME () - osiągnięty limit iteracji
Podając model skrzyżowanych efektów mieszanych, próbuję uwzględnić interakcje. Jednak pojawia się następujący komunikat o błędzie: Error in lme.formula(rate ~ nozzle, random = ~nozzle | operator, data = Flow) : nlminb problem, convergence error code = 1 message = iteration limit reached without convergence (10) Model ma następujące cechy: 1. 3 …

1
RandomForest - interpretacja fabuły MDS
Użyłem randomForest, aby sklasyfikować 6 zachowań zwierząt (np. Stanie, chodzenie, pływanie itp.) W oparciu o 8 zmiennych (różne postawy ciała i ruch). MDSplot w pakiecie randomForest daje mi to wyjście i mam problemy z interpretacją wyniku. Zrobiłem PCA na tych samych danych i uzyskałem już dobrą separację między wszystkimi klasami …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.