Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
LARS vs zejście współrzędnych dla lasso
Jakie są zalety i wady korzystania z LARS [1] w porównaniu ze stosowaniem opadania współrzędnych w celu dopasowania regresji liniowej regulowanej przez L1? Interesują mnie głównie aspekty wydajności (moje problemy występują zwykle Nw setkach tysięcy i p<20). Jednak wszelkie inne spostrzeżenia byłyby również mile widziane. edytuj: Od kiedy opublikowałem pytanie, …


2
Zasoby online do nauki statystyk, ćwiczeń (z rozwiązaniami)?
Obecnie pracuję jako asystent nauczyciela na moim uniwersytecie na kursie statystyki wprowadzającej (dla studentów medycyny). W trybie offline dostępnych jest wiele książek z informacjami, które mogą pomóc nauczycielowi. Jednak chciałbym wiedzieć, czy możesz skierować mnie do jakichkolwiek (dobrych) zasobów, które zapewniają ćwiczenia (z rozwiązaniami) w statystykach, które są dostępne online? …

1
Obliczenie Mediany Median
Robię wiele raportów na temat nieruchomości, a mediana ceny jest często zgłaszana, szczególnie przez NAR (National Association of Realtors). Jak mogę najlepiej powiedzieć, uzyskują one jedynie mediany cen nieruchomości z każdego obszaru. Moje pytanie brzmi: w jaki sposób należy obliczać medianę krajową, biorąc pod uwagę ograniczenia danych? Jako mediana median, …
13 median 


1
Czy mogę częściowo zautomatyzować diagnostykę konwergencji MCMC, aby ustawić długość wygrzewania?
Chciałbym zautomatyzować wybór wypalania dla łańcucha MCMC, np. Usuwając pierwsze n wierszy na podstawie diagnostyki zbieżności. W jakim stopniu można bezpiecznie zautomatyzować ten krok? Nawet jeśli nadal dokładnie sprawdzę autokorelację, ślad MCcm i pliki PDF, byłoby miło mieć automatyczny wybór długości wypalenia. Moje pytanie jest ogólne, ale byłoby wspaniale, gdybyś …
13 r  bayesian  mcmc 

1
Interpretacja / wykorzystanie gęstości jądra
To może być naiwne pytanie, ale proszę bardzo. Jeśli mam zestaw danych empirycznych i dopasuję do niego gęstość jądra, a następnie uzyskam nową pojedynczą wartość, która prawdopodobnie pochodzi z tego samego procesu, który wygenerował oryginalny zestaw danych, czy mogę przypisać prawdopodobieństwo, że ta nowa wartość należy do zestawu / proces …
13 kde 

2
Zrozumienie AIC i kryterium Schwarz
Korzystam z modelu logistycznego. Rzeczywisty zestaw danych modelu zawiera ponad 100 zmiennych, ale wybieram zestaw danych testowych, w którym jest około 25 zmiennych. Wcześniej stworzyłem również zestaw danych, który zawierał 8–9 zmiennych. Powiedziano mi, że do porównania modelu można użyć wartości AIC i SC. Zauważyłem, że model ma wyższe wartości …

3
Dodawanie współczynników w celu uzyskania efektów interakcji - co zrobić z SE?
Mam regresję wielowymiarową, która obejmuje interakcje. Na przykład, aby uzyskać oszacowanie efektu leczenia dla najbiedniejszego kwintylu, muszę dodać współczynniki z regresora leczenia do współczynnika ze zmiennej interakcji (która oddziałuje na leczenie i kwintyl 1). Jak dodając dwa współczynniki z regresji, jak uzyskać standardowe błędy? Czy można dodać standardowe błędy na …


4
Testy post hoc w ANCOVA
Pytanie: Jaka jest dobra metoda przeprowadzania testów post hoc różnic między średnimi grupowymi po skorygowaniu o efekt zmiennej towarzyszącej? Przykład prototypowy: Cztery grupy, 30 uczestników na grupę (np. Cztery różne populacje psychologii klinicznej) Zmienna zależna jest liczbą (np. Wyniki wywiadu) Współzmienna jest liczbą (np. Wskaźnik statusu społeczno-ekonomicznego) Pytania badawcze dotyczą …

3
Łatwe wyjaśnienie wykresu współrzędnych równoległych
Przeczytałem i widziałem wiele wykresów współrzędnych równoległych. Czy ktoś może odpowiedzieć na następujący zestaw pytań: Czym są wykresy współrzędnych równoległych (PCP) w prostych słowach, aby laik mógł to zrozumieć? Matematyczne wyjaśnienie z pewną intuicją, jeśli to możliwe Kiedy PCP jest przydatne i kiedy go używać? Kiedy PCP nie są przydatne …

9
Zwiększone drzewa decyzyjne w pythonie? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 6 miesięcy temu . Czy istnieje dobra biblioteka python do drzewek decyzyjnych przyspieszonych przez trening?
13 python  cart  boosting 

3
Oszacuj wielkość populacji, z której pobierana jest próbka, na podstawie liczby powtórzeń obserwacji
Powiedzmy, że mam populację 50 milionów unikalnych rzeczy i pobieram 10 milionów próbek (z wymianą) ... Pierwszy wykres, do którego załączyłem pokazuje, ile razy próbkuję tę samą „rzecz”, co jest stosunkowo rzadkie populacja jest większa niż moja próba. Jeśli jednak moja populacja liczy tylko 10 milionów rzeczy, a ja pobieram …

1
Jak skutecznie modelować sieć neuronową?
Jaki powinien być stosunek liczby obserwacji do liczby zmiennych? Jak wykryć nadmierne dopasowanie w modelu sieci neuronowej i jakie są sposoby uniknięcia nadmiernego dopasowania? Jeśli chcę przeprowadzić klasyfikację za pomocą sieci neuronowej, czy klasy powinny mieć równą częstotliwość? Proszę pomóż mi.

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.