Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Przewidywanie wielu celów lub klas?
Załóżmy, że buduję model predykcyjny, w którym próbuję przewidzieć wiele zdarzeń (na przykład zarówno rzut kości, jak i rzut monetą). Większość znanych mi algorytmów działa tylko z jednym celem, więc zastanawiam się, czy istnieje standardowe podejście do tego rodzaju rzeczy. Widzę dwie możliwe opcje. Być może najbardziej naiwnym podejściem byłoby …



2
Dostosowanie wartości p dla adaptacyjnej analizy sekwencyjnej (dla testu chi kwadrat)?
Chciałbym wiedzieć, która literatura statystyczna jest istotna dla następującego problemu, a może nawet pomysł, jak go rozwiązać. Wyobraź sobie następujący problem: Mamy 4 możliwe sposoby leczenia niektórych chorób. Aby sprawdzić, które leczenie jest lepsze, przeprowadzamy specjalną próbę. W rozprawie zaczynamy od braku podmiotów, a następnie, jeden po drugim, kolejnych uczestników …


1
Nazwa średniego błędu bezwzględnego analogicznego do wyniku Briera?
Wczorajsze pytanie Określ dokładność modelu, który szacuje prawdopodobieństwo zdarzenia, zainteresowało mnie do oceny prawdopodobieństwa. Wynik Briera jest średnią kwadratową miarą błędu. Czy analogiczna średnia miara błędu bezwzględnego masz też imię?1N.∑i = 1N.( p r e di c t i O Nja- r e fe r e n c eja)2)1N.∑ja=1N.(prmirejadotjaonja-rmifamirmindomija)2)\frac{1}{N}\sum\limits _{i=1}^{N}(prediction_i …



3
Przykładowe zestawy danych i analizy do modelowania wielopoziomowego
Niedawno odbyłem kurs wprowadzający na temat modelowania wielopoziomowego. Większość zestawów danych i przykładów, które wykorzystaliśmy, pochodziła z nauk społecznych. Właśnie dostałem 2-tygodniowy staż w oddziale biostatystycznym, gdzie chcą, żebym rozpoczął projekt dotyczący zróżnicowania wyników leczenia pacjentów na poziomie szpitala w przypadku stanu wyjątkowego o wysokiej śmiertelności, zarówno między szpitalami, jak …


3
Obliczanie trybu danych próbkowanych z ciągłego rozkładu
Jakie są najlepsze metody dopasowania „trybu” danych próbkowanych z ciągłego rozkładu? Ponieważ tryb jest technicznie niezdefiniowany (prawda?) Dla ciągłej dystrybucji, naprawdę pytam „jak znaleźć najczęstszą wartość”? Jeśli przyjmiesz, że rozkład rodzica jest gaussowski, możesz bin binować dane i stwierdzić, że tryb jest lokalizacją bin z największą liczbą. Jak jednak określić …

2
Jakie założenia dotyczące normalności są wymagane dla niesparowanego testu t? A kiedy się spotkają?
Jeśli chcemy przeprowadzić sparowany test t, wymagane jest (o ile dobrze rozumiem), aby średnia różnica między dopasowanymi jednostkami miary była rozkładana normalnie. W sparowanym teście t, który jest wyrażony (AFAIK) w żądaniu, aby różnica między dopasowanymi jednostkami miary była rozkładana normalnie (nawet jeśli rozkład każdej z dwóch porównywanych grup nie …

2
Co zrobić, gdy niektóre punkty czasowe mają mocno wypaczone odpowiedzi, a niektóre nie w badaniu z powtarzanymi pomiarami?
Zazwyczaj, gdy napotyka się ciągłe, ale wypaczone miary wyniku w układzie podłużnym (powiedzmy, z jednym efektem między podmiotami), powszechnym podejściem jest przekształcenie wyniku w normalność. Jeśli sytuacja jest ekstremalna, na przykład w przypadku skróconych obserwacji, można się zachwycić i zastosować model krzywej wzrostu Tobita lub coś takiego. Ale jestem zagubiony, …


2
Modyfikacja Lasso dla LARS
Próbuję zrozumieć, w jaki sposób można zmodyfikować algorytm Larsa w celu wygenerowania Lasso. Chociaż rozumiem LARS, nie jestem w stanie zobaczyć modyfikacji Lasso z pracy Tibshirani i in. W szczególności nie rozumiem, dlaczego warunek znaku w tym, że znak niezerowej współrzędnej musi zgadzać się ze znakiem bieżącej korelacji. Czy ktoś …
12 lasso 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.