Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Próbujesz obliczyć indeks Gini w dystrybucji reputacji StackOverflow?
Próbuję obliczyć indeks Gini dla dystrybucji reputacji SO za pomocą SO Data Explorer. Równanie, które próbuję zaimplementować, jest następujące: Gdzie:n= liczba użytkowników w witrynie; i= identyfikator seryjny użytkownika (1 - 1 225 000); yi= reputacja użytkownikai.sol(S) =1n - 1( n + 1 - 2 ( ∑ni = 1( n + …
11 gini 

1
Resztki Schoenfelda
Czy w modelu proporcjonalnego hazardu Coxa z wieloma zmiennymi, jeśli reszty Schoenfelda nie są płaskie dla jednej ze zmiennych, czy to unieważnia cały model, czy można po prostu zignorować zmienną o niskiej wydajności? Oznacza to, że interpretuj współczynniki dla innych zmiennych, ale nie interpretuj wynikowych współczynników dla zmiennej o niskiej …

3
Badanie symulacyjne: jak wybrać liczbę iteracji?
Chciałbym wygenerować dane za pomocą „Modelu 1” i dopasować je do „Modelu 2”. Podstawową ideą jest zbadanie właściwości odporności „Modelu 2”. Szczególnie interesuje mnie wskaźnik pokrycia 95% przedziału ufności (w oparciu o normalne przybliżenie). Jak ustawić liczbę uruchomień iteracji? Czy to prawda, że ​​większe niż konieczne replikacje mogą powodować fałszywe …

2
Parametr dyspersji na wyjściu GLM
Uruchomiłem glm w R, i summary()mówi, że w pobliżu dolnej części wyjścia (Dispersion parameter for gaussian family taken to be 28.35031) Zrobiłem trochę szperania w Google i dowiedziałem się, że parametr dyspersji służy do dopasowania do standardowych błędów. Mam nadzieję, że ktoś mógłby podać więcej szczegółów na temat parametru dyspersji …

1
Ridge i LASSO otrzymali strukturę kowariancji?
Po przeczytaniu rozdziału 3 w elementach statystycznego uczenia się (Hastie, Tibshrani i Friedman) zastanawiałem się, czy możliwe jest wdrożenie słynnych metod skurczu cytowanych w tytule tego pytania ze względu na strukturę kowariancji, tj. Zminimalizowanie (być może bardziej ogólnego ) ilość ( y⃗ - Xβ⃗ )T.V.- 1( y⃗ - Xβ⃗ ) …

2
Wprowadzenie do prawdopodobieństwa stosowanego dla czystych matematyków?
Mam wykształcenie wyższe z zakresu czystej matematyki (teoria miary, analiza funkcjonalna, algebra operatora itp.). Mam również pracę, która wymaga pewnej wiedzy na temat teorii prawdopodobieństwa (od podstawowych zasad po techniki uczenia maszynowego). Moje pytanie: czy ktoś może dostarczyć kanoniczne materiały do ​​czytania i materiały referencyjne, które: Samodzielne wprowadzenie do teorii …

3
Jak uzasadnione jest wybranie w modelu LASSO, aby uzyskać liczbę niezerowych predyktorów, jakich pragnie?
Kiedy określam swoją lambda poprzez walidację krzyżową, wszystkie współczynniki stają się zerowe. Mam jednak pewne wskazówki z literatury, że niektóre z predyktorów powinny zdecydowanie wpłynąć na wynik. Czy śmieci to arbitralne wybranie lambda, aby było tak wiele rzadkości, jak się chce? Chcę wybrać 10 najlepszych predyktorów spośród 135 dla modelu …
11 lasso 


2
Jak przekonwertować znormalizowane współczynniki na niestandardowe współczynniki?
Moim celem jest wykorzystanie współczynników uzyskanych w poprzednich badaniach na ten temat, aby przewidzieć rzeczywiste wyniki na podstawie zestawu niezależnych zmiennych. Jednak w pracy naukowej wymieniono tylko współczynniki Beta i wartość t. Chciałbym wiedzieć, czy można przekonwertować znormalizowane współczynniki na niestandardowe. Czy użyteczne byłoby przekonwertowanie moich niestandardowych zmiennych niezależnych na …

4
Czy w OLS jest test na pomijane zmienne odchylenie?
Jestem świadomy testu Ramseya Reset, który może wykryć zależności nieliniowe. Jeśli jednak wyrzucisz jeden ze współczynników regresji (tylko zależności liniowe), możesz uzyskać błąd, w zależności od korelacji. Nie jest to oczywiście wykrywane przez test Reset. Nie znalazłem testu dla tego przypadku, ale stwierdzenie: „Nie możesz przetestować OVB, chyba że podasz …

2
Dlaczego nie przeprowadzić metaanalizy danych częściowo symulowanych?
Tło: Typowa metaanaliza w psychologii może próbować modelować korelację między dwiema zmiennymi X i Y. Analiza zazwyczaj obejmuje uzyskanie zestawu odpowiednich korelacji z literatury wraz z wielkością próby. Następnie można zastosować formuły do ​​obliczenia średniej ważonej korelacji. Następnie można przeprowadzić analizy, aby sprawdzić, czy korelacje różnią się w poszczególnych badaniach …

3
Kurs projektowania eksperymentalnego dla górników danych
Jestem informatykiem zajmującym się eksploracją danych. Nie jest tajemnicą stwierdzenie, że informatycy są dość słabi w systematycznym projektowaniu i ocenie eksperymentalnej - stosowanie wartości p i szacunków ufności uważa się za zaawansowane :). Co chciałbym wiedzieć, czy istnieją dobre kursy / materiały do ​​nauczania informatyków o dobrym projekcie eksperymentalnym. Aby …

2
Odniesienie dla
W swojej odpowiedzi na moje poprzednie pytanie @Erik P. podaje wyrażenie gdzie κ jest nadmiarem kurtozy rozkładu. Podanoodniesienie do wpisu w Wikipedii na tematrozkładu wariancji próbki, ale strona wikipedia mówi „potrzebne cytowanie”.V a r [ s2)] = σ4( 2n - 1+ κn),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa Moje podstawowe …


3
Czyli SD czy Mediana MAD, aby podsumować mocno wypaczoną zmienną?
Pracuję na mocno wypaczonych danych, więc używam mediany zamiast środka do podsumowania głównej tendencji. Chciałbym mieć miary dyspersji Choć często widzę ludzi raportowania średnią odchylenie standardowe±±\pm lub mediany kwartyle±±\pm podsumowanie tendencji centralnej, to jest ok zgłosić mediana medianę bezwzględnego dyspersji (MAD)±±\pm ? Czy istnieją potencjalne problemy z tym podejściem? Uważam …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.