Próbuję obliczyć indeks Gini dla dystrybucji reputacji SO za pomocą SO Data Explorer. Równanie, które próbuję zaimplementować, jest następujące: Gdzie:n= liczba użytkowników w witrynie; i= identyfikator seryjny użytkownika (1 - 1 225 000); yi= reputacja użytkownikai.sol(S) =1n - 1( n + 1 - 2 ( ∑ni = 1( n + …
Czy w modelu proporcjonalnego hazardu Coxa z wieloma zmiennymi, jeśli reszty Schoenfelda nie są płaskie dla jednej ze zmiennych, czy to unieważnia cały model, czy można po prostu zignorować zmienną o niskiej wydajności? Oznacza to, że interpretuj współczynniki dla innych zmiennych, ale nie interpretuj wynikowych współczynników dla zmiennej o niskiej …
Chciałbym wygenerować dane za pomocą „Modelu 1” i dopasować je do „Modelu 2”. Podstawową ideą jest zbadanie właściwości odporności „Modelu 2”. Szczególnie interesuje mnie wskaźnik pokrycia 95% przedziału ufności (w oparciu o normalne przybliżenie). Jak ustawić liczbę uruchomień iteracji? Czy to prawda, że większe niż konieczne replikacje mogą powodować fałszywe …
Uruchomiłem glm w R, i summary()mówi, że w pobliżu dolnej części wyjścia (Dispersion parameter for gaussian family taken to be 28.35031) Zrobiłem trochę szperania w Google i dowiedziałem się, że parametr dyspersji służy do dopasowania do standardowych błędów. Mam nadzieję, że ktoś mógłby podać więcej szczegółów na temat parametru dyspersji …
Po przeczytaniu rozdziału 3 w elementach statystycznego uczenia się (Hastie, Tibshrani i Friedman) zastanawiałem się, czy możliwe jest wdrożenie słynnych metod skurczu cytowanych w tytule tego pytania ze względu na strukturę kowariancji, tj. Zminimalizowanie (być może bardziej ogólnego ) ilość ( y⃗ - Xβ⃗ )T.V.- 1( y⃗ - Xβ⃗ ) …
Mam wykształcenie wyższe z zakresu czystej matematyki (teoria miary, analiza funkcjonalna, algebra operatora itp.). Mam również pracę, która wymaga pewnej wiedzy na temat teorii prawdopodobieństwa (od podstawowych zasad po techniki uczenia maszynowego). Moje pytanie: czy ktoś może dostarczyć kanoniczne materiały do czytania i materiały referencyjne, które: Samodzielne wprowadzenie do teorii …
Kiedy określam swoją lambda poprzez walidację krzyżową, wszystkie współczynniki stają się zerowe. Mam jednak pewne wskazówki z literatury, że niektóre z predyktorów powinny zdecydowanie wpłynąć na wynik. Czy śmieci to arbitralne wybranie lambda, aby było tak wiele rzadkości, jak się chce? Chcę wybrać 10 najlepszych predyktorów spośród 135 dla modelu …
Czy jest jakaś znana interpretacja krzyżowa walidacji według Bayesa, ML lub MDL? Czy mogę zinterpretować weryfikację krzyżową jako wykonanie właściwej aktualizacji na specjalnie spreparowanym wcześniej?
Moim celem jest wykorzystanie współczynników uzyskanych w poprzednich badaniach na ten temat, aby przewidzieć rzeczywiste wyniki na podstawie zestawu niezależnych zmiennych. Jednak w pracy naukowej wymieniono tylko współczynniki Beta i wartość t. Chciałbym wiedzieć, czy można przekonwertować znormalizowane współczynniki na niestandardowe. Czy użyteczne byłoby przekonwertowanie moich niestandardowych zmiennych niezależnych na …
Jestem świadomy testu Ramseya Reset, który może wykryć zależności nieliniowe. Jeśli jednak wyrzucisz jeden ze współczynników regresji (tylko zależności liniowe), możesz uzyskać błąd, w zależności od korelacji. Nie jest to oczywiście wykrywane przez test Reset. Nie znalazłem testu dla tego przypadku, ale stwierdzenie: „Nie możesz przetestować OVB, chyba że podasz …
Tło: Typowa metaanaliza w psychologii może próbować modelować korelację między dwiema zmiennymi X i Y. Analiza zazwyczaj obejmuje uzyskanie zestawu odpowiednich korelacji z literatury wraz z wielkością próby. Następnie można zastosować formuły do obliczenia średniej ważonej korelacji. Następnie można przeprowadzić analizy, aby sprawdzić, czy korelacje różnią się w poszczególnych badaniach …
Jestem informatykiem zajmującym się eksploracją danych. Nie jest tajemnicą stwierdzenie, że informatycy są dość słabi w systematycznym projektowaniu i ocenie eksperymentalnej - stosowanie wartości p i szacunków ufności uważa się za zaawansowane :). Co chciałbym wiedzieć, czy istnieją dobre kursy / materiały do nauczania informatyków o dobrym projekcie eksperymentalnym. Aby …
W swojej odpowiedzi na moje poprzednie pytanie @Erik P. podaje wyrażenie gdzie κ jest nadmiarem kurtozy rozkładu. Podanoodniesienie do wpisu w Wikipedii na tematrozkładu wariancji próbki, ale strona wikipedia mówi „potrzebne cytowanie”.V a r [ s2)] = σ4( 2n - 1+ κn),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa Moje podstawowe …
Jak interpretować i generować wykresy wykresów fasoli. Oto jeden przykład wzięty z Walkesa i in. 2010 r . Jakiego rodzaju dane są najbardziej przydatne? (źródło: biomedcentral.com )
Pracuję na mocno wypaczonych danych, więc używam mediany zamiast środka do podsumowania głównej tendencji. Chciałbym mieć miary dyspersji Choć często widzę ludzi raportowania średnią odchylenie standardowe±±\pm lub mediany kwartyle±±\pm podsumowanie tendencji centralnej, to jest ok zgłosić mediana medianę bezwzględnego dyspersji (MAD)±±\pm ? Czy istnieją potencjalne problemy z tym podejściem? Uważam …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.