Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Czy istnieje ogólna definicja wielkości efektu?
effect-sizeTag ma wiki. Strona wikipedii o wielkości efektu nie zawiera dokładnej ogólnej definicji. I nigdy nie widziałem ogólnej definicji wielkości efektu . Jednak podczas czytania niektórych dyskusji, takich jak ta, mam wrażenie, że ludzie mają na myśli ogólne pojęcie wielkości efektu w kontekście testów statystycznych . Widziałem już, że znormalizowana …


3
Zależność liniowa między zmiennymi objaśniającymi w regresji wielokrotnej
Czytałem rozdział dotyczący regresji wielokrotnej analizy danych i grafiki przy użyciu R: podejście oparte na przykładach i byłem nieco zdezorientowany, gdy dowiedziałem się, że zaleca sprawdzanie liniowych zależności między zmiennymi objaśniającymi (za pomocą wykresu rozrzutu), a jeśli nie ma t dowolny, przekształcając je tak, oni mają stać się bardziej liniowo …

1
Regresja liniowa ze zmienną zależną, która jest stosunkiem
Wykonuję regresje liniowe, w których zmienną zależną jest stosunek, który może wynosić od 0,01 do 100. Czy można logować zmienną zależną i regresję? Dopasowuję wyniki badania i tak właśnie zrobili. Jaka jest różnica między przyjmowaniem logu a stosowaniem takiego stanu, w jakim jest?
10 regression 

3
Naprawiono vs efekty losowe
Niedawno zacząłem uczyć się o uogólnionych liniowych modelach mieszanych i używałem R do zbadania, jaką to różnicę traktuje członkostwo w grupie jako efekt stały lub losowy. W szczególności patrzę na omawiany tutaj przykładowy zestaw danych: http://www.ats.ucla.edu/stat/mult_pkg/glmm.htm http://www.ats.ucla.edu/stat/r/dae/melogit.htm Jak nakreślono w tym samouczku, efekt Doctor ID jest zauważalny i spodziewałem się, …

1
Aksjomat wyboru Luce, pytanie o prawdopodobieństwo warunkowe [zamknięte]
Zamknięte . To pytanie wymaga szczegółów lub jasności . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Dodaj szczegóły i wyjaśnij problem, edytując ten post . Zamknięte 2 lata temu . Czytam Luce (1959) . Potem znalazłem to oświadczenie: Kiedy dana osoba wybiera między alternatywami, bardzo często jej reakcje wydają …

1
Który jest bardziej dokładny glm lub glmnet?
R glm i glmnet używają różnych algorytmów. Kiedy używam obu, zauważam nietrywialne różnice między oszacowanymi współczynnikami. Interesuje mnie, kiedy jedna jest bardziej dokładna od drugiej, i czas na rozwiązanie / kompromis. W szczególności mam na myśli przypadek, w którym ustawia się lambda = 0 w glmnet st, szacuje się to …

2
Jaki jest związek między wnioskowaniem przyczynowym a prognozowaniem?
Jakie są zależności i różnice między wnioskowaniem przyczynowym a prognozowaniem (zarówno klasyfikacja, jak i regresja)? W kontekście prognoz mamy zmienne predykcyjne / wejściowe i zmienne odpowiedzi / wyjściowe. Czy to oznacza, że ​​istnieje związek przyczynowy między zmiennymi wejściowymi i wyjściowymi? Czy zatem przewidywanie należy do wnioskowania przyczynowego? Jeśli dobrze rozumiem, …


1
Modele dyskretnych zagrożeń czasowych (cloglog) w R
Wydaje się, że survivalpakiet Rkoncentruje się na modelach ciągłego przetrwania w czasie. Jestem zainteresowany oszacowaniem dyskretnej wersji proporcjonalnego modelu hazardu w czasie, komplementarnego modelu log-log. Mam dość prosty model przetrwania z prostą cenzurą. Wiem, że jednym ze sposobów oszacowania tego modelu jest utworzenie zestawu danych, który ma osobny wiersz dla …
10 r  survival 


2
Znalezienie znanej liczby środków okręgu, które maksymalizują liczbę punktów w ustalonej odległości
Mam zestaw danych 2D, w których chcę znaleźć środki o określonej liczbie środków kół ( ), które maksymalizują całkowitą liczbę punktów w określonej odległości ( ).RN.NNRRR np. mam 10 000 punktów danych ( Xja, Yja)(Xi,Yi)(X_i, Y_i) i chcę znaleźć środki N.= 5N=5N=5 okręgów, które przechwytują jak najwięcej punktów w promieniu …
10 r  clustering  distance 

1
Histogram z pojemnikami jednolitymi vs niejednorodnymi
To pytanie opisuje podstawową różnicę między histogramem jednolitym i niejednorodnym. I to pytanie omawia ogólną zasadę wybierania liczby pojemników jednolitego histogramu, który optymalizuje (w pewnym sensie) stopień, w jakim histogram reprezentuje rozkład, z którego zostały pobrane próbki danych. Nie mogę znaleźć takiego samego rodzaju „optymalności” dyskusji na temat histogramów jednolitych …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.