Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy są lekcje statystyczne z odcinka „Kod biblijny”?
Chociaż to pytanie jest nieco subiektywne, mam nadzieję, że kwalifikuje się jako dobre pytanie subiektywne zgodnie z wytycznymi faq . Opiera się na pytaniu, które zadał mi Olle Häggström rok temu i choć mam na ten temat pewne przemyślenia, nie mam jednoznacznej odpowiedzi i byłbym wdzięczny za pomoc innych. Tło: …

3
Dlaczego konieczny jest wybór zmiennych?
Typowe procedury wyboru zmiennych oparte na danych (na przykład do przodu, do tyłu, krokowo, wszystkie podzbiory) mają tendencję do uzyskiwania modeli o niepożądanych właściwościach, w tym: Współczynniki odchylone od zera. Błędy standardowe, które są zbyt małe, a przedziały ufności, które są zbyt wąskie. Testuj statystyki i wartości p, które nie …


4
Analiza ze złożonymi danymi, coś innego?
Powiedzmy na przykład, że robisz model liniowy, ale dane są złożone.yyy y=xβ+ϵy=xβ+ϵ y = x \beta + \epsilon Mój zestaw danych jest złożony, ponieważ we wszystkich liczbach mają postać . Czy jest coś proceduralnie odmiennego podczas pracy z takimi danymi?yyy(a+bi)(a+bi)(a + bi) Pytam, bo skończysz na otrzymywaniu złożonych macierzy kowariancji …

3
Jak porównują gamma Goodmana-Kruskala i korelacje tau Kendalla lub Spearmana rho?
W mojej pracy porównujemy przewidywane rankingi z prawdziwymi rankingami dla niektórych zestawów danych. Do niedawna korzystaliśmy z Kendall-Tau sam. Grupa pracująca nad podobnym projektem zasugerowała, że zamiast tego próbujemy użyć gammy Goodmana-Kruskala i wolą ją. Zastanawiałem się, jakie były różnice między różnymi algorytmami korelacji rang. Najlepszą, jaką znalazłem, była ta …

1
Wiele porównań w modelu efektów mieszanych
Próbuję analizować niektóre dane przy użyciu modelu efektu mieszanego. Zebrane przeze mnie dane przedstawiają masę niektórych młodych zwierząt o różnym genotypie w czasie. Korzystam z zaproponowanego tutaj podejścia: https://gribblelab.wordpress.com/2009/03/09/repeated-measures-anova-using-r/ W szczególności używam rozwiązania nr 2 Więc mam coś takiego require(nlme) model <- lme(weight ~ time * Genotype, random = ~1|Animal/time, …

3
Wizualizacja miliona edycji PCA
Czy możliwe jest zwizualizowanie wyników analizy głównych składników w sposób zapewniający lepszy wgląd niż tylko tabele podsumowań? Czy można to zrobić, gdy liczba obserwacji jest duża, powiedzmy ~ 1e4? I czy można to zrobić w R [mile widziane inne środowiska]?

6
Czy ktoś może podać przykład unimodalnego rozkładu, który ma skośność równą zero, ale który nie jest symetryczny?
W maju 2010 r. Użytkownik Wikipedii Mcorazao dodał zdanie do artykułu o skośności: „Wartość zero wskazuje, że wartości są względnie równomiernie rozłożone po obu stronach średniej, zazwyczaj, ale niekoniecznie, implikując rozkład symetryczny”. Jednak na stronie wiki nie ma faktycznych przykładów dystrybucji, które łamią tę regułę. Googlowanie „przykładowe rozkłady asymetryczne z …

3
Zależność między przedziałem ufności a testową hipotezą statystyczną dla testu t
Powszechnie wiadomo, że przedziały ufności i testowanie hipotez statystycznych są ściśle powiązane. Moje pytania koncentrują się na porównaniu średnich dla dwóch grup w oparciu o zmienną numeryczną. Załóżmy, że taka hipoteza jest testowana przy użyciu testu t. Z drugiej strony można obliczyć przedziały ufności dla średnich z obu grup. Czy …

6
Jak zwiększyć długoterminową odtwarzalność badań (szczególnie przy użyciu R i Sweave)
Kontekst: W odpowiedzi na wcześniejsze pytanie dotyczące powtarzalnych badań Jake napisał Jednym z problemów, który odkryliśmy podczas tworzenia naszego archiwum JASA, była zmiana wersji i domyślnych pakietów CRAN. Tak więc w tym archiwum uwzględniamy również wersje używanych pakietów. System oparty na winietach prawdopodobnie się zepsuje, gdy ludzie zmienią swoje paczki …

3
Uwzględnianie utrwalonych widoków wartości p
Czasami w raportach zamieszczam oświadczenie o wartościach p i innych dostarczonych statystykach wnioskowania. Mówię, że ponieważ próbka nie była przypadkowa, takie statystyki nie miałyby ścisłego zastosowania. Moje konkretne sformułowanie jest zwykle podane w przypisie: „Podczas gdy, ściśle rzecz biorąc, wnioskowanie statystyczne ma zastosowanie tylko w kontekście losowego próbkowania, stosujemy konwencję …


8
Narzędzia Open Source do wizualizacji danych wielowymiarowych?
Jakie narzędzia open source, oprócz gnuplot i ggobi , używają do wizualizacji danych wielowymiarowych? Gnuplot to mniej więcej podstawowy pakiet kreślarski. Ggobi może robić wiele fajnych rzeczy, takich jak: animować dane wzdłuż wymiaru lub między dyskretnymi kolekcjami animować kombinacje liniowe zmieniające współczynniki oblicz główne składniki i inne transformacje wizualizuj i …

2
Kiedy regresję logistyczną rozwiązuje się w formie zamkniętej?
Weźmy i i załóżmy, że modelujemy zadanie przewidywania y dla x za pomocą regresji logistycznej. Kiedy współczynniki regresji logistycznej można zapisać w formie zamkniętej?x∈{0,1}dx∈{0,1}rex \in \{0,1\}^dy∈{0,1}y∈{0,1}y \in \{0,1\} Jednym z przykładów jest użycie modelu nasyconego. To znaczy zdefiniuj , gdzie indeksuje zestawy w zestawie mocy , a zwraca 1, jeśli …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.