Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Wyprowadzanie negentropy. Utknąć
Pytanie to jest więc nieco związane, ale starałem się, aby było to jak najbardziej proste. Cel: Krótko mówiąc, istnieje pochodna negentropii, która nie obejmuje kumulantów wyższego rzędu, i próbuję zrozumieć, w jaki sposób została wyprowadzona. Tło: (Rozumiem to wszystko) Sam studiuję książkę „Independent Component Analysis” , którą znalazłem tutaj. (To …


3
Standardowa miara zlepienia?
Mam dużo danych i chcę zrobić coś, co wydaje się bardzo proste. W tym dużym zestawie danych interesuje mnie, jak bardzo konkretny element zlepia się ze sobą. Powiedzmy, że moje dane są uporządkowanym zestawem w następujący sposób: {A, C, B, D, A, Z, T, C ...}. Powiedzmy, że chcę wiedzieć, …

5
Szacowanie odsetków jako zmiennej zależnej w regresji
Mam procentowe stopnie studentów na 38 egzaminach jako zmienną zależną w moim badaniu. Procent rangi jest obliczany na podstawie (rangi studenta / liczby studentów na egzaminie). Ta zmienna zależna ma prawie jednolity rozkład i chcę oszacować wpływ niektórych zmiennych na zmienną zależną. Jakiego podejścia regresji używam?

2
Jak mogę użyć wartości do przetestowania założenia liniowości w analizie regresji wielokrotnej?
Poniższe wykresy są resztkowymi wykresami rozproszenia testu regresji, dla których z pewnością spełnione zostały już założenia dotyczące „normalności”, „homoscedastyczności” i „niezależności”! Do testowania założenia „liniowości” , chociaż patrząc na wykresy, można domyślić się, że związek jest krzywoliniowy, ale pytanie brzmi: w jaki sposób można zastosować wartość „R2 Linear” do przetestowania …

6
Materiały do ​​nauki jak wdrażać metody zespołowe
Rozumiem teoretycznie (w pewnym sensie), jak by one działały, ale nie jestem pewien, jak właściwie korzystać z metody złożonej (takiej jak głosowanie, ważone mieszanki itp.). Jakie są dobre zasoby do wdrażania metod zespołowych? Czy są jakieś szczególne zasoby dotyczące implementacji w Pythonie? EDYTOWAĆ: Aby wyjaśnić niektóre na podstawie dyskusji na …

1
Pomóż mi zrozumieć wartości w Bayesian glm
Próbuję uruchomić Bayesa logit na dane tutaj . Używam bayesglm()w armpakiecie w R. Kodowanie jest dość proste: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) daje następujący wynik: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 SEXMale 0.02408 0.09363 …
13 r  bayesian  p-value 

4
Poszukiwanie prawdziwej ilustracji cytatu Fishera na temat DoE
Mój zespół i ja chcielibyśmy przedstawić niestatystom firmy prezentację na temat użyteczności projektowania eksperymentów. Ci statystycy są również naszymi klientami i zwykle nie konsultują się z nami przed zebraniem swoich danych. Czy znasz jakieś prawdziwe przykłady, które dobrze zilustrują słynny cytat Fishera: „Przywołanie statystyki po zakończeniu eksperymentu może być niczym …

2
Jak uzyskać wyniki post-hoc testu Tukey HSD w tabeli pokazującej zgrupowane pary?
Chciałbym wykonać test post-hoc TukeyHSD po mojej dwukierunkowej Anova z R, uzyskując tabelę zawierającą posortowane pary pogrupowane według znaczących różnic. (Przepraszam za brzmienie, wciąż jestem nowy ze statystykami). Chciałbym mieć coś takiego: Pogrupowane w gwiazdki lub litery. Dowolny pomysł? Testowałem funkcję HSD.test()z agricolaepakietu, ale wygląda na to, że nie obsługuje …


1
Prognozy za pomocą glmnet w R
Próbuję modelować niektóre dane przy użyciu glmnetpakietu w R. Załóżmy, że mam następujące dane training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (Jest to uproszczenie; moje dane są znacznie bardziej skomplikowane.) Następnie użyłem następującego kodu, …
13 r  glmnet 

1
Odpowiedzi na śmieszne pytania egzaminacyjne [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 7 lat temu . Korekta egzaminów jest prawdopodobnie najnudniejszym zadaniem nauczyciela. Ale może być zabawne, że zbieramy śmieszne odpowiedzi z egzaminów statystycznych. Jeden wpis na …
13 teaching  humor 

4
Inicjalizowanie centrów K-średnich za pomocą losowych podpróbek zestawu danych?
Jeśli mam określony zestaw danych, jak mądre byłoby inicjowanie centrów klastrowych przy użyciu losowych próbek tego zestawu danych? Załóżmy na przykład, że chcę 5 clusters. Przyjmuję, 5 random samplespowiedzmy, size=20%oryginalny zestaw danych. Czy mogę wziąć średnią z każdej z 5 losowych próbek i użyć tych środków jako moich 5 początkowych …


1
Zastosowanie ogólnej metody momentów (GMM) do obliczenia parametru regresji logistycznej
Chcę obliczyć współczynniki dla regresji, która jest bardzo podobna do regresji logistycznej (w rzeczywistości regresja logistyczna z innym współczynnikiem: gdymogą być podane). Myślałem o użyciu GMM do obliczenia współczynników, ale nie jestem pewien, jakie są obecnie warunki, których powinienem użyć.ZA1 + e- ( b0+ b1x1+ b2)x2)+ … ),A1+e−(b0+b1x1+b2x2+…), \frac{A}{1 + …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.