Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Wytyczne dotyczące odkrywania nowej wiedzy w danych
Knuję coś, aby wskazać na siebie lub kogoś innego. Zazwyczaj pytanie rozpoczyna ten proces i często osoba pytająca ma nadzieję na konkretną odpowiedź. Jak mogę dowiedzieć się ciekawych rzeczy na temat danych w mniej stronniczy sposób? W tej chwili z grubsza stosuję tę metodę: Statystyki podsumowujące. Wykres paskowy. Wykres punktowy. …

2
Sparowana, ANOVA z powtarzanymi pomiarami czy model mieszany?
Poproszono mnie o przeanalizowanie niektórych danych z badania klinicznego dotyczącego dwóch metod pomiaru ciśnienia krwi. Mam dane od 50 osób, z których każda zawiera od 2 do 57 miar przy użyciu każdej metody. Zastanawiam się, jak najlepiej postępować. Oczywiście potrzebuję rozwiązania, które uwzględni fakt, że miara ciśnienia krwi jest sparowana …
9 r  anova  mixed-model  stata 


2
Jak modelować sumę zmiennych losowych Bernoulliego dla danych zależnych?
Mam prawie takie same pytania: Jak mogę skutecznie modelować sumę losowych zmiennych Bernoulliego? Ale ustawienie jest zupełnie inne: S=∑i=1,NXiS=∑i=1,NXiS=\sum_{i=1,N}{X_i} , , ~ 20, ~ 0,1P(Xi=1)=piP(Xi=1)=piP(X_{i}=1)=p_iNNNpipip_i Mamy dane dotyczące wyników zmiennych losowych Bernoulliego: ,Xi,jXi,jX_{i,j}Sj=∑i=1,NXi,jSj=∑i=1,NXi,jS_j=\sum_{i=1,N}{X_{i,j}} Jeśli oszacujemy z oszacowaniem maksymalnego prawdopodobieństwa (i uzyskamy ), okaże się, że jest znacznie większy niż oczekiwane …

1
Wielowymiarowa regresja ortogonalna wielomianowa?
Aby zmotywować pytanie, rozważ problem regresonu, w którym staramy się oszacować za pomocą obserwowanych zmiennychYYY{a,b}{a,b}\{ a, b \} Wykonując wielowymiarową regresję wielomianową, staram się znaleźć optymalne paramitowanie tej funkcji f(y)=c1a+c2b+c3a2+c4ab+c5b2+⋯f(y)=c1a+c2b+c3a2+c4ab+c5b2+⋯f(y)=c_{1}a+c_{2}b+c_{3}a^{2}+c_{4}ab+c_{5}b^{2}+\cdots które najlepiej pasują do danych w najmniejszym kwadracie. Problem polega jednak na tym, że parametry nie są niezależne. Czy istnieje …


1
Czy liczby zerowe muszą zostać dostosowane do testu współczynnika wiarygodności modeli Poissona / Loglinear?
Jeśli w tabeli kontyngencji znajdują się zera i dopasowujemy zagnieżdżone modele poissona / loglinearne (używając glmfunkcji R ) do testu współczynnika prawdopodobieństwa, czy musimy dopasować dane przed dopasowaniem modeli glm (np. Dodać 1/2 do wszystkich liczy się)? Oczywiście niektórych parametrów nie można oszacować bez pewnej korekty, ale w jaki sposób …

3
Wskaźniki akceptacji dla Metropolis-Hastings z jednolitym rozkładem kandydatów
Kiedy działa algorytm Metropolis-Hastings z jednolitymi rozkładami kandydatów, jakie jest uzasadnienie posiadania współczynników akceptacji około 20%? Mam na myśli: po wykryciu prawdziwych (lub zbliżonych do prawdziwych) wartości parametrów, żaden nowy zestaw wartości parametrów kandydujących z tego samego jednolitego przedziału nie zwiększyłby wartości funkcji prawdopodobieństwa. Dlatego im więcej iteracji przeprowadzam, tym …



2
Model Tobit z R.
Czy ktoś wie, gdzie znaleźć dobrą aplikację i przykłady (oprócz instrukcji i ekonometrii stosowanej w książce za pomocą R) przy użyciu modelu tobit z pakietami AER? Edytować Szukam polecenia do obliczenia efektów krańcowych dla y (nie dla ukrytej zmiennej y *). Wygląda na toϕ ( x β/ σ) βϕ(xβ/σ)β\phi(x\beta/\sigma)\beta, gdzie …

6
Testowanie stabilności w szeregu czasowym
Czy istnieje standardowa (lub najlepsza) metoda testowania po ustabilizowaniu się szeregu czasowego? Trochę motywacji Mam stochastyczny system dynamiczny, który generuje wartość xtxtx_t na każdym kroku t∈Nt∈Nt \in \mathbb{N}. Ten system zachowuje się przejściowo do czasut∗t∗t^* a następnie stabilizuje się wokół pewnej wartości średniej x∗x∗x^*z pewnym błędem. Żaden zt∗t∗t^*, x∗x∗x^*lub błąd …



3
Jak zmienić nazwy kolumn w ramce danych w R? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 6 lat temu . names(mydat)[c(name)]<-c("newname") Z tego wiem, że nazwa kolumny / zmiennej „name” ramki danych mydat jest zastąpiona przez „newname”. Moje pytanie brzmi: czy …
9 r 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.