Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Ocena wiarygodności kwestionariusza: wymiarowość, problematyczne elementy i czy użyć alfa, lambda6 lub jakiegoś innego indeksu?
Analizuję wyniki podane przez uczestników biorących udział w eksperymencie. Chcę oszacować wiarygodność mojego kwestionariusza, który składa się z 6 pozycji, mających na celu oszacowanie stosunku uczestników do produktu. Obliczyłem alfa Cronbacha traktującego wszystkie elementy jako pojedynczą skalę (alfa wynosiła około 0,6) i usuwając jeden element na raz (maksymalna alfa wynosiła …

6
Jak usunąć wszystkie zduplikowane rekordy z wyjątkiem jednego w ramce danych R. [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 4 lata temu . Mam ramkę danych, która zawiera zduplikowane identyfikatory. Chcę usunąć rekordy ze zduplikowanymi identyfikatorami, zachowując tylko wiersz o maksymalnej wartości. Więc dla …
16 r 

2
Czy dobrą praktyką jest standaryzacja danych w regresji za pomocą danych panelowych / podłużnych?
Ogólnie rzecz biorąc, standaryzuję moje zmienne niezależne w regresjach, aby właściwie porównać współczynniki (w ten sposób mają one te same jednostki: odchylenia standardowe). Jednak w przypadku danych panelowych / podłużnych nie jestem pewien, jak powinienem ustandaryzować swoje dane, zwłaszcza jeśli oszacuję model hierarchiczny. Aby zobaczyć, dlaczego może to być potencjalny …



2
Jak obliczyć przedziały ufności dla d Cohena?
Obliczyłem współczynnik d Cohena dla współczynników regresji (na podstawie statystyki t), ilorazów szans i różnic średnich, mając nadzieję na połączenie wyników w metaanalizie i zobaczenie, jak to działa. Jednak w Stacie nie wydaje się, abyś mógł łączyć te wyniki bez przedziałów ufności dla d Cohena, więc moje pytanie brzmi, jak …
16 cohens-d 

3
Kiedy właściwe byłoby zgłaszanie wariancji zamiast odchylenia standardowego?
Przeprowadziłem analizę, w której zamodelowałem różne składniki wariancji. Podczas raportowania wyników w tabeli o wiele bardziej zwięzłe jest zgłaszanie standardowych odchyleń zamiast odchyleń. To prowadzi mnie do pytania - czy kiedykolwiek istnieje powód, aby zgłaszać wariancję zamiast odchylenia standardowego? Czy coraz bardziej odpowiednie jest zgłaszanie się jeden po drugim?

4
Założenia analizy skupień
Przepraszam za podstawowe pytanie, jestem nowy w tej formie analizy i jak dotąd mam bardzo ograniczone rozumienie zasad. Zastanawiałem się tylko, czy wiele z parametrycznych założeń dla testów wielowymiarowych / jednowymiarowych ma zastosowanie do analizy skupień? Wiele źródeł informacji, które przeczytałem na temat analizy skupień, nie określa żadnych założeń. Szczególnie …


4
Strategia decydowania o odpowiednim modelu danych zliczania
Jaka jest właściwa strategia przy podejmowaniu decyzji, którego modelu użyć z danymi zliczania? Mam dane, które muszę zamodelować jako model wielopoziomowy i zalecono mi (na tej stronie), że najlepszym sposobem jest to poprzez błędy lub MCMCglmm. Jednak wciąż próbuję dowiedzieć się o statystykach bayesowskich i pomyślałem, że najpierw powinienem dopasować …

2
Agregowanie wyników z modeli liniowych przebiega R
Ponieważ modelowanie regresji jest często bardziej „sztuką” niż nauką, często testuję wiele iteracji struktury regresji. Jakie są skuteczne sposoby podsumowania informacji z tych wielu uruchomień modelu, próbując znaleźć „najlepszy” model? Jednym z zastosowanych przeze mnie sposobów jest umieszczenie wszystkich modeli na liście i przeglądanie summary()tej listy, ale wyobrażam sobie, że …
16 r  regression 

1
Korelacja losowych zmiennych logarytmicznych
Biorąc pod uwagę normalne zmienne losowe X1X1X_1 i X2X2X_2 ze współczynnikiem korelacji ρρ\rho , jak znaleźć korelację między kolejnymi logarytmicznymi zmiennymi losowymi Y1Y1Y_1 i Y2Y2Y_2 ? Y1=a1exp(μ1T+T−−√X1)Y1=a1exp⁡(μ1T+TX1)Y_1 = a_1 \exp(\mu_1 T + \sqrt{T}X_1) Y2=a2exp(μ2T+T−−√X2)Y2=a2exp⁡(μ2T+TX2)Y_2 = a_2 \exp(\mu_2 T + \sqrt{T}X_2) Teraz, jeśli X1=σ1Z1X1=σ1Z1X_1 = \sigma_1 Z_1 i X2=σ1Z2X2=σ1Z2X_2 = \sigma_1 …


4
Historie wojenne, w których podejmowano złe decyzje na podstawie informacji statystycznych?
Myślę, że to sprawiedliwe, że statystyki są nauką stosowaną, więc kiedy obliczane są średnie i odchylenia standardowe, dzieje się tak dlatego, że ktoś chce podjąć pewne decyzje na podstawie tych liczb. Mam nadzieję, że po części bycia dobrym statystykiem jest w stanie „wyczuć”, kiedy można ufać przykładowym danym i kiedy …

4
Czy powinienem dołączyć argument, aby zażądać sumy kwadratów typu III w ezANOVA?
Opracowałem pakiet ez dla R jako środek ułatwiający ludziom przejście z pakietów statystyk takich jak SPSS na R. Jest to (miejmy nadzieję) osiągnięte poprzez uproszczenie specyfikacji różnych smaków ANOVA i zapewnienie wyników podobnych do SPSS (w tym wielkości efektów i założeń testy), między innymi. Ta ezANOVA()funkcja służy głównie jako opakowanie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.