Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jaka jest różnica między podsumowaniem () a ładowaniem () dla obiektu princomp () w R?
Przykładowy kod: (pc.cr <- princomp(USArrests)) summary(pc.cr) loadings(pc.cr) ## note that blank entries are small but not zero Otrzymuję różne wyniki i nie jestem pewien, czy rozumiem, na czym polega różnica. Oto wynik: > summary(pc.cr) Importance of components: Comp.1 Comp.2 Comp.3 Comp.4 Standard deviation 82.8908472 14.06956001 6.424204055 2.4578367034 Proportion of Variance …
11 r  pca 

4
Dobry tekst na temat badań klinicznych?
Jestem studentem statystyki licencjackiej szukającym dobrego leczenia analizy badań klinicznych. Tekst powinien obejmować między innymi podstawy projektowania eksperymentalnego, blokowania, analizy mocy, projektowania kwadratów łacińskich i projektów randomizacji klastrów. Mam licencjacką wiedzę na temat statystyki matematycznej i prawdziwej analizy, ale jeśli istnieje fantastyczny tekst, który wymaga nieco wyższego poziomu statystyki lub …

3
Czy te formuły do ​​przekształcania P, LSD, MSD, HSD, CI do SE jako dokładne lub zawyżone / zachowawcze oszacowanie prawidłowe?
tło Przeprowadzam metaanalizę, która obejmuje wcześniej opublikowane dane. Często różnice między terapiami są zgłaszane z wartościami P, różnicami najmniej znaczącymi (LSD) i innymi statystykami, ale nie zapewniają bezpośredniego oszacowania wariancji. W kontekście modelu, którego używam, przeszacowanie wariancji jest w porządku. Problem Oto lista transformacji do której (Saville 2003), które rozważam, …

4
Obliczanie wielkości próby dla jednoczynnikowej regresji logistycznej
Jak obliczyć wielkość próby potrzebną do badania, w którym grupa badanych będzie miała jedną ciągłą zmienną zmierzoną w czasie operacji, a następnie dwa lata później zostaną one zaklasyfikowane jako wynik funkcjonalny lub wynik pogorszony. Chcielibyśmy sprawdzić, czy pomiar ten mógł przewidzieć zły wynik. W pewnym momencie możemy chcieć uzyskać punkt …

3
Co to jest kontrola spójności?
Zadano mi takie pytanie, jak „Czy sprawdzałeś spójność w swojej codziennej pracy?” podczas rozmowy telefonicznej na stanowisko biostatystyczne. Nie wiem co odpowiedzieć. Wszelkie informacje są mile widziane.
11 validation 


2
Szybko ocenić (wizualnie) korelacje między uporządkowanymi danymi kategorialnymi w R?
Szukam korelacji między odpowiedziami na różne pytania w ankiecie („umm, zobaczmy, czy odpowiedzi na pytanie 11 korelują z odpowiedziami na pytanie 78”). Wszystkie odpowiedzi są kategoryczne (większość z nich „od bardzo nieszczęśliwych” do „bardzo szczęśliwych”), ale kilka z nich ma inny zestaw odpowiedzi. Większość z nich można uznać za porządkowe, …

3
Szacowanie średniej i odchylenia ściętej krzywej gaussa bez skoku
Załóżmy, że mam czarną skrzynkę, która generuje dane po rozkładzie normalnym ze średnią mi odchyleniem standardowym s. Załóżmy jednak, że ilekroć wypisze wartość <0, niczego nie rejestruje (nawet nie jest w stanie powiedzieć, że otrzymała taką wartość). Mamy ścięty rozkład gaussa bez kolca. Jak mogę oszacować te parametry?

6
Czy właściwe jest traktowanie danych w skali n-punktowej Likerta jako n prób z procesu dwumianowego?
Nigdy nie podobało mi się, jak ludzie zazwyczaj analizują dane ze skal Likerta tak, jakby błąd był ciągły i Gaussa, gdy istnieją uzasadnione oczekiwania, że ​​te założenia zostaną naruszone przynajmniej w skrajnych skalach. Co sądzisz o następującej alternatywie: Jeśli odpowiedź przyjmuje wartość w skali punktowej, rozwiń te dane do prób, …

6
Jak znaleźć statystyki podsumowujące dla wszystkich unikalnych kombinacji czynników w ramce data.frame w R? [Zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było na temat dotyczącym weryfikacji krzyżowej. Zamknięte 2 lata temu . Chcę obliczyć podsumowanie zmiennej w data.frame dla każdej unikalnej kombinacji czynników w data.frame. Czy powinienem użyć do tego plyr? Nie …


4
Wiele testów chi-kwadrat
Mam sklasyfikowane dane w tabeli 2 x 2 x 6. Nazwijmy wymiary response, Ai B. Dopasowuję regresję logistyczną do danych za pomocą modelu response ~ A * B. Analiza dewiacji tego modelu wskazuje, że oba terminy i ich interakcja są znaczące. Jednak patrząc na proporcje danych, wygląda na to, że …

6
Jak problematyczne jest kontrolowanie nie-niezależnych zmiennych towarzyszących w badaniu obserwacyjnym (tj. Bez randomizacji)?
Miller i Chapman (2001) twierdzą, że absolutnie niewłaściwe jest kontrolowanie zmiennych niezależnych, które są powiązane zarówno ze zmiennymi niezależnymi, jak i zależnymi w badaniu obserwacyjnym (nierandomizowanym) - mimo że jest to rutynowo wykonywane w naukach społecznych. Jak problematyczne jest to zrobić? Jak najlepiej poradzić sobie z tym problemem? Jeśli rutynowo …

5
Referencje dotyczące planowania badań
W przeciętnej (medianie?) Rozmowie na temat statystyki często omawiasz tę lub inną metodę analizy tego lub innego rodzaju danych. Z mojego doświadczenia wynika, że ​​staranne projektowanie badań ze szczególnym uwzględnieniem analizy statystycznej jest często zaniedbywane (praca w biologii / ekologii, wydaje się, że jest to przeważające zjawisko). Statystycy często znajdują …

4
ANOVA z nie-niezależnymi obserwacjami
Przepraszamy za pełne tło tego pytania: Czasami w badaniach zachowań zwierząt eksperymentator interesuje się ilością czasu, jaki pacjent spędza w różnych, wcześniej określonych strefach w aparacie testowym. Często widziałem tego rodzaju dane analizowane przy użyciu ANOVA; jednak nigdy nie byłem całkowicie przekonany o ważności takich analiz, biorąc pod uwagę, że …
11 anova 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.