Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Intuicja i zastosowania współczynnika zmienności
Obecnie uczęszczam na kurs An Introduction to Operations Management na Coursera.org. W pewnym momencie profesor zaczął zajmować się zmiennością czasu operacji. Miarą, którą stosuje, jest współczynnik zmienności , stosunek między odchyleniem standardowym a średnią: cv=σμcv=σμc_v = \frac{\sigma}{\mu} Dlaczego warto zastosować ten pomiar? Jakie są zalety i wady pracy z CV …


1
Co to jest „bagplot” lub „dwuwymiarowy wykres pudełkowy”?
Mam znaleźć referat wprowadzający wielowymiarowego (dwuwymiarowym tutaj) wersję boxplot - a bagplot. Czym dokładnie jest ten bagplot? Widzę serię zagnieżdżonych wielokątów opartych na wierzchołkach, a jeden z tych wielokątów jest zadeklarowany jako bagplot. Jaki jest pomysł budowy zagnieżdżonego wielokąta? Który z wielokątów jest wykreślnikiem (centralnym lub posiadającym średnią liczbę punktów)? …


2
Niezawodność Omega vs. alfa
Zastanawiam się, czy ktoś może wyjaśnić, jaka jest główna różnica między niezawodnością omega i alfa? Rozumiem, że niezawodność omega opiera się na hierarchicznym modelu czynnikowym, jak pokazano na poniższym obrazie, a alfa używa średnich korelacji między elementami. Nie rozumiem, w jakich warunkach współczynnik niezawodności omega byłby wyższy niż współczynnik alfa …

3
Korzystanie z symulacji komputerowych w celu lepszego zrozumienia pojęć statystycznych na poziomie absolwenta
Cześć, studiuję na kierunku Statystyka, omawiamy statystyki testowe i inne pojęcia. Jednak często jestem w stanie zastosować formuły i rozwinąć swoistą intuicję dotyczącą tego, jak działają rzeczy, ale często mam wrażenie, że być może, jeśli poprę moje badanie symulowanymi eksperymentami, rozwinę lepszą intuicję w bieżące problemy . Zastanawiałem się więc …

1
Uzyskanie różnych wyników podczas kreślenia elips 95% CI za pomocą ggplot lub pakietu elipsy
Chcę wizualizować wyniki grupowania (wytworzone za pomocą protoclust{protoclust}) poprzez tworzenie wykresów scater dla każdej pary zmiennych używanych do klasyfikowania moich danych, kolorowania według klas i nakładania się elips na 95% przedział ufności dla każdej z klas (aby sprawdzić, które klasy elipses pokrywają się pod każdą parą zmiennych). Zaimplementowałem rysunek elips …


2
Jaka jest zaleta zmniejszenia wymiarów predyktorów na potrzeby regresji?
Jakie są zastosowania lub zalety technik regresji redukcji wymiarów (DRR) lub technik nadzorowanej redukcji wymiarów (SDR) w porównaniu z tradycyjnymi technikami regresji (bez żadnej redukcji wymiarowości)? Ta klasa technik znajduje nisko wymiarową reprezentację zestawu cech dla problemu regresji. Przykłady takich technik obejmują krojenie regresji odwrotnej, główny kierunek Hesji, oszacowanie średniej …

1
Czy dane te można agregować w proporcje dla dwumianowego glm?
Poprosiliśmy 60 osób o podanie jak największej liczby franczyz restauracyjnych w Atlancie. Ogólna lista obejmowała ponad 70 restauracji, ale wyeliminowaliśmy te, o których wspomniało mniej niż 10% osób, pozostawiając nam 45. Dla tych 45 obliczyliśmy odsetek informatorów, którzy wymienili franczyzę, i jesteśmy zainteresowani modelowanie tej proporcji jako funkcji budżetu reklamowego …


5
Dobre książki o eksploracji tekstu?
Cześć. Chciałem wiedzieć, czy są jakieś dobre książki na temat eksploracji tekstu i klasyfikacji z niektórymi studiami przypadków ?. Jeśli nie, wystarczyłyby niektóre dokumenty / czasopisma dostępne publicznie. Jeśli zilustrują swoje przykłady R jeszcze lepiej. Nie szukam instrukcji krok po kroku, ale czegoś, co ilustruje zalety i wady różnych podejść …

1
Czy mogę założyć (log-) normalność dla tej próbki?
Oto wykres QQ dla mojej próbki (zwróć uwagę na logarytmiczną oś Y); :n=1000n=1000n = 1000 Jak wskazał whuber, oznacza to, że leżący u podstaw rozkład jest przekrzywiony w lewo (prawy ogon jest krótszy). shapiro.testW=0.9718W=0.9718W = 0.97185.172⋅10−135.172⋅10−135.172\cdot10^{-13}H0:the sample is normal distributedH0:the sample is normal distributedH_0 : \text{the sample is normal distributed} …

1
Jak ustalić współczynnik w porządkowej regresji logistycznej bez zakładania proporcjonalnych szans w R?
Chcę zrobić porządkową regresję logistyczną w R bez założenia prawdopodobieństwa proporcjonalności. Wiem, że można to zrobić bezpośrednio za pomocą vglm()funkcji Rpoprzez ustawienie parallel=FALSE. Ale moim problemem jest to, jak naprawić konkretny zestaw współczynników w tej konfiguracji regresji? Powiedzmy na przykład, że zmienna zależna jest dyskretna i porządkowa i może przyjmować …
11 r  regression  logistic 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.