Graniczy to z filozoficznym pytaniem, ale interesuje mnie, jak inni z większym doświadczeniem myślą o wyborze dystrybucji. W niektórych przypadkach wydaje się jasne, że teoria może działać najlepiej (długość ogona myszy jest prawdopodobnie zwykle rozkładana). W wielu przypadkach prawdopodobnie nie ma teorii do opisania zestawu danych, więc po prostu używasz …
Zastanawiałem się, jak wywnioskować wariancję zmiennej za pomocą wykresu pudełkowego. Czy można przynajmniej wywnioskować, czy dwie zmienne mają tę samą wariancję, obserwując ich wykres pudełkowy?
Wartość p określa się jako prawdopodobieństwo uzyskania statystyki testowej co najmniej tak ekstremalnej, jak to, co obserwuje się, przy założeniu, że hipoteza zerowa jest prawdziwa. Innymi słowy, P(X≥t|H0)P(X≥t|H0)P( X \ge t | H_0 ) Ale co, jeśli statystyka testowa ma rozkład bimodalny? czy wartość p oznacza coś w tym kontekście? …
Zastanawiałem się, czy ktokolwiek może wyjaśnić mi intuicję poza Clopper-Pearson CI dla proporcji. O ile mi wiadomo, każdy element CI zawiera wariancję. Jednak w przypadku proporcji, nawet jeśli moja proporcja wynosi 0 lub 1 (0% lub 100%), można obliczyć CI Cloppera-Pearsona. Próbowałem spojrzeć na formuły i rozumiem, że ma coś …
Opracowuję kwestionariusz. Aby poprawić jego niezawodność i aktualność, chcę zastosować metody statystyczne. Chcę wyeliminować pytania, których odpowiedzi są zawsze takie same. Oznacza to, że prawie wszyscy uczestnicy udzielili takich samych odpowiedzi na te pytania. Teraz moje pytania to: Jaki jest termin techniczny na takie bezużyteczne pytania, których odpowiedzi są zawsze …
Podczas wizualizacji danych jednowymiarowych często stosuje się technikę szacowania gęstości jądra w celu uwzględnienia nieprawidłowo wybranych szerokości pojemników. Czy w moim jednowymiarowym zbiorze danych występują niepewności pomiaru, czy istnieje standardowy sposób na włączenie tych informacji? Na przykład (i wybaczcie mi, jeśli moje rozumienie jest naiwne) KDE przekształca profil gaussowski z …
Mam bardzo mały zestaw danych na temat liczebności pojedynczych pszczół, które mam problemy z analizą. Są to dane zliczania i prawie wszystkie zliczenia są w jednym traktowaniu, a większość zer w drugim traktowaniu. Istnieje również kilka bardzo wysokich wartości (po jednej w dwóch z sześciu miejsc), więc rozkład zliczeń ma …
Obecnie próbuję przeanalizować zestaw danych dokumentu tekstowego, który nie ma podstawowej prawdy. Powiedziano mi, że możesz użyć k-krotnego sprawdzania poprawności, aby porównać różne metody klastrowania. Jednak przykłady, które widziałem w przeszłości, wykorzystują podstawową prawdę. Czy istnieje sposób na użycie zestawu K-fold w tym zestawie danych do zweryfikowania moich wyników?
Mam duży zbiorczy zestaw danych rynkowych dotyczących sprzedaży wina w USA i chciałbym oszacować popyt na niektóre wina wysokiej jakości. Te udziały w rynku zostały zasadniczo wyprowadzone z losowego modelu użytkowego w postaci Uja j t= X′j tβ- α pj t+ ξj t+ ϵja j t≡ δj t+ ϵj tUijt=Xjt′β−αpjt+ξjt+ϵijt≡δjt+ϵjtU_{ijt} …
Krótki wpis na stronie internetowej NY Times zawiera Fakty i liczby dotyczące konsumpcji pizzy w Stanach Zjednoczonych. Interesująco interesuje mnie sposób, w jaki statystyki są wykorzystywane (lub nadużywane) w celu dostarczania informacji ogółowi odbiorców, a na podstawie przedstawionych statystyk pojawiło się kilka pytań: Jeśli 1 na 8 Amerykanów zje dzisiaj …
Próbuję obliczyć prawdopodobieństwo logarytmiczne dla uogólnionej regresji nieliniowej metodą najmniejszych kwadratów dla funkcji zoptymalizowanej przez funkcja w pakiecie R , przy użyciu macierzy kowariancji wariancji generowanej przez odległości na drzewie filogenetycznym przy założeniu ruchu Browna ( z pakietu). Poniższy odtwarzalny kod R pasuje do modelu GNSS przy użyciu danych x, …
Jest dla mnie jasne i dobrze wyjaśnione na wielu stronach, jakie informacje wartości na przekątnej macierzy kapelusza dają regresję liniową. Macierz kapeluszowa modelu regresji logistycznej jest dla mnie mniej jasna. Czy jest identyczny z informacjami uzyskanymi z matrycy kapelusza przy zastosowaniu regresji liniowej? Oto definicja macierzy kapelusza, którą znalazłem na …
Dlaczego konieczne jest założenie podziału na błędy, tj yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , z ϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) . Dlaczego nie napisać? yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , z yi∼N(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) , gdzie w obu przypadkach ϵi=yi−y^ϵi=yi−y^\epsilon_i = y_i - \hat{y} . Podkreśliłem, że założenia dystrybucyjne dotyczą błędów, a …
Z góry przepraszamy, jeśli jakakolwiek terminologia, której używam, jest niepoprawna. Z zadowoleniem przyjąłbym każdą korektę. Jeśli to, co opisuję jako „punkt odcięcia”, ma inną nazwę, daj mi znać, a mogę zaktualizować pytanie. Interesuje mnie sytuacja: masz zmienne niezależne i jedną zmienną zależną y . Pozostawię to niejasne, ale zakładam, że …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.