Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Czy istnieją jakieś samouczki na temat Bayesowskiej teorii prawdopodobieństwa lub modeli graficznych na przykład?
Widziałem odniesienia do nauki bayesowskiej teorii prawdopodobieństwa w języku R i zastanawiałem się, czy jest czegoś takiego, być może konkretnie w Pythonie? Skoncentrowany na nauce Bayesowskiej teorii prawdopodobieństwa, wnioskowania, szacowania maksymalnego prawdopodobieństwa, modeli graficznych i tym podobnych?


2
Wyjaśnienie modelu Tobit
Mamy 100 uczestników w dwóch grupach, n = 50n=50n=50w każdej grupie. Zastosowaliśmy ocenę zdolności podstawowego funkcjonowania w 4 punktach czasowych. Ocena składa się z 6 pytań, każde z wynikiem 0–5. Nie mamy indywidualnych wyników dla każdego pytania, tylko łączne wyniki z zakresu od 0 do 30. Wyższe wyniki wskazują na …

3
Regresja zwykła a regresja przy różnicowaniu zmiennych
Próbuję po prostu zrozumieć, jaki jest związek między normalną regresją wielokrotną / prostą a regresją wielokrotną / prostą, gdy zmienne są różnicowane. Na przykład analizuję związek między saldem depozytów ( ) a stopami rynkowymi ( ) Jeśli uruchomię prostą regresję liniową, korelacja jest ujemna i dość znacząca (około -74). Jeśli …

2
Wykorzystanie statystycznego testu istotności do sprawdzenia poprawności wyników analizy skupień
Badam wykorzystanie statystycznego testowania istotności (SST) do walidacji wyników analizy skupień. Znalazłem kilka artykułów na ten temat, takich jak „ Statystyczne znaczenie grupowania dla danych o dużych wymiarach i małych próbkach ” Liu, Yufeng i in. (2008) „ O niektórych testach istotności w analizie skupień ”, Bock (1985) Ale jestem …

3
Wybór modelu: regresja logistyczna
Załóżmy, że mamy zmiennych towarzyszących i binarną zmienną wyniku . Niektóre z tych zmiennych towarzyszących są podzielone na kategorie z wieloma poziomami. Inne są ciągłe. Jak wybrałbyś „najlepszy” model? Innymi słowy, jak wybrać współzmienne, które należy uwzględnić w modelu?x 1 , … , x n ynnnx1, … , Xnx1,…,xnx_1, \dots, …

3
Jak porównać stoki regresji rozruchowej?
Załóżmy, że mam dwa zestawy danych z n obserwacjami par danych zmiennej niezależnej x i zmiennej zależnej y . Załóżmy dalej, że chcę wygenerować rozkład nachyleń regresji dla każdego zestawu danych, ładując obserwacje (z zamianą) N razy i obliczając regresję y = a + bxza każdym razem. Jak porównać oba …


1
Obliczanie błędu prognozy przy krzyżowej weryfikacji szeregów czasowych
Mam model prognozowania dla szeregów czasowych i chcę obliczyć jego błąd prognozowania poza próbą. W tej chwili strategię, którą stosuję, jest ta sugerowana na blogu Roba Hyndmana (w dolnej części strony), która wygląda następująco (zakładając szereg czasowy i zestaw treningowy o rozmiarze k )y1, … , Yny1,…,yny_1,\dots,y_nkkk Dopasować model do …

2
Ocena modeli regresji logistycznej
To pytanie wynika z mojego faktycznego zamieszania dotyczącego tego, jak zdecydować, czy model logistyczny jest wystarczająco dobry. Mam modele, które wykorzystują stan par projekt indywidualny dwa lata po ich uformowaniu jako zmienna zależna. Wynik jest udany (1) lub nie (0). Mam zmienne niezależne mierzone w czasie tworzenia par. Moim celem …

2
Jak przewidzieć kategorię odpowiedzi na podstawie modelu regresji logistycznej porządkowej?
Chcę przewidzieć problem zdrowotny. Mam 3 kategorie wyników, które są uporządkowane: „normalna”, „łagodna” i „ciężka”. Chcę to przewidzieć na podstawie dwóch zmiennych predykcyjnych, wyniku testu (zmienna ciągła, zmienna interwałowa) i historii rodziny z tym problemem (tak lub nie). W mojej próbie prawdopodobieństwo wynosi 55% (normalne), 35% (łagodne) i 10% (ciężkie). …

1
Test istotności różnicy współczynnika korelacji Spearmana
(Bardzo dziękuję za szybkie odpowiedzi! Zadałem kiepskie zadanie, więc pozwól mi spróbować ponownie.) Nie wiem, jak sprawdzić, czy różnica między dwiema korelacjami Spearmana jest statystycznie istotna. Chciałbym wiedzieć, jak się tego dowiedzieć. Powodem, dla którego chciałem się dowiedzieć, jest następujący artykuł: Semantyczna interpretacja semantyczna oparta na Wikipedii , opracowana przez …

3
Czy dynamiczne zwiększanie wielkości próby jest w porządku, jeśli stwierdzono to z góry?
Zaraz zrobię badanie na temat zalet jednego bodźca w porównaniu do drugiego z projektem wewnątrz przedmiotu. Mam schemat permutacji, który ma na celu zmniejszenie efektów porządkowych niektórych części badania (kolejność typów zadań, kolejność bodźców, kolejność zestawów zadań). Schemat permutacji nakazuje podzielność wielkości próby przez 8. Aby określić wielkość próbki, musiałbym …

3
Jak uzasadnić termin błędu w czynnikowej ANOVA?
Prawdopodobnie bardzo podstawowe pytanie dotyczące wieloczynnikowej ANOVA. Załóżmy dwustronny projekt, w którym testujemy zarówno główne efekty A, B, jak i interakcję A: B. Podczas testowania głównego efektu dla A z typem I SS, efekt SS jest obliczany jako różnica , gdzie jest sumą błędu resztkowego kwadratów dla modelu z tylko …

2
W jaki sposób ekonomiści oceniają operacje na czarnym rynku?
Przeprowadziłem wiele badań nad przestępczością zorganizowaną w Azji Wschodniej w ramach projektu mającego na celu przysługę mojemu przyjacielowi, autorowi, i zauważyłem, że byli znani ekonomiści i dziennikarze, którzy łącznie oceniają wartość operacji na czarnym rynku na całym świecie . Jaka jest metodologia tego? Jak te liczby się łączą? Czy te …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.