Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Regresja logistyczna dla wieloklasowej
Mam model regresji logistycznej dla wieloklasowej, który podaje P(Y=j|X(i))=exp(θTjX(i))1+∑km=1exp(θTmX(i))P(Y=j|X(i))=exp⁡(θjTX(i))1+∑m=1kexp⁡(θmTX(i)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^TX^{(i)})}{1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)})} gdzie k to liczba klas theta to parametr do oszacowania j to j-ta klasa Xi to dane treningowe Cóż, jedna rzecz, której nie dostałem, to dlaczego część mianownika znormalizowała model. Mam na myśli, że prawdopodobieństwo pozostanie …

2
R jest równoważne opcji klastrowej przy zastosowaniu ujemnej regresji dwumianowej
Próbuję powielić pracę kolegi i przenoszę analizę ze Staty do R. Modele, które stosuje, wywołują opcję „klastrowania” w funkcji nbreg, aby grupować błędy standardowe. Zobacz http://repec.org/usug2007/crse.pdf, aby uzyskać dość kompletny opis co i dlaczego tej opcji Moje pytanie brzmi: jak wywołać tę samą opcję dla ujemnej regresji dwumianowej w R? …

1
Czy istnieje generalizacja śladu Pillai i śladu Hotellinga-Lawleya?
W ustawieniu wielowymiarowej regresji wielokrotnej (regresor wektorowy i regresja i) cztery główne testy ogólnej hipotezy (Lambda Wilka, Pillai-Bartlett, Hotelling-Lawley i największa korzeń Roya) zależą od wartości własnych macierzy HE−1HE−1H E^{-1} , gdzie HHH i EEE są „objaśnionymi” i „całkowitymi” macierzami zmienności. I zauważył, że dane statystyczne Pillai i Hotellinga-Lawley mogą …

1
Co oznaczają interakcje wyrazów splajnowych i nielinearowych?
Jeśli dopasuję moje dane do czegoś podobnego lm(y~a*b), w składni R, gdzie ajest zmienną binarną i bzmienną numeryczną, to a:btermin interakcji jest różnicą między nachyleniem y~bat a= 0 i at a= 1. Teraz załóżmy, że relacje między yi bjest krzywoliniowy. Jeśli teraz pasuję lm(y~a*poly(b,2)), to a:poly(b,2)1jest zmiana zmiany y~bwarunkowej na …

3
Jaka jest różnica między statystyką a informatyką?
Zawsze mówimy, że statystyki dotyczą tylko danych. Ale wiemy również, że informatyka czerpie wiedzę z analizy danych. Na przykład ludzie bioinformatyki mogą całkowicie przejść bez biostatystyki. Chcę wiedzieć, jaka jest zasadnicza różnica między statystyką a informatyką.

1
Wzorzec kliknięć myszy (lub klawiatury) i przewidywanie aktywności użytkownika komputera
Czy na podstawie wyłącznie czasowego wzoru kliknięć myszą (lista czasów kliknięcia ) można przewidzieć aktywność użytkownika komputera?[ t1, t2), t3), … ][t1,t2,t3,…][t_1,t_2,t_3,\ldots] Na przykład poza pracą: spędzaniem czasu na Facebooku, oglądaniem zdjęć i graniem w grę komputerową. Jeśli są to bardziej szczegółowe prognozy (np. Granie w StarCraft vs Counter Strike …

2
Normalizacja
Istnieje wiele metod przeprowadzania regularyzacji - na przykład regularyzacja oparta na normach , L 1 i L 2 . Według Friedmana Hastie & Tibsharani , najlepszy regulizator zależy od problemu: mianowicie charakteru prawdziwej funkcji celu, konkretnej zastosowanej podstawy, stosunku sygnału do szumu i wielkości próbki.L.0L0L_0L.1L1L_1L.2)L2L_2 Czy istnieją badania empiryczne porównujące …

2
Jaka jest różnica między korelacją szeregową a posiadaniem katalogu głównego?
Być może mieszam swoje koncepcje szeregów czasowych i nieszeregowych, ale jaka jest różnica między modelem regresji wykazującym korelację szeregową a modelem wykazującym pierwiastek jednostkowy? Ponadto, dlaczego można użyć testu Durbina-Watsona do testowania korelacji szeregowej, ale należy użyć testu Dickeya-Fullera dla pierwiastków jednostkowych? (Mój podręcznik mówi, że dzieje się tak, ponieważ …

6
Jak ocenić moc predykcyjną zestawu predyktorów jakościowych wyniku binarnego? Oblicz prawdopodobieństwo lub regresję logistyczną?
Próbuję ustalić, czy proste prawdopodobieństwa będą działać na mój problem, czy też lepiej będzie użyć (i dowiedzieć się więcej) bardziej wyrafinowanych metod, takich jak regresja logistyczna. Zmienna odpowiedzi w tym problemie jest odpowiedzią binarną (0, 1). Mam wiele zmiennych predykcyjnych, które są kategoryczne i nieuporządkowane. Próbuję ustalić, które kombinacje zmiennych …

2
Jaka jest ważna analiza post hoc dla ANOVA z powtarzanymi pomiarami w trzech kierunkach?
Przeprowadziłem ANOVA z powtarzanymi potrójnymi pomiarami; jakie analizy post-hoc są ważne? Jest to w pełni zbalansowany projekt (2x2x2) z jednym z czynników powtarzających się w obrębie badanych osób. Jestem świadomy wielowymiarowego podejścia do ANOVA z powtarzanymi pomiarami w R, ale moim pierwszym instynktem jest przejście do prostej ANOVA w stylu …


3
Pozyskiwanie priorów… za pomocą pieniędzy!
Załóżmy, że mam „ekspertów”, z którymi chciałbym wywołać uprzedniej dystrybucji na jakiejś zmiennej X . Chciałbym ich zmotywować prawdziwymi pieniędzmi . Chodzi o to, aby wywołać priory, obserwować n realizacji losowej zmiennej , a następnie podzielić pewną z góry ustaloną „torebkę” wśród ekspertów na podstawie tego, jak dobrze ich priory …
10 bayesian  prior 


6
Kwartyle w programie Excel
Interesuje mnie definicja kwartylu, która jest zwykle używana, gdy jesteś w podstawowych statystykach. Mam książkę typu Stat 101, która daje intuicyjną definicję. „Około jedna czwarta danych przypada na pierwszy kwartyl lub poniżej ...”, ale daje przykład, w którym oblicza Q1, Q2 i Q3 dla zestawu danych 5, 7, 9, 10, …
10 excel  quantiles 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.