Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Termin interakcji z wykorzystaniem analizy regresji hierarchicznej zmiennych centrowanych? Jakie zmienne powinniśmy wyśrodkować?
Przeprowadzam hierarchiczną analizę regresji i mam małe wątpliwości: Czy obliczamy termin interakcji za pomocą zmiennych centrowanych? Czy musimy wyśrodkować WSZYSTKIE zmienne ciągłe, które mamy w zbiorze danych, oprócz zmiennej zależnej? Kiedy musimy rejestrować niektóre zmienne (ponieważ ich wartość sd jest znacznie wyższa niż ich średnia), to czy centrujemy zmienną, która …

4
Jeśli mam wiele pozytywnych, nieistotnych wyników, mogę przetestować „przynajmniej
Powiedzmy, że uruchomiłem tę samą regresję osobno dla 100 różnych osób. Moje współczynniki zainteresowania są dodatnie (i całkiem różne od siebie), ale statystycznie nieistotne we wszystkich 100 wynikach (powiedzmy, że każda wartość p = 0,11). Czy istnieje sposób na połączenie tych wartości p w celu stwierdzenia, że ​​„co najmniej 80 …

2
W jaki sposób mundur wcześniejszy prowadzi do tych samych szacunków na podstawie maksymalnego prawdopodobieństwa i trybu z tyłu?
Badam różne metody szacowania punktowego i czytam, że kiedy używam oszacowań MAP vs ML, kiedy używamy „jednolitego wcześniejszego”, oszacowania są identyczne. Czy ktoś może wyjaśnić, czym jest „jednolity” uprzedni i podać (proste) przykłady, kiedy estymatory MAP i ML będą takie same?

2
Jak najlepiej obsługiwać wyniki cząstkowe w metaanalizie?
Przeprowadzam metaanalizę wielkości efektu dw R za pomocą pakietu metafor. d reprezentuje różnice w wynikach pamięci między pacjentami a zdrowymi. Jednak niektóre badania donoszą jedynie o wynikach zainteresowania d (np. Kilka różnych wyników pamięci lub wyników z trzech oddzielnych bloków testowania pamięci). Zapoznaj się z poniższym zestawem danych pozornych, gdzie …

4
Dlaczego pierwiastek kwadratowy jest pobierany dla liczby próbek „N” we wzorze odchylenia standardowego?
Próbuję zrozumieć bardzo podstawową koncepcję odchylenia standardowego. Ze wzoru σ=∑i=1n(xi−μ)2N−−−−−−−−−−⎷σ=∑i=1n(xi−μ)2N\sigma= \sqrt{ \dfrac{ \sum\limits_{i=1}^n (x_i-\mu)^2} N } Nie rozumiem, dlaczego powinniśmy zmniejszyć o połowę populację „N”, tj. Dlaczego chcemy wziąć N−−√N\sqrt{N} kiedy tego nie zrobiliśmy N2N2{N^2}? Czy to nie wypacza populacji, którą rozważamy? To nie powinna być formuła σ=∑i=1n(xi−μ)2−−−−−−−−−√Nσ=∑i=1n(xi−μ)2N\sigma= \dfrac{ \sqrt{ …

3
Problem zabawki z regresją procesu Gaussa
Próbowałem uzyskać intuicję w regresji procesu Gaussa, więc podjąłem prosty problem z zabawką 1D, aby wypróbować. wziąłemxja= { 1 , 2 , 3 }xja={1,2),3)}x_i=\{1,2,3\} jako dane wejściowe, oraz yja= { 1 , 4 , 9 }yi={1,4,9}y_i=\{1,4,9\}jako odpowiedzi. („Inspirowane” zy=x2)y=x2y=x^2) Do regresji użyłem standardowej kwadratowej wykładniczej funkcji jądra: k (xp,xq) =σ2)faexp( …

2
Szanse i ilorazy szans w regresji logistycznej
Mam trudności ze zrozumieniem jednego wyjaśnienia regresji logistycznej. Regresja logistyczna zachodzi między temperaturą a rybami, które giną lub nie giną. Nachylenie regresji logistycznej wynosi 1,76. Następnie szanse, że umrą ryby, wzrosną o współczynnik exp (1,76) = 5,8. Innymi słowy, szanse, że ryby umrą, wzrosną pięciokrotnie w przypadku każdej zmiany temperatury …

1
Czy skorygowany R-kwadrat ma na celu oszacowanie ustalonego wyniku lub populacji losowego wyniku r-kwadrat?
Populacja r-kwadrat ρ2)ρ2)\rho^2 można zdefiniować przy założeniu wyników stałych lub wyników losowych: Naprawiono wyniki: Wielkość próby i poszczególne wartości predyktorów są utrzymywane na stałym poziomie. A zatem,ρ2)faρfa2)\rho^2_f jest proporcją wariancji wyjaśnioną w wyniku równaniem regresji populacji, gdy wartości predyktora są utrzymywane na stałym poziomie. Losowe wyniki: Konkretne wartości predyktorów pochodzą …



2
Co to jest kopuła adaptacyjna?
Moje podstawowe pytanie brzmi: co to jest kopuła adaptacyjna? Mam slajdy z prezentacji (niestety nie mogę zapytać autora slajdów) o kopiach adaptacyjnych i nie rozumiem, co to znaczy resp. do czego to jest dobre? Oto slajdy: Następnie slajdy kontynuują test punktu zmiany. Zastanawiam się, o co chodzi i dlaczego potrzebuję …

1
Pytanie o ważenie wariancji odwrotnej
Załóżmy, że chcemy wnioskować na podstawie nieobserwowanej realizacji losowej zmiennej , która normalnie jest dystrybuowana ze średnią i wariancją . Załóżmy, że istnieje inna zmienna losowa (której nieobserwowaną realizację podobnie nazywamy ), która jest normalnie dystrybuowana ze średnią i wariancją . Niech będzie kowariancją i .xxxx~x~\tilde xμxμx\mu_xσ2xσx2\sigma^2_xy~y~\tilde yyyyμyμy\mu_yσ2yσy2\sigma^2_yσxyσxy\sigma_{xy}x~x~\tilde xy~y~\tilde y …

1
Unikalny (?) Pomysł na prognozowanie sprzedaży
Pracuję nad opracowaniem modelu do przewidywania całkowitej sprzedaży produktu. Mam około półtora roku rezerwacji, więc mógłbym przeprowadzić standardową analizę szeregów czasowych. Mam jednak również wiele danych na temat każdej „możliwości” (potencjalnej sprzedaży), która została zamknięta lub utracona. „Możliwości” są realizowane etapami rurociągu, dopóki nie zostaną zamknięte lub utracone; powiązali również …


1
Integracja Monte Carlo dla funkcji całkowitych niekwadratowych
Mam nadzieję, że jest to właściwe miejsce, aby zapytać, jeśli nie, możesz przenieść je na bardziej odpowiednie forum. Od dłuższego czasu zastanawiam się, jak traktować funkcje całkowite niekwadratowe z integracją Monte Carlo. Wiem, że MC nadal podaje prawidłowe oszacowanie, ale błąd jest nierealny (rozbieżny?) Dla tego rodzaju funkcji. Ograniczmy nas …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.