Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

5
Co przedziały ufności mówią o precyzji (jeśli w ogóle)?
Morey i in. (2015) twierdzą, że przedziały ufności są mylące i istnieje wiele błędów związanych z ich zrozumieniem. Między innymi opisują błąd precyzji jako: Błąd Precyzji Szerokość przedziału ufności wskazuje na dokładność naszej wiedzy o parametrze. Wąskie przedziały ufności pokazują dokładną wiedzę, a szerokie błędy ufności pokazują nieprecyzyjną wiedzę. Nie …

4
Czy mniejsze wartości p są bardziej przekonujące?
Czytałem o wartościach , wskaźnikach błędów typu 1, poziomach istotności, obliczeniach mocy, wielkościach efektów i debacie Fisher vs Neyman-Pearson. To sprawiło, że poczułem się trochę przytłoczony. Przepraszam za ścianę tekstu, ale czułem, że konieczne było przedstawienie mojego obecnego zrozumienia tych pojęć, zanim przejdę do moich faktycznych pytań.ppp Z tego, co …

5
Zalecenia dotyczące koloru i grubości linii dla wykresów linii
Wiele napisano na temat wyboru kolorów przyjaznych dla ślepych kolorów dla map, wielokątów i ogólnie zacienionych regionów (patrz na przykład http://colorbrewer2.org ). Nie byłem w stanie znaleźć zaleceń dotyczących kolorów linii i różnej grubości linii dla wykresów linii. Cele to: łatwo rozróżniają linie, nawet gdy się przeplatają linie są łatwe …


4
Dlaczego niższe wartości p nie stanowią więcej dowodów przeciwko zeru? Argumenty z Johansson 2011
Johansson (2011) w „ Zdrowaś niemożliwe: wartości p, dowody i prawdopodobieństwo ” (tutaj również link do czasopisma ) stwierdza, że ​​niższe wartości są często uważane za silniejsze dowody przeciw zerowej wartości. Johansson sugeruje, że ludzie uznaliby dowody przeciwko wartości zerowej za silniejsze, gdyby ich test statystyczny dał wartość , niż …


2
Jaka jest różnica między „głębokim uczeniem się” a modelowaniem wielopoziomowym / hierarchicznym?
Czy „głębokie uczenie się” to kolejny termin na modelowanie wielopoziomowe / hierarchiczne? Jestem znacznie bardziej zaznajomiony z tym drugim niż ten pierwszy, ale z tego, co mogę powiedzieć, podstawowa różnica nie polega na ich definicji, ale na tym, jak są one używane i oceniane w ich domenie aplikacji. Wygląda na …

1
Jakie są przydatne wskazówki dotyczące parametrów GBM?
Jakie są przydatne wskazówki dotyczące testowania parametrów (tj. Głębokość interakcji, dziecko, częstotliwość próbkowania itp.) Za pomocą GBM? Powiedzmy, że mam 70-100 funkcji, populację 200 000 i zamierzam przetestować głębokość interakcji 3 i 4. Oczywiście muszę przeprowadzić testy, aby zobaczyć, która kombinacja parametrów najlepiej trzyma się poza próbą. Wszelkie sugestie dotyczące …

1
Redukcja wymiarów (SVD lub PCA) na dużej, rzadkiej matrycy
/ edit: Dalsze działania teraz możesz użyć irlba :: prcomp_irlba / edit: śledzenie mojego własnego posta. irlbama teraz argumenty „środkowy” i „skalowany”, które pozwalają go używać do obliczania podstawowych składników, np .: pc <- M %*% irlba(M, nv=5, nu=0, center=colMeans(M), right_only=TRUE)$v Mam dużą różnorodność Matrixfunkcji, których chciałbym użyć w algorytmie …

8
Zamieniając wartości odstające na średnie
To pytanie zadał mój przyjaciel, który nie jest obeznany z Internetem. Nie mam statystyk i szukałem w Internecie tego pytania. Pytanie brzmi: czy możliwe jest zastąpienie wartości odstających wartością średnią? jeśli to możliwe, czy są jakieś odniesienia do książek / czasopisma, na których można sporządzić kopię tego oświadczenia?

2
Jak wykreślić granicę decyzyjną klasyfikatora k-najbliższego sąsiada na podstawie elementów uczenia statystycznego?
Chcę wygenerować fabułę opisaną w książce ElemStatLearn „Elementy statystycznego uczenia się: eksploracja danych, wnioskowanie i przewidywanie. Drugie wydanie” Trevora Hastiego i Roberta Tibshirani i Jerome Friedmana. Fabuła jest: Zastanawiam się, jak mogę stworzyć ten dokładny wykres R, szczególnie zwróć uwagę na grafikę i obliczenia siatki, aby pokazać granicę.

2
Wariancja iloczynu zmiennych zależnych
Jaki jest wzór na wariancję iloczynu zmiennych zależnych? W przypadku zmiennych niezależnych formuła jest prosta: v a r (XY) = E( X2)Y2)) - E( XY)2)= v a r ( X) v a r ( Y) + v a r ( X) E( Y)2)+ v a r ( Y) E( X)2)var(XY)=E(X2Y2)−E(XY)2=var(X)var(Y)+var(X)E(Y)2+var(Y)E(X)2 …

3
Odrzucenie opartej na entropii paradoksu czasu Bayesa do tyłu Shaliziego?
W tym artykule utalentowany badacz Cosma Shalizi przekonuje, że aby w pełni zaakceptować subiektywny pogląd bayesowski, należy również zaakceptować niefizyczny wynik, że strzałka czasu (podana przez przepływ entropii) powinna faktycznie cofnąć się . Jest to głównie próba argumentacji przeciwko maksymalnemu entropii / w pełni subiektywnemu poglądowi Bayesa przedstawionemu i spopularyzowanemu …

5
Wykrywanie znaczących predyktorów spośród wielu zmiennych niezależnych
W zbiorze danych dwóch nie pokrywających się populacji (pacjenci i osoby zdrowe, ogółem n=60n=60n=60 ) chciałbym znaleźć (spośród zmiennych niezależnych) znaczące predyktory dla zmiennej zależnej ciągłej. Występuje korelacja między predyktorami. Chcę dowiedzieć się, czy któryś z predyktorów jest powiązany ze zmienną zależną „w rzeczywistości” (zamiast przewidywać zmienną zależną tak dokładnie, …

5
Jaka jest różnica między „wartością średnią” a „średnią”?
Wikipedia wyjaśnia: W przypadku zestawu danych średnia to suma wartości podzielona przez liczbę wartości. Ta definicja odpowiada jednak temu, co nazywam „przeciętnym” (przynajmniej tak pamiętam naukę). Jeszcze Wikipedia cytuje: Istnieją inne miary statystyczne, które wykorzystują próbki, które niektórzy mylą ze średnimi - w tym „mediana” i „tryb”. To mylące. Czy …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.