Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Problem z dowodem warunkowego oczekiwania jako najlepszego predyktora
Mam problem z dowodem E(Y|X)∈argming(X)E[(Y−g(X))2]E(Y|X)∈arg⁡ming(X)E[(Y−g(X))2]E(Y|X) \in \arg \min_{g(X)} E\Big[\big(Y - g(X)\big)^2\Big] które najprawdopodobniej ujawnią głębsze nieporozumienie oczekiwań i oczekiwań warunkowych. Dowód, który znam, wygląda następująco (inną wersję tego dowodu można znaleźć tutaj ) ===argming(X)E[(Y−g(x))2]argming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]argming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]argming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]arg⁡ming(X)E[(Y−g(x))2]=arg⁡ming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]=arg⁡ming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]=arg⁡ming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]\begin{align*} &\arg \min_{g(X)} E\Big[\big(Y - g(x)\big)^2\Big]\\ = &\arg \min_{g(X)} E \Big[ \big(Y - E(Y|X) + E(Y|X) - …

1
Jak znaleźć wartości nie podane w tabelach statystycznych (interpolować)?
Często ludzie używają programów do uzyskania wartości p, ale czasami - z jakiegokolwiek powodu - konieczne może być uzyskanie wartości krytycznej z zestawu tabel. Biorąc pod uwagę tabelę statystyczną z ograniczoną liczbą poziomów istotności i ograniczoną liczbą stopni swobody, jak uzyskać przybliżone wartości krytyczne dla innych poziomów istotności lub stopni …

5
Jaki jest najlepszy sposób na wizualizację zależności między zmiennymi dyskretnymi i ciągłymi?
Jaki jest najlepszy sposób na pokazanie związku między: zmienna ciągła i dyskretna, dwie zmienne dyskretne? Do tej pory korzystałem z wykresów rozrzutu, aby spojrzeć na związek między zmiennymi ciągłymi. Jednak w przypadku zmiennych dyskretnych punkty danych są kumulowane w określonych odstępach czasu. Zatem linia najlepszego dopasowania może być stronnicza.

3
Przykład rozkładu, w którym potrzebna jest duża wielkość próby dla centralnego twierdzenia o granicy
Niektóre książki podają, że próbka o rozmiarze 30 lub większym jest konieczna, aby centralne twierdzenie graniczne dawało dobre przybliżenie dla . X¯X¯\bar{X} Wiem, że to nie wystarczy dla wszystkich dystrybucji. Chciałbym zobaczyć kilka przykładów rozkładów, w których nawet przy dużej wielkości próbki (być może 100, 1000 lub więcej) rozkład średniej …


1
Jak traktuje się wartości „NA” w glm w R
Mam tabelę danych T1, która zawiera prawie tysiąc zmiennych (V1) i około 200 milionów punktów danych. Dane są rzadkie, a większość wpisów to NA. Każdy punkt danych ma unikalną parę identyfikatora i daty, aby odróżnić je od innych. Mam inną tabelę T2, która zawiera osobny zestaw zmiennych (V2). Ta tabela …

3
Jaka jest praktyczna różnica między regułami asocjacji a drzewami decyzyjnymi w eksploracji danych?
Czy istnieje naprawdę prosty opis praktycznych różnic między tymi dwiema technikami? Oba wydają się być używane do nadzorowanego uczenia się (chociaż reguły stowarzyszenia mogą również obsługiwać bez nadzoru). Oba można wykorzystać do przewidywania Znalazłem najbliżej „dobrego” opisu z podręcznika Statsoft . Mówią, że Reguły stowarzyszenia są używane do: ... wykrywają …




5
Jak wyświetlać słupki błędów dla eksperymentów krzyżowych (sparowanych)
Poniższy scenariusz stał się najczęściej zadawanym pytaniem w trio badacza (I), recenzenta / redaktora (R, niezwiązanego z CRAN) i mnie (M) jako twórcy fabuły. Możemy założyć, że (R) jest typowym recenzentem medycznym dużego bossa, który wie tylko, że każda fabuła musi mieć pasek błędu, w przeciwnym razie jest to błąd. …

2
Najbardziej efektywne wykorzystanie koloru w mapach ciepła / konturów
Podczas prezentacji wyników EEG czasowo-częstotliwościowych dość często używa się map ciepła / konturów. Często wybieranym schematem kolorów (i tym, który mi się podoba i którego używam) jest schemat kolorów „jet” (patrz np. Czas EEG wyszukiwania obrazów w Google ). Zastanawiam się, czy istnieją lepsze schematy kolorów do prezentacji tych wykresów …

2
Jeśli zasada prawdopodobieństwa koliduje z częstym prawdopodobieństwem, to czy odrzucamy jedno z nich?
W komentarzu zamieszczonym niedawno tutaj jeden z komentatorów wskazał na bloga Larry'ego Wassermana, który wskazuje (bez żadnych źródeł), że wnioskowanie częstych jest sprzeczne z zasadą prawdopodobieństwa. Zasada prawdopodobieństwa mówi po prostu, że eksperymenty dające podobne funkcje prawdopodobieństwa powinny dawać podobne wnioski. Dwie części tego pytania: Które części, smak lub szkoła …

1
Czy lmer () może używać splajnów jako efektów losowych?
Załóżmy, że pracujemy nad modelem efektów losowych niektórych danych zliczanych w czasie i chcemy kontrolować niektóre trendy. Zwykle zrobiłbyś coś takiego: lmer(counts ~ dependent_variable + (1+t+I(t^2)|ID), family="poisson") zawierać kwadratowy kształt dla t. Czy można zastosować bardziej wyrafinowane techniki wygładzania, takie jak wygładzanie LOESS lub splajny, aby modelować ten związek?


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.