Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Model liniowy Heteroscedastyczność
Mam następujący model liniowy: Aby rozwiązać problem heteroscedastyczności resztek, próbowałem zastosować transformację logu do zmiennej zależnej jako ale nadal widzę ten sam efekt rozłożenia na resztki. Wartości DV są stosunkowo małe, więc stałe dodanie +1 przed pobraniem dziennika prawdopodobnie nie jest w tym przypadku właściwe.log( Y+ 1 )log⁡(Y+1)\log(Y + 1) …

3
Czy dwumianowy wyświetlacz wielkości efektu (BESD) wprowadza w błąd reprezentację wielkości efektu?
Trudno mi zaakceptować, że Donald Rubin kiedykolwiek wymyśli prawdziwą cytrynę techniki. Ale takie jest moje postrzeganie BESD [ 1 , 2 , 3 ]. Oryginalny artykuł Rosenthala i Rubina (1982) twierdził, że warto wykazać „jak przekształcić dowolną korelację momentu produktu w taki wyświetlacz [2x2], niezależnie od tego, czy oryginalne dane …

3
Jak prognozować na podstawie zagregowanych danych w nieregularnych odstępach czasu?
Staram się prognozować sprzedaż produktów w automatach. Problem polega na tym, że maszyna jest napełniana w nieregularnych odstępach czasu i przy każdym napełnieniu możemy rejestrować tylko zagregowaną sprzedaż od ostatniego napełnienia maszyny (tj. Nie mamy danych o codziennej sprzedaży). Zasadniczo mamy dane dotyczące zagregowanej sprzedaży w nieregularnych odstępach czasu. Odstępy …

1
Poza jądrem Fishera
Przez pewien czas wydawało się, że jądra Fishera mogą stać się popularne, ponieważ wydają się być sposobem na konstruowanie jąder z modeli probabilistycznych. Rzadko jednak widywałem je w praktyce i mam dobry autorytet, że nie działają zbyt dobrze. Opierają się na obliczeniach Fisher Information - cytując Wikipedię: informacja Fishera jest …



3
Automatyczne czyszczenie danych
Częstym problemem jest brak dobrej jakości danych ML: błędy w wartościach funkcji, błędne klasyfikacje instancji itp. Jednym ze sposobów rozwiązania tego problemu jest ręczne przejrzenie danych i sprawdzenie, ale czy istnieją inne techniki? (Założę się, że są!) Które są lepsze i dlaczego?

1
Pomoc w modelowaniu SEM (OpenMx, polycor)
Mam wiele problemów z jednym zestawem danych, do którego próbuję zastosować SEM. Przypuszczamy istnienie 5 ukrytych czynników A, B, C, D, E ze wskaźnikami odpowiednio. A1 do A5 (czynniki uporządkowane), B1 do B3 (ilościowo), C1, D1, E1 (wszystkie trzy ostatnie czynniki uporządkowane, z tylko 2 poziomami dla E1. Interesują nas …

3
Podejścia przy uczeniu się z ogromnych zestawów danych?
Zasadniczo istnieją dwa typowe sposoby uczenia się przeciwko ogromnym zestawom danych (gdy napotykasz ograniczenia czasowe / przestrzenne): Oszukiwanie :) - użyj tylko „zarządzalnego” podzbioru do treningu. Utrata dokładności może być nieistotna z uwagi na prawo malejących zwrotów - predykcyjne działanie modelu często spłaszcza się na długo przed włączeniem do niego …


1
Czy MFCC są optymalną metodą reprezentowania muzyki w systemie pobierania?
Technika przetwarzania sygnału, Mel Cepstrum , jest często używana do wydobywania informacji z utworu muzycznego w celu wykorzystania go w zadaniu uczenia maszynowego. Ta metoda daje krótkoterminowe spektrum mocy, a współczynniki są wykorzystywane jako dane wejściowe. Przy projektowaniu systemów wyszukiwania muzyki takie współczynniki są uważane za charakterystyczne dla danego utworu …

3
Oczekiwana liczba rzutów monetą, aby uzyskać N z rzędu, biorąc pod uwagę M z rzędu
Interviewstreet miał swój drugi CodeSprint w styczniu, który zawierał poniższe pytanie. Odpowiedź programowa jest opublikowana, ale nie zawiera wyjaśnienia statystycznego. (Możesz zobaczyć oryginalny problem i opublikowane rozwiązanie, logując się na stronie Interviewstreet przy użyciu danych Google, a następnie przechodząc do problemu Monety na tej stronie ). Monety Monety Masz bezstronną …

3
Powtarzane miary modelowania równań strukturalnych
Muszę przeanalizować zbiór danych dotyczących rehabilitacji klinicznej. Interesują mnie oparte na hipotezie związki między skwantyfikowanym „wkładem” (ilością terapii) a zmianami stanu zdrowia. Chociaż zbiór danych jest stosunkowo niewielki (n ~ 70), powtórzyliśmy dane odzwierciedlające zmiany czasowe w obu przypadkach. Jestem zaznajomiony z nieliniowym modelowaniem efektów mieszanych w R, jednak interesują …

2
Przedział ufności dla chi-kwadrat
Próbuję znaleźć rozwiązanie, aby porównać dwa testy „dobroci dopasowania chi-kwadrat”. Dokładniej, chcę porównać wyniki z dwóch niezależnych eksperymentów. W tych eksperymentach autorzy wykorzystali chi-kwadrat dobroci dopasowania, aby porównać losowe zgadywanie (częstotliwości oczekiwane) z częstotliwościami obserwowanymi. Dwa eksperymenty otrzymały taką samą liczbę uczestników, a procedury eksperymentalne są identyczne, zmieniono tylko bodźce. …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.