Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


2
Twierdzenie Gaussa-Markowa: NIEBIESKI i OLS
Czytam o twierdzeniu Guassa-Markowa na wikipedii i miałem nadzieję, że ktoś może mi pomóc ustalić główny punkt tego twierdzenia. Zakładamy, że model liniowy w postaci macierzy podaje: i szukamy NIEBIESKIEGO, .y= Xβ+ ηy=Xβ+η y = X\beta +\eta βˆβ^ \widehat\beta Zgodnie z tym , to, że etykieta "pozostałych" i przycisków "błąd". …

3
Jaka jest statystyka testowa w dokładnym teście Fishera?
W przypadku tabeli awaryjnej 2 na 2 niektórzy powiedzieli, że dokładny test Fishera wykorzystuje liczbę w komórce (1,1) w tabeli jako statystykę testu, a pod hipotezą zerową będzie mieć rozkład hipergeometryczny.X1 , 1X1,1X_{1,1}X1 , 1X1,1X_{1,1} Niektórzy twierdzą, że jego statystyki testowe to gdzie jest średnią rozkładu hipergeometrycznego (wspomnianego powyżej) pod …

2
Hipoteza zerowa Manna-Whitneya przy nierównej wariancji
Jestem tylko ciekawy hipotezy zerowej testu U Manna-Whitneya. Często widzę, że stwierdzono, iż hipoteza zerowa mówi, że dwie populacje mają równe rozkłady. Ale myślę - gdybym miał dwie normalne populacje o tej samej średniej, ale niezwykle nierównej wariancji, test Manna-Whitneya prawdopodobnie nie wykryłby tej różnicy. Widziałem także, że stwierdzono, iż …

1
Sumy kwadratów typu III
Muszę modelu regresji liniowej z jednym skategoryzowany (mężczyzn i kobiet), a jeden bezstopniowej .AAABBB Skonfigurowałem kody kontrastowe w R z options(contrasts=c("contr.sum","contr.poly")). A teraz mam sumy kwadratów typu III dla , B i ich interakcji (A: B) za pomocą .AAABBBdrop1(model, .~., test="F") Co ja skazani sposób sumy kwadratów jest obliczana dla …


2
Solidne oszacowanie średnie z wydajnością aktualizacji O (1)
Szukam dokładnego oszacowania średniej, która ma określoną właściwość. Mam zestaw elementów, dla których chcę obliczyć tę statystykę. Następnie dodaję nowe elementy pojedynczo i dla każdego dodatkowego elementu chciałbym ponownie obliczyć statystyki (znane również jako algorytm online). Chciałbym, aby to obliczenie aktualizacji było szybkie, najlepiej O (1), tzn. Nie zależy od …

1
EFA wyraźnie wspiera jeden czynnik, środek jest wewnętrznie spójny, ale CFA ma słabe dopasowanie?
Badam właściwości psychometryczne 10-elementowej miary samoopisu. Mam około 400 przypadków w dwóch niezależnych próbach. Przedmioty są uzupełniane w 4-punktowej skali Likerta. EFA wyraźnie wspiera rozwiązanie jednoczynnikowe (np. Pierwsza wartość własna powyżej 6, wszystkie inne poniżej 1), a wartość alfa Cronbacha jest dobra (np. 0,90). Żaden element nie ma niskiej korelacji …

2
Prognoza ARIMA z sezonowością i trendem, dziwny wynik
gdy wkraczam w prognozowanie z modelami ARIMA, staram się zrozumieć, jak mogę poprawić prognozę opartą na dopasowaniu ARIMA do sezonowości i dryfu. Moje dane to następujące szeregi czasowe (ponad 3 lata, z wyraźnym trendem wzrostowym i widoczną sezonowością, która wydaje się nie być wspierana przez autokorelację w opóźnieniach 12, 24, …

1
Określ nieznaną liczbę rzeczywistych lokalizacji na podstawie raportów opartych na GPS
Pracuję nad oprogramowaniem, które powinno określać lokalizacje świata rzeczywistego (np. Kamery prędkości) na podstawie kilku raportów opartych na GPS . Zgłaszając lokalizację użytkownik będzie jechał samochodem, dlatego raporty będą bardzo niedokładne. Aby rozwiązać ten problem, muszę grupować raporty dotyczące tej samej lokalizacji i obliczać średnią. Moje pytanie dotyczy sposobu grupowania …


1
Dynamiczne dopasowanie czasu i normalizacja
Korzystam z dynamicznego dopasowywania czasu, aby dopasować „zapytanie” i krzywą „szablonu” i jak dotąd mam rozsądny sukces, ale mam kilka podstawowych pytań: Oceniam „dopasowanie”, oceniając, czy wynik DTW jest mniejszy niż pewna wartość progowa, którą wymyślam heurystycznie. Czy to jest ogólne podejście do określania „dopasowania” za pomocą DTW? Jeśli nie, …


2
Wzór Doane'a na binowanie histogramów
Wdrażam różne algorytmy, aby oszacować najlepszą liczbę pojemników do użycia w histogramach. Większość z tych, które wdrażam, opisano na stronie „Histogram” w Wikipedii w sekcji „ Liczba pojemników i szerokość ” *. Utknąłem na problem z formułą Doane'a: 1 + log(n) + log(1 + kurtosis(data) * sqrt(n / 6.)) gdzie …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.