Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Czy standardowe błędy ładowania i przedziały ufności są odpowiednie w regresjach, w których naruszone jest założenie homoscedastyczności?
Jeśli w standardowych regresjach OLS zostaną naruszone dwa założenia (normalny rozkład błędów, homoscedastyczność), to czy standardowe błędy początkowe i przedziały ufności są odpowiednią alternatywą dla uzyskania znaczących wyników w odniesieniu do znaczenia współczynników regresora? Czy testy istotności ze standardowymi błędami ładowania i przedziałami ufności nadal „działają” z heteroscedastycznością? Jeśli tak, …

1
Co jest warunkowe w tabeli awaryjnej?
Merriam-Webster Słownik definiuje warunkowe wydarzenie lub sytuację jako 1 : likely but not certain to happen : possible 2 : not logically necessary; especially : empirical 3 a : happening by chance or unforeseen causes b : subject to chance or unseen effects : unpredictable c : intended for use …

3
Klaster Big Data w R i czy próbkowanie jest istotne?
Jestem nowy w nauce o danych i mam problem ze znalezieniem klastrów w zestawie danych z 200 000 wierszy i 50 kolumnami w R. Ponieważ dane mają zarówno zmienne liczbowe, jak i nominalne, metody takie jak K-średnie, które wykorzystują euklidesową miarę odległości, nie wydają się właściwym wyborem. Zwracam się więc …




3
Suma dwóch niezależnych zmiennych losowych gamma
Zgodnie z artykułem Wikipedii na temat dystrybucji gamma : Jeśli i , gdzie i są niezależnymi zmiennymi losowymi, to .Y ∼ G a m m a ( b , θ ) X Y X + Y ∼ G a m m a ( a + b , θ )X∼Gamma(a,θ)X∼Gamma(a,θ)X\sim\mathrm{Gamma}(a,\theta)Y∼Gamma(b,θ)Y∼Gamma(b,θ)Y\sim\mathrm{Gamma}(b,\theta)XXXYYYX+Y∼Gamma(a+b,θ)X+Y∼Gamma(a+b,θ)X+Y\sim \mathrm{Gamma}(a+b, …

3
Statystyka F, wartość krytyczna F i wartość P.
Jestem bardzo nowy w tym obszarze i mam trudności ze zrozumieniem koncepcji odrzucenia hipotezy zerowej na podstawie wyników z tabeli ANOVA. Jak obliczona wartość F i wartość krytyczna odnoszą się do wartości p? A jeśli obliczone F jest większe niż 1, czy to zawsze oznacza, że ​​hipotezę zerową należy odrzucić, …
13 anova 



2
O co chodzi z autokorelacją?
Na wstępie mam dość głębokie podstawy matematyczne, ale tak naprawdę nigdy nie zajmowałem się szeregami czasowymi ani modelowaniem statystycznym. Więc nie musisz być dla mnie bardzo delikatny :) Czytam ten artykuł o modelowaniu zużycia energii w budynkach komercyjnych, a autor twierdzi, że: [Obecność autokorelacji powstaje], ponieważ model został opracowany na …

1
Zrozumienie prognoz regresji logistycznej
Moje przewidywania pochodzące z modelu regresji logistycznej (glm w R) nie są ograniczone od 0 do 1, jak bym się spodziewał. Rozumiem, że regresja logistyczna polega na tym, że parametry wejściowe i modelowe są łączone liniowo, a odpowiedź jest przekształcana w prawdopodobieństwo za pomocą funkcji logit link. Ponieważ funkcja logit …


2
Jak daleko zaprowadzi mnie samokształcenie?
Nigdy nie brałem udziału w oficjalnym lub ustrukturyzowanym kursie analizy danych lub uczenia maszynowego (innym niż ostatnie oferty online) i nauczyłem się większości tego, co wiem, czytając i wypróbowując różne rzeczy. Wiem, że daleko mi do znalezienia pracy. Moje pytanie nie jest takie, które jest lepsze ( jak to pytanie …

1
Algebra LDA. Siła dyskryminacji Fishera zmiennej i liniowej analizy dyskryminacyjnej
Widocznie, analiza Fishera ma jednocześnie na celu maksymalizację rozdziału między klasami, przy jednoczesnym zminimalizowaniu dyspersji wewnątrz klasy. Przydatną miarą mocy dyskryminacyjnej zmiennej jest zatem wielkość przekątna: .bja ja/ Wja jaBii/WiiB_{ii}/W_{ii} http://root.cern.ch/root/htmldoc/TMVA__MethodFisher.html I rozumieć, że wielkość ( p x p) z Między ( B ), a W klasie ( W ) …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.