Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
test t na mocno wypaczonych danych
Mam zestaw danych z dziesiątkami tysięcy obserwacji danych o kosztach medycznych. Te dane są mocno przekrzywione w prawo i mają dużo zer. Wygląda to tak dla dwóch grup osób (w tym przypadku dwa przedziały wiekowe z> 3000 obs każda): Min. 1st Qu. Median Mean 3rd Qu. Max. 0.0 0.0 0.0 …

1
Jak radzić sobie z maszyną SVM z atrybutami kategorialnymi
Mam przestrzeń 35 wymiarów (atrybutów). Mój problem analityczny jest prosty. Spośród 35 wymiarów ponad 25 ma charakter kategoryczny, a każdy atrybut przyjmuje ponad 50 typów wartości. W tym scenariuszu wprowadzenie zmiennej zastępczej również nie będzie dla mnie działać. Jak mogę uruchomić SVM na przestrzeni, która ma wiele atrybutów jakościowych?


4
Jak można opracować regułę zatrzymania w analizie mocy dwóch niezależnych proporcji?
Jestem programistą pracującym nad systemami testowymi A / B. Nie mam solidnych statystyk, ale zbierałem wiedzę w ciągu ostatnich kilku miesięcy. Typowy scenariusz testowy polega na porównaniu dwóch adresów URL na stronie internetowej. Odwiedzający odwiedza, LANDING_URLa następnie jest losowo przekazywany do jednego URL_CONTROLlub jednego URL_EXPERIMENTAL. Odwiedzający stanowi próbkę, a warunek …

5
Czy statystycy zakładają, że nie da się podlać rośliny, czy po prostu używam złych kryteriów wyszukiwania dla regresji krzywoliniowej?
Prawie wszystko, co czytam o regresji liniowej i GLM sprowadza się do tego: gdzie f ( x , β ) jest nie rosnącą lub nie malejącą funkcją x, a β jest parametrem, który oceniasz i testujesz hipotezy na temat. Istnieją dziesiątki funkcji łączenia i przekształceń y i x, dzięki którym …


3
Macierz wariancji-kowariancji w lmer
Wiem, że jedną z zalet modeli mieszanych jest to, że pozwalają one określić macierz wariancji-kowariancji dla danych (symetria złożona, autoregresja, nieustrukturyzowana itp.). Jednak lmerfunkcja w R nie pozwala na łatwą specyfikację tej macierzy. Czy ktoś wie, która struktura lmerużywa domyślnie i dlaczego nie ma sposobu, aby ją łatwo określić?

2
Dlaczego matryca Fisher Information jest pozytywnie półfinałowa?
Niech . Matrycę informacji Fisher definiuje się jako:θ∈Rnθ∈Rn\theta \in R^{n} I(θ)i,j=−E[∂2log(f(X|θ))∂θi∂θj∣∣∣θ]I(θ)i,j=−E[∂2log⁡(f(X|θ))∂θi∂θj|θ]I(\theta)_{i,j} = -E\left[\frac{\partial^{2} \log(f(X|\theta))}{\partial \theta_{i} \partial \theta_{j}}\bigg|\theta\right] Jak mogę udowodnić, że Matryca Informacyjna Fishera jest dodatnia półfinałowa?

1
Czym skrajny losowy las różni się od losowego lasu?
Czy ER jest bardziej wydajne w realizacji (może Extreme Gradient Boostingto być zwiększenie gradientu) - czy różnica jest ważna z praktycznego punktu widzenia? Istnieje pakiet R, który je implementuje. Czy to nowy algorytm, który pokonuje implementację „ogólną” (pakiet RandomForest od R) nie tylko pod względem wydajności, czy też w niektórych …

2
Duża różnica zdań w oszacowaniu nachylenia, gdy grupy są traktowane jako losowe vs. ustalone w modelu mieszanym
Rozumiem, że używamy modeli efektów losowych (lub efektów mieszanych), gdy uważamy, że niektóre parametry modelu zmieniają się losowo w zależności od czynnika grupującego. Chcę dopasować model, w którym odpowiedź została znormalizowana i wyśrodkowana (nie idealnie, ale całkiem blisko) w obrębie czynnika grupującego, ale zmienna niezależna xnie została w żaden sposób …

1
Centralne twierdzenie graniczne i prawo wielkich liczb
Mam pytanie od bardzo początkującego dotyczące centralnego twierdzenia granicznego (CLT): Wiem, że CLT stwierdza, że ​​średnia iid zmiennych losowych ma w przybliżeniu rozkład normalny (dla , gdzie n jest indeksem sum) lub że znormalizowana zmienna losowa miałaby standardowy rozkład normalny.n → ∞n→∞n \to \inftynnn Teraz prawo dużej liczby mówi z …


9
Odległości Mahalanobisa parami
Muszę obliczyć przykładową odległość Mahalanobisa w R pomiędzy każdą parą obserwacji w macierzy współzmiennych . Potrzebuję rozwiązania, które jest wydajne, tj. Obliczane są tylko odległości, a najlepiej realizowane w C / RCpp / Fortran itp. Zakładam, że , macierz kowariancji populacyjnej, jest nieznana i wykorzystuję próbkę macierz kowariancji na swoim …
18 r  algorithms  distance 

1
Jak radzić sobie z wysoką korelacją między predyktorami w regresji wielokrotnej?
Znalazłem odniesienie w artykule, który brzmi: Według Tabachnick i Fidell (1996) zmienne niezależne o korelacji dwuwymiarowej większej niż 0,70 nie powinny być uwzględniane w analizie regresji wielokrotnej. Problem: Użyłem w układzie regresji wielokrotnej 3 zmiennych skorelowanych> .80, VIF na poziomie około .2 - .3, Tolerancja ~ 4- 5. Nie mogę …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.