Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych



3
Strategia dopasowania wysoce nieliniowej funkcji
Do analizy danych z eksperymentu biofizyki próbuję obecnie dopasować krzywą za pomocą wysoce nieliniowego modelu. Funkcja modelu wygląda następująco: y= a x + b x- 1 / 2y=ax+bx−1/2y = ax + bx^{-1/2} Tutaj szczególnie duże znaczenie ma wartość .bbb Wykres dla tej funkcji: (Zauważ, że funkcja modelu opiera się na …



3
Czy korelacja lub współczynnik determinacji odnoszą się do odsetka wartości, które mieszczą się wzdłuż linii regresji?
Korelacja jest miarą liniowego powiązania między dwiema zmiennymi. Współczynnik determinacji, , jest miarą tego, jak dużą zmienność jednej zmiennej można „wyjaśnić” zmiennością drugiej.r 2rrrr2)r2r^2 Na przykład, jeśli jest korelacją między dwiema zmiennymi, to . Stąd 64% zmienności w jednym z nich można wytłumaczyć różnicami w drugim. Dobrze?r 2 = 0,64r …

2
Jakie są kompletne wystarczające statystyki?
Mam problem ze zrozumieniem pełnej wystarczającej statystyki? Niech będzie wystarczającą statystyką.T=ΣxiT=ΣxiT=\Sigma x_i Jeśli z prawdopodobieństwem 1, dla niektórych funkcji g , jest to kompletna wystarczająca statystyka.E[g(T)]=0E[g(T)]=0E[g(T)]=0ggg Ale co to znaczy? Widziałem przykłady uniformów i Bernoulli (strona 6 http://amath.colorado.edu/courses/4520/2011fall/HandOuts/umvue.pdf ), ale nie jest to intuicyjne, bardziej się zdezorientowałem widząc integrację. Czy …

2
Dlaczego zwiększenie liczby funkcji zmniejsza wydajność?
Próbuję uzyskać intuicję, dlaczego zwiększenie liczby funkcji może obniżyć wydajność. Obecnie używam klasyfikatora LDA, który sprawdza się lepiej w przypadku niektórych funkcji, ale gorzej, gdy patrzy się na więcej funkcji. Moja dokładność klasyfikacji jest przeprowadzana przy użyciu stratyfikowanego 10-krotnego xval. Czy istnieje prosty przypadek, w którym klasyfikator działałby lepiej w …


1
Jak obliczyć „Ścieżki do białego domu” za pomocą R?
Właśnie natrafiłem na tę świetną analizę, która jest zarówno interesująca, jak i piękna wizualnie: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html Ciekawe, jak można zbudować takie „drzewo ścieżki” za pomocą R. Jakie dane i algorytm potrzebne są do zbudowania takiego drzewa ścieżki? Dzięki.

1
Odznaczanie danych zliczania
Użyłem stl () w R, aby rozłożyć dane zliczania na składniki trendu, sezonowości i nieregularności. Wynikowe wartości trendu nie są już liczbami całkowitymi. Mam następujące pytania: Czy funkcja stl () jest odpowiednim sposobem na zdezasonalizowanie danych zliczania? Ponieważ wynikowy trend nie jest już wyceniany przez interger, czy mogę użyć lm …

1
AIC dla modeli nie zagnieżdżonych: stała normalizująca
AIC jest zdefiniowane jako , gdzie jest estymatorem największego prawdopodobieństwa, a jest wymiarem przestrzeni parametrów. Do oszacowania zwykle pomija się stały współczynnik gęstości. Jest to czynnik, który nie zależy od parametrów, w celu uproszczenia prawdopodobieństwa. Z drugiej strony czynnik ten jest bardzo ważny przy obliczaniu AIC, biorąc pod uwagę, że …



2
Losowy las: co, jeśli wiem, że zmienna jest ważna
Rozumiem, że losowy las wybiera losowo zmienne mtry do zbudowania każdego drzewa decyzyjnego. Jeśli więc mtry = ncol / 3, wówczas każda zmienna zostanie użyta średnio w 1/3 drzew. I 2/3 drzew ich nie wykorzysta. Ale co, jeśli wiem, że jedna zmienna jest prawdopodobnie bardzo ważna, czy dobrze byłoby ręcznie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.