Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Czy kiedykolwiek istnieje powód, aby nie stosować ortogonalnych wielomianów podczas dopasowywania regresji?
Ogólnie zastanawiam się, czy kiedykolwiek lepiej nie używać ortogonalnych wielomianów podczas dopasowywania regresji do zmiennych wyższego rzędu. W szczególności zastanawiam się nad użyciem R: Jeśli poly()z raw = FALSEprodukuje te same wartości, montowany poly()z raw = TRUEoraz polyz raw = FALSErozwiązuje niektóre z problemów związanych z wielomianowej regresji, to należy …

2
Dyskretna jednolita zmienna losowa (?) Przyjmująca wszystkie wartości wymierne w zamkniętym przedziale
Właśnie miałem (intelektualny) atak paniki. Ciągła zmienna losowa, która następuje po mundurze w zamkniętym przedziale : wygodnie znana koncepcja statystyczna. U( a , b )U(a,b)U(a,b) Ciągły jednolity rv mający wsparcie nad rozszerzonymi rzeczywistymi (połową lub całością): nie odpowiedni rv, ale podstawowa koncepcja bayesowska na niewłaściwe wcześniejsze, użyteczne i możliwe do …

3
Modelowe założenia regresji cząstkowej metodą najmniejszych kwadratów (PLS)
Próbuję znaleźć informacje dotyczące założeń regresji PLS (pojedynczy yyy ). Szczególnie interesuje mnie porównanie założeń PLS z regresją OLS. Przeczytałem / przejrzałem wiele literatury na temat PLS; artykuły Wolda (Svante i Herman), Abdiego i wielu innych, ale nie znalazły zadowalającego źródła. Wold i in. (2001) Regresja PLS: podstawowe narzędzie chemometrii …

1
MLE parametru lokalizacji w rozkładzie Cauchy'ego
Po wycentrowaniu można przyjąć , że dwa pomiary x i −x są niezależnymi obserwacjami z rozkładu Cauchy'ego z funkcją gęstości prawdopodobieństwa: 1f(x:θ)=f(x:θ)=f(x :\theta) = ,-∞&lt;x&lt;∞1π(1+(x−θ)2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,−∞&lt;x&lt;∞,−∞&lt;x&lt;∞, -∞ < x < ∞ Pokaż, że jeśli x2≤1x2≤1x^2≤ 1 MLE z θθ\theta wynosi 0, ale jeśli x2&gt;1x2&gt;1x^2>1 , są dwa MLE z …

2
wykorzystując informacje o sąsiadach do przypisywania danych lub znajdowania danych niepowiązanych (w R)
Mam zestaw danych z założeniem, że najbliżsi sąsiedzi są najlepszymi predyktorami. Po prostu idealny przykład wizualizacji gradientu dwukierunkowego Załóżmy, że mamy przypadek, w którym brakuje kilku wartości, możemy łatwo przewidzieć na podstawie sąsiadów i trendu. Odpowiadająca macierz danych w R (przykładowy manekin do treningu): miss.mat &lt;- matrix (c(5:11, 6:10, NA,12, …

2
Czy istnieje prosta testowa wersja równoważności testu Kołmogorowa – Smirnowa?
Czy w ramach testu Kołmogorowa – Smirnowa sformułowano dwa jednostronne testy równoważności (TOST) w celu przetestowania negatywnej hipotezy zerowej, że dwie rozkłady różnią się co najmniej o poziom określony przez badacza? Jeśli nie TOST, to jakaś inna forma testu równoważności? Nick Stauner mądrze wskazuje, że (powinienem już wiedzieć;), że istnieją …

3
Jakie kryteria należy spełnić, aby stwierdzić, że występuje „efekt pułapu”?
Według The SAGE Encyclopedia of Social Science Research Methods … [a] efekt pułapu występuje, gdy miara ma wyraźną górną granicę potencjalnych odpowiedzi, a duża koncentracja uczestników osiąga ten lub zbliżony poziom. Tłumienie skali jest problemem metodologicznym, który pojawia się, gdy wariancja jest ograniczona w ten sposób. … Na przykład może …

3
Losowy las na danych o strukturze wielopoziomowej / hierarchicznej
Jestem całkiem nowy w uczeniu maszynowym, technikach CART i tym podobnych, i mam nadzieję, że moja naiwność nie jest zbyt oczywista. Jak Random Forest obsługuje wielopoziomowe / hierarchiczne struktury danych (na przykład, gdy interesująca jest interakcja między poziomami)? Oznacza to, że zestawy danych z jednostkami analizy na kilku poziomach hierarchicznych …

3
Odchylenie standardowe kilku pomiarów z niepewnością
Mam dwie 2 godziny danych GPS z częstotliwością próbkowania 1 Hz (7200 pomiarów). Dane są podane w formie , gdzie jest niepewnością pomiaru.(X,Xσ,Y,Yσ,Z,Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma)NσNσN_\sigma Kiedy wezmę średnią ze wszystkich pomiarów (np. Średnią wartość Z tych dwóch godzin), jakie jest jej odchylenie standardowe? Mogę oczywiście obliczyć odchylenie …

1
Jak interpretować ładunki PCA?
Czytając o PCA, natrafiłem na następujące wyjaśnienie: Załóżmy, że mamy zestaw danych, w którym każdy punkt danych reprezentuje wyniki pojedynczego ucznia w teście matematycznym, teście fizyki, teście czytania ze zrozumieniem i teście słownictwa. Znajdujemy dwa pierwsze główne składniki, które wychwytują 90% zmienności danych i interpretują ich obciążenia. Dochodzimy do wniosku, …
13 pca 

4
Dlaczego wszystkie znane dystrybucje są niemodalne?
Nie znam żadnych dystrybucji multimodalnych. Dlaczego wszystkie znane dystrybucje są niemodalne? Czy jest jakaś „znana” dystrybucja, która ma więcej niż jeden tryb? Oczywiście mieszanki dystrybucji są często multimodalne, ale chciałbym wiedzieć, czy istnieją jakieś dystrybucje „niemiksowane”, które mają więcej niż jeden tryb.

1
Najnowocześniejsza deduplikacja
Jakie są najnowocześniejsze metody deduplikacji rekordów? Deduplikacja jest również czasami nazywana: łączenie rekordów, rozpoznawanie jednostek, rozpoznawanie tożsamości, scalanie / czyszczenie. Wiem na przykład o CBLOCK [1]. Byłbym wdzięczny, gdyby odpowiedzi zawierały również odniesienia do istniejącego oprogramowania wdrażającego metody. Wiem na przykład, że Mahout stosuje klastrowanie baldachimu . Jest też Duke, …


1
Jak skalować nowe obserwacje w celu dokonywania prognoz, gdy model został wyposażony w skalowane dane?
Rozumiem pojęcie skalowania macierzy danych do zastosowania w modelu regresji liniowej. Na przykład w R możesz użyć: scaled.data &lt;- scale(data, scale=TRUE) Moje jedyne pytanie brzmi: w przypadku nowych obserwacji, dla których chcę przewidzieć wartości wyjściowe, w jaki sposób są one odpowiednio skalowane? Czy to by było scaled.new &lt;- (new - …

1
Dlaczego standardowy błąd przechwytywania zwiększa się o dalsze
Standardowy błąd terminu przechwytującego ( ) w jest podawany przez gdzie to średnia z .y=β1x+β0+εSE( β 0)2=σ2[1β^0β^0\hat{\beta}_0y=β1x+β0+εy=β1x+β0+εy=\beta_1x+\beta_0+\varepsilonˉxxiSE(β^0)2=σ2[1n+x¯2∑ni=1(xi−x¯)2]SE(β^0)2=σ2[1n+x¯2∑i=1n(xi−x¯)2]SE(\hat{\beta}_0)^2 = \sigma^2\left[\frac{1}{n}+\frac{\bar{x}^2}{\sum_{i=1}^n(x_i-\bar{x})^2}\right]x¯x¯\bar{x}xixix_i Z tego, co rozumiem, SE określa twoją niepewność - na przykład w 95% próbek przedział będzie zawierał true . Nie rozumiem, w jaki sposób SE, miara niepewności, rośnie z . Jeśli …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.