Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Odległość między dwiema mieszankami gaussowskimi do oceny rozwiązań klastrowych
Korzystam z szybkiej symulacji, aby porównać różne metody klastrowania, i obecnie mam problem z oceną rozwiązań klastrowych. Znam różne miary sprawdzania poprawności (wiele z nich znajduje się w klaster.stats () w R), ale zakładam, że najlepiej je wykorzystać, jeśli szacunkowa liczba klastrów faktycznie równa się prawdziwej liczbie klastrów. Chcę zachować …

1
Motywacja za losowymi krokami algorytmu lasu
Znana mi metoda konstruowania losowego lasu jest następująca: (z http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm ) Aby zbudować drzewo w lesie: Bootstrap próbkę o rozmiarze N, gdzie N jest rozmiarem naszego zestawu treningowego. Użyj tej próbki startowej jako zestawu treningowego dla tego drzewa. W każdym węźle drzewa losowo wybierz m naszych funkcji M. Wybierz najlepsze …

2
Dlaczego modele efektów losowych wymagają, aby efekty nie były skorelowane ze zmiennymi wejściowymi, podczas gdy modele efektów stałych pozwalają na korelację?
Z Wikipedii Istnieją dwa wspólne założenia dotyczące konkretnego efektu indywidualnego, założenia efektów losowych i założenia efektów stałych. Założeniem efektów losowych (wykonanym w modelu efektów losowych) jest to, że poszczególne efekty indywidualne nie są skorelowane ze zmiennymi niezależnymi. Założeniem efektu stałego jest to, że indywidualny efekt specyficzny jest skorelowany ze zmiennymi …



3
Pytanie o normalny dowód równania
Jak możesz udowodnić, że równania normalne: mają jedno lub więcej rozwiązań bez założenia, że ​​X jest odwracalny?( XT.X) β= XT.Y(XTX)β=XTY(X^TX)\beta = X^TY Domyślam się tylko, że ma to coś wspólnego z uogólnioną odwrotnością, ale jestem całkowicie zagubiony.
11 regression  proof 


2
Fisher dla manekinów?
Krótka wersja: czy jest wstęp do pism Ronalda Fishera (artykułów i książek) na temat statystyki, który jest skierowany do osób z niewielkim lub zerowym doświadczeniem w statystyce? Myślę o czymś w rodzaju „czytelnika Fishera z komentarzem” skierowanego do niestatystów. Poniżej uzasadniam to pytanie, ale ostrzegam, że jest on rozwlekły (nie …

4
Testy statystyczne uwzględniające niepewność pomiaru
Załóżmy, że podano mi dwie grupy pomiarów masy (w mg), które są określane jako y1 i y2. Chcę zrobić test, aby ustalić, czy dwie próbki są pobierane z populacji w inny sposób. Coś takiego jak na przykład (w R): y1 <- c(10.5,2.9,2.0,4.4,2.8,5.9,4.2,2.7,4.7,6.6) y2 <- c(3.8,4.3,2.8,5.0,9.3,6.0,7.6,3.8,6.8,7.9) t.test(y1,y2) Dostaję wartość p wynoszącą …

1
Jak LASSO wybiera spośród predyktorów współliniowych?
Szukam intuicyjnej odpowiedzi, dlaczego model GLM LASSO wybiera określony predyktor z grupy wysoce skorelowanych i dlaczego robi to inaczej niż najlepszy wybór funkcji podzbioru. Z geometrii LASSO pokazanej na ryc. 2 w Tibshirani 1996 doprowadzono mnie do przekonania, że ​​LASSO wybiera predyktor z większą wariancją. Załóżmy teraz, że używam najlepszej …


1
Łączenie dwóch macierzy kowariancji
Obliczam kowariancję rozkładu równolegle i muszę połączyć wyniki rozproszone w liczbie pojedynczej Gaussa. Jak połączyć te dwa elementy? Interpolacja liniowa między tymi dwoma prawie działa, jeśli są one podobnie rozmieszczone i zwymiarowane. Wikipedia zapewnia forumla na dole dla kombinacji, ale wydaje się to niewłaściwe; dwie identycznie rozmieszczone dystrybucje powinny mieć …



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.