Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Walidacja krzyżowa, w tym szkolenie, walidacja i testowanie. Dlaczego potrzebujemy trzech podzbiorów?
Mam pytanie dotyczące procesu weryfikacji krzyżowej. Jestem w trakcie kursu uczenia maszynowego na Cursera. Jeden z tematów dotyczy weryfikacji krzyżowej. Trochę trudno było mnie śledzić. Wiem, dlaczego potrzebujemy CV, ponieważ chcemy, aby nasze modele działały dobrze na przyszłych (nieznanych) danych, a CV zapobiega nadmiernemu dopasowaniu. Jednak sam proces jest mylący. …

4
Związany z korelacją trzech zmiennych losowych
Istnieją trzy losowe zmienne, x,y,zx,y,zx,y,z . Trzy korelacje między trzema zmiennymi są takie same. To jest, ρ=cor(x,y)=cor(x,z)=cor(y,z)ρ=cor(x,y)=cor(x,z)=cor(y,z)\rho=\textrm{cor}(x,y)=\textrm{cor}(x,z)=\textrm{cor}(y,z) Jaka jest najściślejsza granica, jaką możesz dla ρρρ\rho ?

3
Dlaczego centrowanie zmiennych niezależnych może zmieniać główne efekty z umiarem?
Mam pytanie związane z regresją wielokrotną i interakcją, zainspirowane tym wątkiem CV: Pojęcie interakcji za pomocą analizy hierarchicznej regresji zmiennych centrowanych? Jakie zmienne powinniśmy wyśrodkować? Podczas sprawdzania efektu moderacji centruję zmienne niezależne i mnożę zmienne wyśrodkowane, aby obliczyć termin interakcji. Następnie przeprowadzam analizę regresji i sprawdzam efekty główne i interakcyjne, …

1
Różnica między standardowymi a sferycznymi algorytmami k-średnich
Chciałbym zrozumieć, jaka jest główna różnica w implementacji między standardowymi a sferycznymi algorytmami klastrowania k-średnich. Na każdym etapie k-średnich oblicza odległości między wektorami elementów i centroidami gromady i ponownie przypisuje dokument do tej gromady, której centroid jest najbliższy. Następnie wszystkie centroidy są przeliczane. W sferycznych średnich k wszystkie wektory są …

6
Test t dla częściowo sparowanych i częściowo niesparowanych danych
Badacz chce opracować połączoną analizę kilku zestawów danych. W niektórych zestawach danych istnieją sparowane obserwacje dla leczenia A i B. W innych są niesparowane dane A i / lub B. Szukam odniesienia do dostosowania testu t lub testu współczynnika prawdopodobieństwa dla takich częściowo sparowanych danych. Jestem gotów (na razie) założyć …

3
Jak radzić sobie z wielokoliniowością podczas wyboru zmiennych?
Mam zestaw danych z 9 ciągłymi zmiennymi niezależnymi. Staram się wybierać między tymi zmiennymi, aby dopasować model do jednego procentu (zależnej) zmiennej Score. Niestety wiem, że między kilkoma zmiennymi wystąpi poważna kolinearność. Próbowałem użyć stepAIC()funkcji w R do wyboru zmiennych, ale ta metoda, co dziwne, wydaje się wrażliwa na kolejność, …

2
Dlaczego RSS jest dystrybuowany chi razy razy np?
Chciałbym zrozumieć, dlaczego w modelu OLS rozkłada się RSS (resztkową sumę kwadratów) χ2⋅(n−p)χ2⋅(n−p)\chi^2\cdot (n-p) ( ppp oznacza liczbę parametrów w modelu, nnn liczbę obserwacji). Przepraszam, że zadałem tak podstawowe pytanie, ale wydaje się, że nie jestem w stanie znaleźć odpowiedzi online (lub w moich, bardziej zorientowanych na aplikację podręcznikach).



4
Jak zrobić zmniejszenie wymiarów w R.
Mam macierz, w której (i, j) mówi mi, ile razy przeglądałem stronę j. Istnieje 27 000 osób i 95 000 stron. Chciałbym mieć garść „wymiarów” lub „aspektów” w przestrzeni stron, które odpowiadałyby zestawom stron często oglądanych razem. Moim ostatecznym celem jest wtedy, aby móc obliczyć, jak często przeglądałem strony, które …

4
Jak to możliwe, że utrata walidacji rośnie, a jednocześnie zwiększa się dokładność walidacji
Uczę prostej sieci neuronowej na zbiorze danych CIFAR10. Po pewnym czasie utrata walidacji zaczęła rosnąć, a dokładność walidacji również rośnie. Utrata i dokładność testu stale się poprawiają. Jak to jest możliwe? Wydaje się, że w przypadku wzrostu utraty walidacji dokładność powinna się zmniejszyć. PS Jest kilka podobnych pytań, ale nikt …

5
Dlaczego funkcja średnia w Procesie Gaussa jest nieciekawa?
Właśnie zacząłem czytać o GP i analogicznie do zwykłego rozkładu Gaussa charakteryzuje się funkcją średnią i funkcją kowariancji lub jądrem. Rozmawiałem i mówca powiedział, że funkcja średniej jest zwykle dość nieciekawa i cały wysiłek wnioskowania poświęcony jest na oszacowanie prawidłowej funkcji kowariancji. Czy ktoś może mi wyjaśnić, dlaczego tak powinno …

8
Poszukuję dobrej i pełnej księgi prawdopodobieństwa i statystyki
Nigdy nie miałem okazji odwiedzić kursu statystyki z wydziału matematyki. Szukam teorii prawdopodobieństwa i księgi statystycznej, która byłaby kompletna i samowystarczalna. Przez kompletne rozumiem, że zawiera wszystkie dowody, a nie tylko wyniki. Przez samowystarczalność rozumiem, że nie muszę czytać innej książki, aby ją zrozumieć. Oczywiście może to wymagać rachunku na …


4
Jak wykonać test t-Studenta mający tylko wielkość próby, średnią próbki i średnią populacji?
Studenta -test wymaga próbka odchylenie standardowe . Jak jednak obliczyć dla gdy znana jest tylko wielkość próbki i średnia próbki?s stttssssss Na przykład, jeśli wielkość próbki wynosi a średnia próbki to , wówczas spróbuję utworzyć listę identycznych próbek o wartości każda. Oczekiwane odchylenie standardowe próbki wynosi . Spowoduje to utworzenie …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.