Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


5
Jak indywidualny badacz powinien myśleć o odsetku fałszywych odkryć?
Próbowałem owinąć głowę wokół tego, w jaki sposób współczynnik fałszywych odkryć (FDR) powinien wpływać na wnioski poszczególnych badaczy. Na przykład, jeśli twoje badanie jest słabe, czy powinieneś zdyskontować swoje wyniki, nawet jeśli są znaczące przy ? Uwaga: mówię o FDR w kontekście badania wyników wielu badań łącznie, a nie jako …


3
Dlaczego nie zgłosić średniej dystrybucji bootstrap?
Kiedy jeden ładuje parametr, aby uzyskać standardowy błąd, otrzymujemy rozkład parametru. Dlaczego nie wykorzystamy średniej tego rozkładu jako wyniku lub oszacowania parametru, który próbujemy uzyskać? Czy rozkład nie powinien być zbliżony do rzeczywistego? Dlatego otrzymalibyśmy dobre oszacowanie „prawdziwej” wartości? Podajemy jednak oryginalny parametr uzyskany z naszej próbki. Dlaczego? Dzięki

3
czy przeskalować wskaźnik / binarne / obojętne predyktory dla LASSO
W przypadku LASSO (i innych procedur wyboru modelu) kluczowe jest przeskalowanie predyktorów. Ogólna rekomendacja śledzę to po prostu użyć 0, 1 średni normalizację standardowego odchylenia dla zmiennych ciągłych. Ale co to ma wspólnego z manekinami? Np. Niektóre zastosowane przykłady z tej samej (doskonałej) szkoły letniej powiązałem z przeskalowaniem zmiennych ciągłych, …

3
Którego współczynnika inflacji wariancji powinienem używać: lub ?
Próbuję interpretować czynniki inflacji wariancji za pomocą viffunkcji w pakiecie R car. Funkcja drukuje zarówno uogólniony i . Zgodnie z plikiem pomocy ta ostatnia wartośćVIFVIF\text{VIF}GVIF1 / ( 2 ⋅ df )GVIF1/(2)⋅df)\text{GVIF}^{1/(2\cdot\text{df})} Aby dopasować się do wymiaru elipsoidy ufności, funkcja wypisuje również GVIF ^ [1 / (2 * df)], gdzie df …

3
Dlaczego macierz kowariancji próbki jest pojedyncza, gdy wielkość próby jest mniejsza niż liczba zmiennych?
Powiedzmy, że mam wymiarowy wielowymiarowy rozkład Gaussa. Biorę obserwacji (każdy z nich -vector), z tego rozkładu i obliczyć próbki kowariancji . W tym artykule autorzy stwierdzają, że macierz kowariancji próbki obliczona za pomocą jest pojedynczą.pppnnnpppSSSp>np>np > n Jak to jest prawda lub pochodne? Jakieś wyjaśnienia?

5
Jak korzystać z SVD w filtrowaniu grupowym?
Jestem trochę zdezorientowany tym, w jaki sposób SVD jest używane do wspólnego filtrowania. Załóżmy, że mam wykres społecznościowy i buduję macierz przylegania z krawędzi, a następnie biorę SVD (zapomnijmy o regularyzacji, wskaźnikach uczenia się, optymalizacjach sparityzacji itp.), W jaki sposób użyć tego SVD, aby poprawić moje rekomendacje? Załóżmy, że mój …

5
Co oznacza głębokość interakcji w GBM?
Miałem pytanie dotyczące parametru głębokości interakcji w gbm w R. To może być pytanie nooba, za które przepraszam, ale w jaki sposób parametr, który moim zdaniem oznacza liczbę węzłów końcowych w drzewie, zasadniczo wskazuje X-way interakcja między predyktorami? Próbuję zrozumieć, jak to działa. Dodatkowo dostaję całkiem różne modele, jeśli mam …





5
Jak uzyskać estymator najmniejszych kwadratów dla wielokrotnej regresji liniowej?
W przypadku prostej regresji liniowej można uzyskać estymator najmniejszych kwadratów tak, że nie musisz znać aby oszacowaćy=β0+β1xy=β0+β1xy=\beta_0+\beta_1xβ^1=∑(xi−x¯)(yi−y¯)∑(xi−x¯)2β^1=∑(xi−x¯)(yi−y¯)∑(xi−x¯)2\hat\beta_1=\frac{\sum(x_i-\bar x)(y_i-\bar y)}{\sum(x_i-\bar x)^2}β^0β^0\hat\beta_0β^1β^1\hat\beta_1 Załóżmy, że mam y=β1x1+β2x2y=β1x1+β2x2y=\beta_1x_1+\beta_2x_2 , jak uzyskać β^1β^1\hat\beta_1 bez szacowania β^2β^2\hat\beta_2 ? czy to nie jest możliwe?

2
Co oznacza termin nasycenie nieliniowości?
Czytałem artykuł Klasyfikacja ImageNet z głębokimi sieciami neuronowymi splotowymi, aw części 3, w której wyjaśnili architekturę swojej sieci neuronowej splotowej, wyjaśnili, w jaki sposób woleli: nieliniowa nieliniowośćf(x)=max(0,x).f(x)=max(0,x).f(x) = max(0, x). ponieważ trenowanie było szybsze. W tym artykule wydaje się, że odnoszą się one do nasycenia nieliniowości jako bardziej tradycyjnych funkcji …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.