Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


1
Zgłaszanie wariancji powtarzanej k-krotnej walidacji krzyżowej
Używałem powtarzanej k-krotnej walidacji krzyżowej i zgłaszałem średnią (metryki oceny, np. Czułości, swoistości) obliczoną jako średnia średnia dla fałdów różnych przebiegów walidacji krzyżowej. Nie jestem jednak pewien, jak powinienem zgłosić wariancję. Znalazłem tutaj wiele pytań omawiających powtórną walidację krzyżową, jednak żadne, o których jestem świadomy, wyraźnie odpowiada na pytanie wariancji …

2
Jak interpretować współczynnik korelacji Matthewsa (MCC)?
Odpowiedź na pytanie Związek między współczynnikami korelacji phi, Matthewsa i Pearsona? pokazuje, że wszystkie trzy współczynniki są równoważne. Nie jestem ze statystyk, więc powinno to być łatwe pytanie. Artykuł Matthewsa (www.sciencedirect.com/science/article/pii/0005279575901099) opisuje, co następuje: "A correlation of: C = 1 indicates perfect agreement, C = 0 is expected for a …

1
Jaka jest właściwa miara asocjacji zmiennej ze składnikiem PCA (na biplocie / wykresie ładowania)?
Używam FactoMineRdo zredukowania mojego zestawu danych pomiarów do ukrytych zmiennych. Powyższa mapa zmiennych jest dla mnie jasna do interpretacji, ale jestem zdezorientowany, jeśli chodzi o powiązania między zmiennymi a składnikiem 1. Patrząc na mapę zmiennych ddpi covjest ona bardzo blisko komponentu na mapie i ddpAbsjest nieco dalej z dala. Ale …

2
Pytanie o standaryzację w regresji kalenicowej
Cześć chłopaki, znalazłem jeden lub dwa artykuły, które używają regresji grzbietu (dla danych koszykówki). Zawsze kazano mi ustandaryzować moje zmienne, jeśli prowadziłem regresję grzbietu, ale po prostu kazano mi to zrobić, ponieważ grzbiet był wariantem skali (regresja grzbietu nie była tak naprawdę częścią naszego kursu, więc nasz wykładowca przejrzał ją). …


2
Kontrasty wielomianowe dla regresji
Nie rozumiem użycia kontrastów wielomianowych w dopasowaniu regresji. W szczególności mam na myśli kodowanie stosowane Rw celu wyrażenia zmiennej interwałowej (zmienna porządkowa z równo rozmieszczonymi poziomami), opisanej na tej stronie . W przykładzie tej strony , jeśli dobrze zrozumiałem, R pasuje do modelu zmiennej interwałowej, zwracając pewne współczynniki, które ważą …

1
Co jest złego w tej ilustracji rozkładu tylnego?
Mam następujący obraz, który, jak mi powiedziano, ilustruje, w jaki sposób tylny rozkład prawdopodobieństwa jest kombinacją wcześniejszych rozkładów prawdopodobieństwa. Powiedziano mi, że coś jest nie tak z obrazem, a mianowicie to, że rozkład tylny nie może mieć formy, jaką ma, biorąc pod uwagę funkcję funkcji prawdopodobieństwa. Ale staram się wymyślić, …

5
Jakie są różnice między terminami „analiza szeregów czasowych” i „analiza danych podłużnych”
Mówiąc o danych podłużnych, możemy odnosić się do danych zebranych w czasie wielokrotnie od tego samego przedmiotu / jednostki badawczej, dlatego istnieją korelacje dla obserwacji w obrębie tego samego przedmiotu, tj. Podobieństwo wewnątrz podmiotu. Mówiąc o danych szeregów czasowych, odnosimy się również do danych zebranych w szeregu czasowym i wydaje …

2
Jak uruchomić analizę regresji logistycznej porządkowej w R z wartościami liczbowymi / kategorialnymi?
Dane podstawowe : mam ~ 1000 osób oznaczonych ocenami: „1”, „dobry”, „2”, „środkowy] lub„ 3 ”[zły] - to wartości, które staram się przewidzieć dla ludzi w przyszłości . Oprócz tego mam pewne informacje demograficzne: płeć (kategorycznie: M / K), wiek (liczbowo: 17-80) i rasę (kategorycznie: czarny / kaukaski / latino). …

3
Dlaczego potrzebujemy autoencoderów?
Ostatnio studiowałem autoencodery. Jeśli dobrze zrozumiałem, autoencoder to sieć neuronowa, w której warstwa wejściowa jest identyczna z warstwą wyjściową. Tak więc sieć neuronowa próbuje przewidzieć wyjście, używając wejścia jako złotego standardu. Jaka jest przydatność tego modelu? Jakie są zalety próby zrekonstruowania niektórych elementów wyjściowych, aby były jak najbardziej równe elementom …



2
Wybór funkcji za pomocą Losowych lasów
Mam zestaw danych zawierający głównie zmienne finansowe (120 funkcji, 4k przykładów), które są w większości wysoce skorelowane i bardzo głośne (na przykład wskaźniki techniczne), dlatego chciałbym wybrać około 20-30 do późniejszego użycia ze szkoleniem modelu (klasyfikacja binarna) - zwiększyć zmniejszyć). Myślałem o użyciu losowych lasów do rankingu funkcji. Czy warto …

4
Jaki jest związek między
Zastanawiałem się, czy istnieje związek między a testem F.R2R2R^2 Zwykle i mierzy siłę związek liniowy w regresji.R2=∑(Y^t−Y¯)2/T−1∑(Yt−Y¯)2/T−1R2=∑(Y^t−Y¯)2/T−1∑(Yt−Y¯)2/T−1R^2=\frac {\sum (\hat Y_t - \bar Y)^2 / T-1} {\sum( Y_t - \bar Y)^2 / T-1} Test F tylko potwierdza hipotezę. Czy istnieje związek pomiędzy R2R2R^2 i F-test?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.