Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Rzadkie uprzedzenie regresji logistycznej zdarzenia: jak symulować niedoszacowane wartości p na minimalnym przykładzie?
CrossValidated ma kilka pytań na temat tego, kiedy i jak zastosować korektę błędu rzadkich zdarzeń autorstwa Kinga i Zenga (2001) . Szukam czegoś innego: minimalnej demonstracji opartej na symulacji, że istnieje uprzedzenie. W szczególności państwo King i Zeng „... w danych dotyczących rzadkich zdarzeń tendencje w prawdopodobieństwach mogą mieć istotne …

1
Zastosowanie predyktorów kołowych w regresji liniowej
Próbuję dopasować model, wykorzystując dane wiatru (0, 359) i porę dnia (0, 23), ale martwię się, że źle pasują one do regresji liniowej, ponieważ same nie są parametrami liniowymi. Chciałbym je przekształcić za pomocą Pythona. Widziałem wzmiankę o obliczaniu wektora przez wzięcie grzechu i cos stopni, przynajmniej w przypadku wiatru, …

3
Julia: Podsumowując, jak się miewa
Ten post dotyczy szybko zmieniającego się wydarzenia. Natknąłem się na pytanie z 2012 roku, które miało bardzo dobrą dyskusję na temat Julii jako alternatywy dla R / Python dla różnych rodzajów prac statystycznych. Oto oryginalne Pytanie z 2012 roku dotyczące obietnicy Julii Niestety Julia była wtedy bardzo nowa, a zestawy …
19 r  python  computing  julia 

1
Geometryczne rozumienie PCA w badanej (podwójnej) przestrzeni
Próbuję uzyskać intuicyjne zrozumienie działania analizy głównych składników (PCA) w przestrzeni przedmiotowej (podwójnej) . Rozważ zestaw danych 2D z dwiema zmiennymi, x1x1x_1 i x2x2x_2 oraz punktami danych (macierz danych wynosi i zakłada się, że jest wyśrodkowana). Typowa prezentacja PCA polega na tym, że bierzemy pod uwagę punktów w , zapisujemy …

3
Znaczenie węzła stronniczości w sieciach neuronowych
Ciekaw jestem, jak ważny jest węzeł stronniczości dla skuteczności nowoczesnych sieci neuronowych. Z łatwością rozumiem, że może to być ważne w płytkiej sieci z zaledwie kilkoma zmiennymi wejściowymi. Jednak współczesne sieci neuronowe, takie jak głębokie uczenie się, często mają dużą liczbę zmiennych wejściowych, które decydują, czy dany neuron zostanie wyzwolony. …


1
Co wyciągnąć z tej fabuły lasso (glmnet)
Poniżej znajduje się wykres glmnet z domyślną wartością alfa (1, stąd lasso) przy użyciu mtcarszestawu danych w R mpgjako DV i innych jako zmiennych predykcyjnych. glmnet(as.matrix(mtcars[-1]), mtcars[,1]) Co możemy wywnioskować z tej działki dotyczące różnych zmiennych, zwłaszcza am, cyli wt(czerwone, czarne i jasne niebieskie linie)? Jak sformułujemy wynik w raporcie, …

3
Dlaczego Pearson jest parametryczny, a Spearman nieparametryczny
Najwyraźniej współczynnik korelacji Pearsona jest parametryczny, a współczynnik rho Spearmana nieparametryczny. Mam problem ze zrozumieniem tego. Jak rozumiem, Pearson jest obliczany jako a Spearman jest obliczany w ten sam sposób, z tym wyjątkiem, że zastępujemy wszystkie wartości ich szeregami.rx y= c o v ( X, Y)σxσyrxy=doov(X,Y)σxσy r_{xy} = \frac{cov(X,Y)}{\sigma_x\sigma_y} Wikipedia …


3
Zamieszanie z częstością fałszywych odkryć i wielokrotnymi testami (na Colquhoun 2014)
Przeczytałem ten wielki artykuł Davida Colquhouna: Badanie współczynnika fałszywych odkryć i błędnej interpretacji wartości p (2014). Zasadniczo wyjaśnia, dlaczego współczynnik fałszywych odkryć (FDR) może wynosić nawet chociaż kontrolujemy błąd typu I za pomocą .30%30%30\%α=0.05α=0.05\alpha=0.05 Nadal jednak nie jestem pewien, co się stanie, jeśli zastosuję kontrolę FDR w przypadku wielokrotnych testów. …





5
Czy są jakieś wersje T-SNE do przesyłania strumieniowego danych?
Rozumiem t-SNE i aproksymację Barnesa-Huta, że ​​wszystkie punkty danych są wymagane, aby wszystkie oddziaływania sił mogły być obliczone w tym samym czasie, a każdy punkt można dostosować na mapie 2d (lub niższych wymiarach). Czy są jakieś wersje T-sne, które mogą skutecznie radzić sobie z przesyłaniem danych? Więc jeśli moje obserwacje …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.