CrossValidated ma kilka pytań na temat tego, kiedy i jak zastosować korektę błędu rzadkich zdarzeń autorstwa Kinga i Zenga (2001) . Szukam czegoś innego: minimalnej demonstracji opartej na symulacji, że istnieje uprzedzenie. W szczególności państwo King i Zeng „... w danych dotyczących rzadkich zdarzeń tendencje w prawdopodobieństwach mogą mieć istotne …
Próbuję dopasować model, wykorzystując dane wiatru (0, 359) i porę dnia (0, 23), ale martwię się, że źle pasują one do regresji liniowej, ponieważ same nie są parametrami liniowymi. Chciałbym je przekształcić za pomocą Pythona. Widziałem wzmiankę o obliczaniu wektora przez wzięcie grzechu i cos stopni, przynajmniej w przypadku wiatru, …
Ten post dotyczy szybko zmieniającego się wydarzenia. Natknąłem się na pytanie z 2012 roku, które miało bardzo dobrą dyskusję na temat Julii jako alternatywy dla R / Python dla różnych rodzajów prac statystycznych. Oto oryginalne Pytanie z 2012 roku dotyczące obietnicy Julii Niestety Julia była wtedy bardzo nowa, a zestawy …
Próbuję uzyskać intuicyjne zrozumienie działania analizy głównych składników (PCA) w przestrzeni przedmiotowej (podwójnej) . Rozważ zestaw danych 2D z dwiema zmiennymi, x1x1x_1 i x2x2x_2 oraz punktami danych (macierz danych wynosi i zakłada się, że jest wyśrodkowana). Typowa prezentacja PCA polega na tym, że bierzemy pod uwagę punktów w , zapisujemy …
Ciekaw jestem, jak ważny jest węzeł stronniczości dla skuteczności nowoczesnych sieci neuronowych. Z łatwością rozumiem, że może to być ważne w płytkiej sieci z zaledwie kilkoma zmiennymi wejściowymi. Jednak współczesne sieci neuronowe, takie jak głębokie uczenie się, często mają dużą liczbę zmiennych wejściowych, które decydują, czy dany neuron zostanie wyzwolony. …
Używam dekompozycji Cholesky'ego do symulacji skorelowanych zmiennych losowych na podstawie macierzy korelacji. Chodzi o to, że wynik nigdy nie odtwarza struktury korelacji, jaka jest podana. Oto mały przykład w Pythonie ilustrujący sytuację. import numpy as np n_obs = 10000 means = [1, 2, 3] sds = [1, 2, 3] # …
Poniżej znajduje się wykres glmnet z domyślną wartością alfa (1, stąd lasso) przy użyciu mtcarszestawu danych w R mpgjako DV i innych jako zmiennych predykcyjnych. glmnet(as.matrix(mtcars[-1]), mtcars[,1]) Co możemy wywnioskować z tej działki dotyczące różnych zmiennych, zwłaszcza am, cyli wt(czerwone, czarne i jasne niebieskie linie)? Jak sformułujemy wynik w raporcie, …
Najwyraźniej współczynnik korelacji Pearsona jest parametryczny, a współczynnik rho Spearmana nieparametryczny. Mam problem ze zrozumieniem tego. Jak rozumiem, Pearson jest obliczany jako a Spearman jest obliczany w ten sam sposób, z tym wyjątkiem, że zastępujemy wszystkie wartości ich szeregami.rx y= c o v ( X, Y)σxσyrxy=doov(X,Y)σxσy r_{xy} = \frac{cov(X,Y)}{\sigma_x\sigma_y} Wikipedia …
Jeśli mamy 2 normalne, nieskorelowane zmienne losowe , możemy utworzyć 2 skorelowane zmienne losowe o wzorzeX1,X2X1,X2X_1, X_2 Y= ρ X1+ 1 - ρ2)-----√X2)Y=ρX1+1−ρ2X2Y=\rho X_1+ \sqrt{1-\rho^2} X_2 i następnie będzie miał korelacji z .ρ X 1YYYρρ\rhoX1X1X_1 Czy ktoś może wyjaśnić, skąd pochodzi ta formuła?
Przeczytałem ten wielki artykuł Davida Colquhouna: Badanie współczynnika fałszywych odkryć i błędnej interpretacji wartości p (2014). Zasadniczo wyjaśnia, dlaczego współczynnik fałszywych odkryć (FDR) może wynosić nawet chociaż kontrolujemy błąd typu I za pomocą .30%30%30\%α=0.05α=0.05\alpha=0.05 Nadal jednak nie jestem pewien, co się stanie, jeśli zastosuję kontrolę FDR w przypadku wielokrotnych testów. …
Naprawdę interesuje mnie procedura elastycznej siatki dla skurczenia / wyboru predyktora. Wydaje się bardzo potężny. Ale z naukowego punktu widzenia nie wiem dobrze, co zrobić, gdy otrzymam współczynniki. Na jakie pytanie odpowiadam? Czy są to zmienne, które najbardziej wpływają na ten wynik i czy są to współczynniki, które dają najlepszy …
RNN może być wykorzystywany do przewidywania lub mapowania sekwencji do sekwencji. Ale w jaki sposób można użyć RNN do klasyfikacji? Dajemy całej sekwencji jedną etykietę.
W podręcznikach i wykładach na YouTubie wiele się nauczyłem o modelach iteracyjnych, takich jak zwiększanie, ale nigdy nie widziałem nic na temat określania przedziału prognoz. Krzyżową walidację stosuje się w następujących przypadkach: Wybór modelu : Wypróbuj różne modele i wybierz ten, który najlepiej pasuje. W przypadku wzmocnienia użyj CV, aby …
Z wyjątkiem faktu, że zwroty mogą być ujemne, podczas gdy ceny muszą być dodatnie, czy jest jakiś inny powód, dla którego modelowanie cen akcji jest logarytmicznym rozkładem normalnym, ale modelowanie zapasów jest normalne?
Rozumiem t-SNE i aproksymację Barnesa-Huta, że wszystkie punkty danych są wymagane, aby wszystkie oddziaływania sił mogły być obliczone w tym samym czasie, a każdy punkt można dostosować na mapie 2d (lub niższych wymiarach). Czy są jakieś wersje T-sne, które mogą skutecznie radzić sobie z przesyłaniem danych? Więc jeśli moje obserwacje …
Używamy plików cookie i innych technologii śledzenia w celu poprawy komfortu przeglądania naszej witryny, aby wyświetlać spersonalizowane treści i ukierunkowane reklamy, analizować ruch w naszej witrynie, i zrozumieć, skąd pochodzą nasi goście.
Kontynuując, wyrażasz zgodę na korzystanie z plików cookie i innych technologii śledzenia oraz potwierdzasz, że masz co najmniej 16 lat lub zgodę rodzica lub opiekuna.