Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Jak stworzyć dowolną macierz kowariancji
Na przykład, w RThe MASS::mvrnorm()Funkcja ta jest przydatna do generowania danych, aby wykazać różne rzeczy w statystykach. Bierze obowiązkowy Sigmaargument, który jest macierzą symetryczną określającą macierz kowariancji zmiennych. Jak utworzyć symetryczną macierz z dowolnymi wpisami?n×nn×nn\times n

2
Dlaczego funkcja softmax jest używana do obliczania prawdopodobieństw, chociaż każdą wartość możemy podzielić przez sumę wektora?
Zastosowanie funkcji softmax na wektorze spowoduje „prawdopodobieństwa” i wartości od do . 000111 Ale możemy również podzielić każdą wartość przez sumę wektora, co da prawdopodobieństwa i wartości od do .000111 Przeczytałem tutaj odpowiedź , ale mówi ona, że ​​powodem jest to, że jest różniczkowalna, chociaż obie funkcje są różniczkowalne.

5
Jakie jest intuicyjne znaczenie liniowej zależności między logami dwóch zmiennych?
Mam dwie zmienne, które nie wykazują dużej korelacji, gdy są nanoszone względem siebie, ale bardzo wyraźna liniowa zależność, kiedy rysuję logi każdej zmiennej przeciw drugiej. Skończyłem więc na modelu tego typu: log(Y)=alog(X)+blog⁡(Y)=alog⁡(X)+b\log(Y) = a \log(X) + b , co jest świetne matematycznie, ale wydaje się, że nie ma wartości objaśniającej …



2
FPR (współczynnik fałszywie dodatnich wyników) vs FDR (odsetek fałszywych wyników wyszukiwania)
Poniższy cytat pochodzi ze słynnego artykułu badawczego Znaczenie statystyczne dla badań całego genomu Storey i Tibshirani (2003): Na przykład fałszywie dodatni wskaźnik wynoszący 5% oznacza, że ​​średnio 5% prawdziwie zerowych cech w badaniu zostanie nazwanych znaczącymi. FDR (wskaźnik fałszywych odkryć) wynoszący 5% oznacza, że ​​spośród wszystkich funkcji nazywanych znaczącymi, 5% …

1
lme () i lmer () dają sprzeczne wyniki
Pracowałem z niektórymi danymi, które mają pewne problemy z powtarzanymi pomiarami. W ten sposób zauważyłem bardzo różne zachowanie między danymi testowymi lme()i ich lmer()używanie i chcę wiedzieć, dlaczego. Fałszywy zestaw danych, który utworzyłem, zawiera pomiary wzrostu i masy ciała dla 10 osób, wykonane dwukrotnie. Ustawiłem dane tak, aby między badanymi …

9
Niedopasowanie i niedopasowanie
Przeprowadziłem pewne badania na temat niedopasowania i niedopasowania i zrozumiałem, czym dokładnie są, ale nie mogę znaleźć powodów. Jakie są główne powody niedopasowania i niedopasowania? Dlaczego napotykamy te dwa problemy podczas szkolenia modelu?


4
Czy codzienne prawdopodobieństwo jest tylko sposobem radzenia sobie z nieznanym (nie mówiąc tutaj o fizyce kwantowej)?
Wydaje się, że w codziennym prawdopodobieństwie (nie w fizyce kwantowej) prawdopodobieństwa są tak naprawdę tylko substytutem nieznanego. Weźmy na przykład rzut monetą. Mówimy, że jest „losowy”, 50% zmiana głowy i 50% szans na reszkę. Gdybym jednak dokładnie znał gęstość, rozmiar i kształt monety; gęstość powietrza; z jaką siłą rzuciła moneta; …

3
Zrozumienie parametru input_shape w LSTM za pomocą Keras
Próbuję użyć przykładu opisanego w dokumentacji Keras o nazwie „Stacked LSTM do klasyfikacji sekwencji” (patrz kod poniżej) i nie mogę znaleźć input_shapeparametru w kontekście moich danych. Mam jako dane wejściowe macierz sekwencji 25 możliwych znaków zakodowanych w liczbach całkowitych do sekwencji wypełnionej o maksymalnej długości 31. W rezultacie moje x_trainma …
20 lstm  keras  shape  dimensions 

3
Znalezienie sposobu na symulację liczb losowych dla tego rozkładu
Usiłuję napisać program w języku R, który symuluje pseudolosowe liczby z rozkładu za pomocą funkcji rozkładu skumulowanego: fa( x ) = 1 - exp(−ax−bp+1xp+1),x≥0F(x)=1−exp⁡(−ax−bp+1xp+1),x≥0F(x)= 1-\exp \left(-ax-\frac{b}{p+1}x^{p+1}\right), \quad x \geq 0 gdziea , b > 0 , p ∈ ( 0 , 1 )za,b>0,p∈(0,1)a,b>0, p \in (0,1) Próbowałem próbkowania z transformacją …


4
Jeśli planowanych jest wiele porównań, czy nadal trzeba korygować wiele porównań?
Recenzuję artykuł, który wykonał> 15 osobnych testów 2x2 Chi Square. Zasugerowałem, że muszą poprawić wiele porównań, ale odpowiedzieli, mówiąc, że wszystkie porównania zostały zaplanowane i dlatego nie jest to konieczne. Wydaje mi się, że to nie musi być poprawne, ale nie mogę znaleźć żadnych zasobów, które wyraźnie stwierdzą, czy tak …

5
Przykład, w którym zasada prawdopodobieństwa * naprawdę * ma znaczenie?
Czy istnieje przykład, w którym dwa różne testy dające się obronić z proporcjonalnymi prawdopodobieństwami prowadziłyby do wyraźnie odmiennych (i równie dających się obronić) wniosków, na przykład, gdzie wartości p są daleko od siebie rzędu wielkości, ale siła alternatyw jest podobna? Wszystkie przykłady, które widzę, są bardzo głupie, porównując dwumianowy z …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.