Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
suma niecentralnych zmiennych losowych chi-kwadrat
Muszę znaleźć rozkład zmiennej losowej Y=∑i=1n(Xi)2Y=∑i=1n(Xi)2Y=\sum_{i=1}^{n}(X_i)^2 gdzie Xi∼N(μi,σ2i)Xi∼N(μi,σi2)X_i\sim{\cal{N}}(\mu_i,\sigma^2_i) i wszystkie XiXiX_i są niezależne. Wiem, że można najpierw znaleźć iloczyn wszystkich funkcji generujących momenty dla XiXiX_i , a następnie przekształcić je z powrotem, aby uzyskać rozkład YYYZastanawiam się jednak, czy istnieje ogólna forma dla YYY podobnie jak przypadek Gaussa: wiemy, że …


6
Jaka jest różnica między statystykami opisowymi a wnioskującymi?
Rozumiałem, że statystyki opisowe opisują ilościowo cechy próbki danych, podczas gdy statystyki wnioskowania wnioskowały o populacjach, z których pobrano próbki. Jednak strona Wikipedii do wnioskowania statystycznego stwierdza: W większości wnioskowanie statystyczne tworzy propozycje dotyczące populacji, wykorzystując dane pochodzące z populacji, która jest przedmiotem zainteresowania, poprzez jakąś formę losowego próbkowania. „W …


1
Konwersja (normalizacja) bardzo małych wartości prawdopodobieństwa na prawdopodobieństwo
Piszę algorytm, w którym przy danym modelu obliczam prawdopodobieństwa dla listy zestawów danych, a następnie muszę znormalizować (według prawdopodobieństwa) każde z prawdopodobieństw. Więc coś w rodzaju [0,00043, 0,00004, 0,00321] można przekonwertować na coś takiego jak [0,2, 0,03, 0,77]. Mój problem polega na tym, że prawdopodobieństwa dziennika, z którymi pracuję, są …

3
Jak i kiedy korzystać z dopasowania Bonferroni
Mam dwa pytania dotyczące tego, kiedy użyć korekty Bonferroni: Czy właściwe jest zastosowanie korekty Bonferroni we wszystkich przypadkach wielokrotnego testowania? Jeśli ktoś przeprowadza test na zestawie danych, dzieli go na dokładniejsze poziomy (np. Dzieli dane według płci) i wykonuje te same testy, jak to może wpłynąć na liczbę postrzeganych testów …


1
Wykrywanie wartości odstających w danych zliczania
Mam coś, co naiwnie uważałem za dość prosty problem, który polega na wykrywaniu wartości odstających dla wielu różnych zestawów danych zliczania. W szczególności chcę ustalić, czy jedna lub więcej wartości w serii danych zliczania jest wyższa lub niższa niż oczekiwano w stosunku do reszty zliczeń w rozkładzie. Czynnikiem zakłócającym jest …

4
Wielokrotna imputacja i wybór modelu
Wielokrotna imputacja jest dość prosta, jeśli masz model liniowy a priori , który chcesz oszacować. Jednak rzeczy wydają się nieco trudniejsze, gdy faktycznie chcesz dokonać wyboru modelu (np. Znajdź „najlepszy” zestaw zmiennych predykcyjnych z większego zestawu zmiennych kandydujących - mam na myśli szczególnie LASSO i wielomiany ułamkowe za pomocą R). …

5
Losowy las a regresja
Uruchomiłem model regresji OLS na zestawie danych z 5 niezależnymi zmiennymi. Zmienne niezależne i zmienne zależne są ciągłe i są liniowo powiązane. Kwadrat R wynosi około 99,3%. Ale kiedy uruchamiam to samo przy użyciu losowego lasu w R, mój wynik to „% Var wyjaśnił: 88.42”. Dlaczego losowy wynik lasu byłby …

5
Jak kontrolować koszty błędnej klasyfikacji w losowych lasach?
Czy można kontrolować koszt błędnej klasyfikacji w pakiecie R randomForest ? W mojej własnej pracy fałszywe negatywy (np. Brak pomyłki, że dana osoba może mieć chorobę) są znacznie bardziej kosztowne niż fałszywie pozytywne. Pakiet rpart pozwala użytkownikowi kontrolować koszty błędnej klasyfikacji, określając macierz strat do różnej wagi błędnych klasyfikacji. Czy …

1
Jakie są dobrze znane ulepszenia w stosunku do podręcznikowych algorytmów MCMC, których ludzie używają do wnioskowania bayesowskiego?
Kiedy koduję symulację Monte Carlo dla jakiegoś problemu, a model jest dość prosty, używam bardzo prostego podręcznika Gibbs. Kiedy nie jest możliwe użycie próbkowania Gibbsa, koduję podręcznik Metropolis-Hastings, którego nauczyłem się wiele lat temu. Zastanawiam się nad wyborem rozkładu skoków lub jego parametrów. Wiem, że istnieją setki specjalistycznych metod, które …


3
Co się stanie, gdy zastosujesz SVD do problemu filtrowania grupowego? Jaka jest różnica między nimi?
W filtrowaniu grupowym mamy wartości, które nie są wypełnione. Załóżmy, że użytkownik nie obejrzał filmu, a następnie musimy wstawić „na”. Jeśli mam wziąć SVD tej macierzy, muszę tam wstawić pewną liczbę - powiedz 0. Teraz, jeśli podzielę macierz na czynniki pierwsze, mam metodę znalezienia podobnych użytkowników (poprzez ustalenie, którzy użytkownicy …


Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.