Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jak dopasować przybliżony plik PDF (tj. Oszacowanie gęstości) przy użyciu pierwszych k (empirycznych) momentów?
Mam sytuację, w której jestem w stanie oszacować (pierwsze) momentów zbioru danych i chciałbym użyć go do oszacowania funkcji gęstości.kkk Natknąłem się już na rozkład Pearsona , ale zdałem sobie sprawę, że opiera się on tylko na pierwszych 4 momentach (z pewnymi ograniczeniami dotyczącymi możliwych kombinacji momentów). Rozumiem również, że …

3
Jakie są zalety różnych podejść do wykrywania kolinearności?
Chcę wykryć, czy kolinearność jest problemem w mojej regresji OLS. Rozumiem, że czynniki inflacyjne wariancji i wskaźnik warunków są dwiema powszechnie stosowanymi miarami, ale trudno mi znaleźć coś konkretnego na podstawie zalet każdego podejścia lub tego, jakie powinny być wyniki. Bardzo przydatne byłoby wybitne źródło, które wskazuje, jakie podejście należy …

1
Jaki jest właściwy sposób obliczania oszacowania gęstości jądra na podstawie współrzędnych geograficznych?
Muszę obliczyć 2d oszacowanie gęstości jądra (kde) z listy współrzędnych szerokości i długości geograficznej. Ale jeden stopień szerokości geograficznej nie jest taki sam, jak jeden stopień długości geograficznej, co oznacza, że ​​poszczególne jądra byłyby owalne, szczególnie im dalej punkt znajduje się od równika. W moim przypadku wszystkie punkty są wystarczająco …

2
Klasyfikacja z częściowo „nieznanymi” danymi
Załóżmy, że chcę nauczyć się klasyfikatora, który przyjmuje wektor liczb jako dane wejściowe i podaje etykietę klasy jako dane wyjściowe. Moje dane treningowe składają się z dużej liczby par przepływów międzygałęziowych. Jednak kiedy przechodzę do testowania niektórych nowych danych, dane te są zwykle tylko częściowo kompletne. Na przykład, jeśli wektor …


1
Jakie są „pożądane” właściwości statystyczne testu współczynnika wiarygodności?
Czytam artykuł, którego metoda jest w pełni oparta na teście współczynnika wiarygodności. Autor mówi, że test LR na jednostronne alternatywy to UMP. Kontynuuje, twierdząc, że „... nawet jeśli nie można wykazać, że [test LR] jest jednorodnie najsilniejszy, test LR często ma pożądane właściwości statystyczne”. Zastanawiam się, jakie są tutaj właściwości …

2
Scalanie obserwacji w procesie Gaussa
Używam procesu Gaussa (GP) do regresji. W moim problemie dość często zdarza się, że dwa lub więcej punktów danych są blisko siebie, względem długości skale problemu. Obserwacje mogą być również bardzo głośne. Aby przyspieszyć obliczenia i poprawić precyzję pomiaru , naturalne wydaje się łączenie / integrowanie skupisk punktów, które są …

1
Czy statystycy wykorzystują wcześniejszą pracę Jeffreysa w rzeczywistej pracy stosowanej?
Kiedy dowiedziałem się o wcześniejszym Jeffreysu w mojej klasie wnioskowania statystycznego, moi profesorowie brzmieli tak, jakby był interesujący głównie ze względów historycznych, a nie dlatego, że ktokolwiek mógłby z niego skorzystać. Potem, kiedy wziąłem analizę danych bayesowskich, nigdy nie zostaliśmy poproszeni o użycie priory Jeffreysa. Czy ktoś faktycznie używa ich …


2
Rodzinna granica błędów: czy ponowne wykorzystanie zestawów danych w różnych badaniach niezależnych pytań prowadzi do wielu problemów z testowaniem?
Jeśli zespół badaczy przeprowadzi wiele testów (hipotez) na danym zbiorze danych, istnieje obszerna literatura, w której stwierdza się, że powinni oni zastosować jakąś formę korekty do testów wielokrotnych (Bonferroni itp.), Nawet jeśli testy są niezależne. Moje pytanie brzmi: czy ta sama logika dotyczy wielu zespołów testujących hipotezy dotyczące tego samego …

1
Oszacuj wariancję populacji, jeśli znana jest średnia populacji
Wiem, że używamy do oszacowania wariancji populacji. Pamiętam wideo z Khan Academy, w którym podana intuicja była taka, że ​​nasza szacunkowa średnia jest prawdopodobnie nieco mniejsza od rzeczywistej, więc odległości byłyby faktycznie większe, więc dzielimy przez mniej ( zamiast ) aby uzyskać większą wartość, co skutkuje lepszym oszacowaniem. Pamiętam gdzieś …
11 variance  sample 

1
Wybór modelu bayesowskiego w PyMC3
Używam PyMC3 do uruchamiania modeli bayesowskich na moich danych. Jestem nowy w modelowaniu bayesowskim, ale według niektórych postów na blogach , Wikipedii i kontroli jakości z tej witryny wydaje się, że poprawnym podejściem jest zastosowanie współczynnika Bayesa i kryterium BIC, aby móc wybrać model najlepiej reprezentujący moje dane (ten, który …

1
Ile dystrybucji jest w GLM?
Zidentyfikowałem wiele miejsc w podręcznikach, w których GLM jest opisany z 5 dystrybucjami (mianowicie, Gamma, Gaussian, Dwumianowy, Odwrotny Gaussian i Poisson). Jest to również zilustrowane funkcją rodzinną w R. Czasami natrafiam na odniesienia do GLM, w których uwzględniono dodatkowe dystrybucje ( przykład ). Czy ktoś może wyjaśnić, dlaczego te 5 …


2
Jakie są różnice między regresją Ridge'a przy użyciu glmnet R i scikit-learn Pythona?
Przeglądam sekcję LAB §6.6 na temat regresji grzbietu / Lasso w książce „An Introduction to Statistics Learning with Applications in R” Jamesa, Witten, Hastie, Tibshirani (2013). Mówiąc dokładniej, próbuję zastosować model scikit-learn Ridgedo zestawu danych „Hitters” z pakietu R „ISLR”. Stworzyłem ten sam zestaw funkcji, jak pokazano w kodzie R. …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.