Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych


3
Jak korzystać z DLM z filtrowaniem Kalmana do prognozowania
Czy ktoś mógłby poprowadzić mnie przez przykład użycia filtrowania DLM Kalmana w R w szeregach czasowych. Powiedzmy, że mam te wartości (wartości kwartalne z roczną sezonowością); jak użyłbyś DLM do przewidywania kolejnych wartości? A tak przy okazji, czy mam wystarczającą ilość danych historycznych (co jest minimum)? 89 2009Q1 82 2009Q2 …


3
Jak pobierać próbki z
Chcę próbkować zgodnie z gęstością gdzie i są ściśle pozytywne. (Motywacja: może to być przydatne do próbkowania Gibbsa, gdy parametr kształtu gęstości gamma ma wcześniejszą jednolitość).cdf(a)∝cada−1Γ(a)1(1,∞)(a)f(a)∝cada−1Γ(a)1(1,∞)(a) f(a) \propto \frac{c^a d^{a-1}}{\Gamma(a)} 1_{(1,\infty)}(a) cccddd Czy ktoś wie, jak łatwo pobierać próbki z tej gęstości? Może to standard i coś, o czym nie …

3
Czy statystyki bayesowskie są rzeczywiście poprawą w stosunku do tradycyjnych (częstych) statystyk dla badań behawioralnych?
Podczas udziału w konferencjach zwolennicy statystyki bayesowskiej mieli niewielki nacisk na ocenę wyników eksperymentów. Jest chwalony za bardziej wrażliwy, odpowiedni i wybiórczy w stosunku do prawdziwych ustaleń (mniej fałszywych wyników pozytywnych) niż częste statystyki. Zagłębiłem się nieco w ten temat i jak dotąd nie jestem przekonany o korzyściach płynących z …



2
Kiedy dzisiaj ma znaczenie „najbliższy sąsiad”?
W 1999 r. Beyer i in. zapytał, kiedy „Nearest Neighbor” ma znaczenie? Czy istnieją lepsze sposoby analizy i wizualizacji wpływu płaskości odległości na wyszukiwanie NN od 1999 r.? Czy [dany] zestaw danych zawiera sensowne odpowiedzi na problem 1-NN? Problem 10-NN? Problem 100-NN? Jak dziś eksperci podchodzą do tego pytania? Edycje …


1
Interpretacja wykresów analizy korespondencji 2D
Szukałem w Internecie daleko i daleko ... Muszę znaleźć naprawdę dobry przegląd interpretacji wykresów analizy korespondencji 2D. Czy ktoś mógłby udzielić porady na temat interpretacji odległości między punktami? Być może przydałby się przykład, oto spisek znaleziony na wielu stronach, które widziałem, omawiający analizę korespondencji. Czerwone trójkąty przedstawiają kolor oczu, a …


7
Miary złożoności modelu
Jak możemy porównać złożoność dwóch modeli o tej samej liczbie parametrów? Edytuj 09/19 : Aby wyjaśnić, złożoność modelu jest miarą tego, jak trudno jest uczyć się na podstawie ograniczonych danych. Gdy dwa modele równie dobrze pasują do istniejących danych, model o mniejszej złożoności da mniejszy błąd w przyszłych danych. Gdy …

6
Jaka jest „podstawowa” koncepcja uczenia maszynowego do szacowania parametrów?
„Podstawową” ideą statystyki do szacowania parametrów jest maksymalne prawdopodobieństwo . Zastanawiam się, jaki jest odpowiedni pomysł w uczeniu maszynowym. Qn 1. Czy uczciwie byłoby powiedzieć, że „podstawową” ideą uczenia maszynowego do szacowania parametrów jest: „Funkcje utraty” [Uwaga: mam wrażenie, że algorytmy uczenia maszynowego często optymalizują funkcję strat i stąd powyższe …


10
Materiały do ​​nauki tworzenia wizualizacji danych?
Chciałbym dowiedzieć się, jak tworzyć wizualizacje widoczne na stronie http://flowingdata.com i informationisbeautiful. EDYCJA: Znaczenie, wizualizacje, które są interesujące same w sobie - trochę jak grafika NY Times, w przeciwieństwie do szybkiego czegoś na raport. Jakiego rodzaju narzędzia są używane do ich tworzenia - czy to w większości dużo Adobe Illustrator …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.