Biorąc pod uwagę liczb, gdzie wartość każdej liczby jest inna, oznaczona jako , a prawdopodobieństwo wyboru każdej liczby wynosi odpowiednio .
Teraz, jeśli liczby na podstawie podanych prawdopodobieństw, gdzie , jakie jest oczekiwanie sumy tych liczb ? Zauważ, że zaznaczenie nie jest zastępowane, więc liczby nie mogą obejmować zduplikowanych liczb. Rozumiem, że jeśli wybór jest z zastąpieniem, oczekiwanie sumy liczb jest równe , gdzie
Ponadto, co z oczekiwaniem wariancji tych liczb ?
Jestem doktorantem CS, który pracuje nad problemem dużych zbiorów danych i nie mam żadnych statystyk. Oczekuję, że ktoś może dać mi formułę jako odpowiedź. Jeśli jednak odpowiedź jest zbyt skomplikowana, aby ją opisać formułą lub konieczne jest zastosowanie intensywnego obliczenia, przybliżona odpowiedź jest całkowicie akceptowalna.
Możesz założyć, że jest tutaj dość duże, a prawdopodobieństwo może być bardzo różne. W praktyce wartości tych prawdopodobieństw pochodzą z dziennika zapytań, który rejestruje serię zapytań agregacyjnych. Chodzi o to, że częstotliwość każdej liczby uczestniczącej w zapytaniach może być dość wypaczona, tj. Niektóre są rzadko pytane, a niektóre bardzo często. Możesz założyć, że rozkład prawdopodobieństwa jest rozkładem normalnym, rozkładem zipf lub innymi rozsądnymi alternatywami.
Rozkład wartości jest tylko ciągłym podzbiorem każdego możliwego rozkładu. Innymi słowy, jeśli masz histogram reprezentujący pewien rozkład, wszystkie liczby zaangażowane w ten problem to liczby znajdujące się w jednym segmencie.
Pod względem wartości K można założyć, że jest ona zawsze mniejsza niż liczba często zadawanych elementów.