Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Po co używać opóźnionego DV jako zmiennej instrumentalnej?
Odziedziczyłem kod analizy danych, który nie będąc ekonometrycznym, staram się zrozumieć. Jeden model uruchamia regresję zmiennych instrumentalnych za pomocą następującego polecenia Stata ivreg my_dv var1 var2 var3 (L.my_dv = D2.my_dv D3.my_dv D4.my_dv) Ten zestaw danych jest panelem z wieloma sekwencyjnymi obserwacjami dla tego zestawu zmiennych. Dlaczego ten kod używa opóźnionych …

4
Jak mogę (liczbowo) aproksymować wartości dla rozkładu beta z dużymi wartościami alfa i beta
Czy istnieje stabilny numerycznie sposób obliczania wartości rozkładu beta dla dużej liczby całkowitej alfa, beta (np. Alfa, beta> 1000000)? Właściwie potrzebuję tylko 99% przedziału ufności wokół trybu, jeśli to w jakiś sposób ułatwi problem. Dodaj : Przepraszam, moje pytanie nie było tak jasno określone, jak myślałem. Chcę to zrobić: mam …


4
Jak duża powinna być próbka dla danej techniki szacowania i parametrów?
Czy istnieje ogólna zasada, a nawet jakikolwiek sposób określający, jak duża powinna być próbka, aby oszacować model o określonej liczbie parametrów? Na przykład, jeśli chcę oszacować regresję metodą najmniejszych kwadratów z 5 parametrami, jak duża powinna być próbka? Czy ma znaczenie, jakiej techniki szacowania używasz (np. Maksymalne prawdopodobieństwo, najmniejsze kwadraty, …

3
Jak mogę sprawdzić, czy moje grupowanie danych binarnych jest znaczące
Robię analizy koszyka na zakupy. Mój zestaw danych to zbiór wektorów transakcji z produktami, które są kupowane. Kiedy stosuję k-średnich w transakcjach, zawsze otrzymam jakiś wynik. Matryca losowa prawdopodobnie pokazywałaby także niektóre skupienia. Czy istnieje sposób na sprawdzenie, czy skupienie, które znalazłem, jest znaczące, czy też może być bardzo przypadkowe. …

1
Jak znaleźć punkty próbne, które mają statystycznie znaczące stosunki wartości odstających między dwiema wartościami punktu?
Jako przykładową aplikację rozważ następujące dwie właściwości użytkowników stosu przepełnienia stosu: liczy się reputacja i widok profilu . Oczekuje się, że dla większości użytkowników te dwie wartości będą proporcjonalne: użytkownicy o wysokiej liczbie powtórzeń przyciągają więcej uwagi, a tym samym uzyskują więcej widoków profilu. Dlatego interesujące jest wyszukiwanie użytkowników, którzy …
12 ratio 

1
Co pokazuje wykres autokorelacji (pandy)?
Jestem początkującym i staram się zrozumieć, co pokazuje wykres autokorelacji. Przeczytałem kilka wyjaśnień z różnych źródeł, takich jak ta strona lub powiązana strona Wikipedii, między innymi, że nie przytaczam tutaj. Mam ten bardzo prosty kod, w którym mam daty w moim indeksie na rok, a wartości po prostu zwiększają się …

3
Dzielenie danych szeregów czasowych na zestawy pociągu / testu / walidacji
Jaki jest najlepszy sposób na podzielenie danych szeregów czasowych na zestawy pociągu / testu / walidacji, gdzie zestaw walidacji byłby wykorzystywany do strojenia hiperparametrów? Mamy 3-letnie dzienne dane dotyczące sprzedaży, a naszym planem jest wykorzystanie danych szkoleniowych 2015-2016, a następnie losowe próbkowanie 10 tygodni z danych z 2017 r., Które …

2
Jak głęboki jest związek między funkcją softmax w ML a rozkładem Boltzmanna w termodynamice?
Funkcja softmax, powszechnie stosowana w sieciach neuronowych do przekształcania liczb rzeczywistych na prawdopodobieństwa, jest taką samą funkcją jak rozkład Boltzmanna, rozkład prawdopodobieństwa nad energiami dla zespołu cząstek w równowadze termicznej w danej temperaturze T w termodynamice. Widzę pewne wyraźne heurystyczne powody, dla których jest to praktyczne: Bez względu na to, …

2
Dlaczego istnieją zalecenia, aby nie używać Jeffreysa lub priorów opartych na entropii dla samplerów MCMC?
Na swojej stronie wiki twórcy Stana stwierdzają: Niektóre zasady, których nie lubimy: niezmienność, Jeffreys, entropia Zamiast tego widzę wiele normalnych zaleceń dotyczących dystrybucji. Do tej pory korzystałem z metod bayesowskich, które nie polegały na próbkowaniu, i byłem zadowolony, że zrozumiałem, dlaczego był dobrym wyborem dla prawdopodobieństw dwumianowych.θ ∼ Beta ( …
12 bayesian  mcmc  prior  pymc  stan 


2
Wybrałeś rozmiar filtra, kroki itp. W CNN?
Patrzyłem na wykłady CS231N z Stanford i staram się ominąć niektóre problemy w architekturach CNN. Próbuję zrozumieć, czy istnieją jakieś ogólne wytyczne dotyczące wybierania rozmiaru filtra splotowego i rzeczy takich jak postępy, czy też jest to bardziej sztuka niż nauka? Rozumiem, że gromadzenie danych istnieje głównie w celu wywołania pewnej …




Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.