Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Instalacja dystrybucji Beta w Scipy
Według Wikipedii rozkład prawdopodobieństwa beta ma dwa parametry kształtu: i .αα\alphaββ\beta Kiedy wywołuję scipy.stats.beta.fit(x)Python, gdzie xjest wiązka liczb z zakresu , zwracane są 4 wartości. Wydaje mi się to dziwne.[0,1][0,1][0,1] Po google przeszukałem, że jedną z zwracanych wartości musi być „lokalizacja”, ponieważ trzecią zmienną jest 0, jeśli zadzwonię scipy.stats.beta.fit(x, floc=0). …


4
Jakie są studia przypadków w badaniach polityki zdrowia publicznego, w których nieuczciwe / mylone / nieprawidłowe badania lub modele były niewłaściwie wykorzystywane?
Przygotowuję przegląd literatury na temat aktualnego problemu zdrowia publicznego, w którym dane są pomieszane: Jakie są typowe historyczne studia przypadków wykorzystywane w edukacji zdrowotnej / epidemiologicznej, w których nieważne lub zakłócone relacje lub wnioski były celowo lub błędnie stosowane w polityce i ustawodawstwie w zakresie zdrowia publicznego? Fala fatality samochodowe …

1
Radzenie sobie z brakującymi danymi w modelu wygładzania wykładniczego
Wydaje się, że nie ma standardowego sposobu radzenia sobie z brakującymi danymi w kontekście rodziny modeli wygładzania wykładniczego. W szczególności implementacja R zwana ets w pakiecie prognozy wydaje się brać najdłuższą podsekwencję bez brakujących danych, a książka „Prognozowanie z wygładzaniem wykładniczym” Hyndmana i in. wydaje się wcale nie mówić o …

1
Nieliniowa regresja efektów mieszanych w R
Co zaskakujące, nie byłem w stanie znaleźć odpowiedzi na następujące pytanie za pomocą Google: Mam pewne dane biologiczne od kilku osób, które pokazują z grubsza esicy zachowanie wzrostu w czasie. Dlatego chcę go modelować przy użyciu standardowego wzrostu logistycznego P(t) = k*p0*exp(r*t) / (k+p0*(exp(r*t)-1)) gdzie p0 jest wartością początkową przy …


4
Praktyczny przykład dla MCMC
Przechodziłem wykłady związane z MCMC. Nie znalazłem jednak dobrego przykładu tego, jak się go używa. Czy ktoś może dać mi konkretny przykład. Widzę tylko, że prowadzą łańcuch Markowa i mówią, że jego rozkład stacjonarny jest rozkładem pożądanym. Chcę dobrego przykładu, w którym trudno jest pobrać żądany rozkład. Tworzymy łańcuch Markowa. …

3
Generuj pary liczb losowych równomiernie rozmieszczonych i skorelowanych
Chciałbym wygenerować pary liczb losowych z pewną korelacją. Jednak zwykłe podejście polegające na stosowaniu kombinacji liniowej dwóch zmiennych normalnych nie jest tutaj poprawne, ponieważ kombinacja liniowa zmiennych jednolitych nie jest już zmienną równomiernie rozłożoną. Potrzebuję dwóch zmiennych, aby były jednolite. Masz pomysł, jak wygenerować pary zmiennych jednorodnych o zadanej korelacji?

2
Optymalizacja: źródło wszelkiego zła w statystykach?
Słyszałem wcześniej następujące wyrażenie: „Optymalizacja jest źródłem wszelkiego zła w statystykach”. Na przykład najlepsza odpowiedź w tym wątku zawiera to stwierdzenie w związku z niebezpieczeństwem zbyt agresywnej optymalizacji podczas wyboru modelu. Moje pierwsze pytanie brzmi: czy ten cytat można przypisać komukolwiek w szczególności? (np. w literaturze statystycznej) Z tego, co …


4
Wnioskowanie dla sceptycznego (ale nie niechętnego matematyce) czytelnika
Właśnie obejrzałem wykład na temat wnioskowania statystycznego („porównywanie proporcji i środków”), będący częścią wstępu do kursu online dotyczącego statystyk. Materiał miał dla mnie jak najmniej sensu, jak zawsze (do tej pory musiałem to widzieć dziesiątki razy, rozłożone w ciągu ostatnich trzech dekad). Szukam książki o „podstawowych statystykach-101” (ocena punktowa, ocena …

2
Związek między testem McNemara a warunkową regresją logistyczną
Interesuje mnie modelowanie danych odpowiedzi binarnej w sparowanych obserwacjach. Naszym celem jest wnioskowanie o skuteczności interwencji poprzedzającej post w grupie, potencjalnie dostosowując się do kilku zmiennych towarzyszących i ustalając, czy istnieje modyfikacja efektu przez grupę, która przeszła szczególnie różne szkolenie w ramach interwencji. Biorąc pod uwagę dane o następującej formie: …

5
Metoda generowania skorelowanych nienormalnych danych
Chciałbym znaleźć metodę generowania skorelowanych, nienormalnych danych. Idealnie więc jakiś rodzaj rozkładu, który przyjmuje parametr kowariancji (lub korelacji) jako parametr i generuje dane, które ją przybliżają. Ale tutaj jest haczyk: metoda, którą próbuję znaleźć, powinna mieć elastyczność, aby kontrolować również jej wielowymiarową skośność i / lub kurtozę. Znam metodę Fleishmana …

2
Czy regresja krokowa zapewnia tendencyjne oszacowanie kwadratowej liczby ludności?
W psychologii i innych dziedzinach często stosuje się formę regresji stopniowej, która obejmuje: Spójrz na pozostałe predyktory (początkowo nie ma ich w modelu) i zidentyfikuj predyktor, który powoduje największą zmianę r-kwadrat; Jeśli wartość p zmiany r-kwadrat jest mniejsza niż alfa (zazwyczaj 0,05), to włącz ten predyktor i wróć do kroku …

2
Dlaczego prawdopodobieństwo zerowe dla dowolnej wartości rozkładu normalnego?
Zauważyłem, że w rozkładzie normalnym prawdopodobieństwo wynosi zero, natomiast dla rozkładu Poissona nie będzie równe zero, gdy jest liczbą całkowitą nieujemną.P(x=c)P(x=c)P(x=c)ccc Moje pytanie brzmi: czy prawdopodobieństwo jakiejkolwiek stałej w rozkładzie normalnym wynosi zero, ponieważ reprezentuje pole pod dowolną krzywą? Czy to tylko reguła do zapamiętania?

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.