Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jaki jest rozkład błędu wokół danych wzrostu logistycznego?
W ekologii często używamy logistycznego równania wzrostu: N.t=K.N.0mir tK.+N.0mir t - 1Nt=KN0ertK+N0ert−1 N_t = \frac{ K N_0 e^{rt} }{K + N_0 e^{rt-1}} lub N.t=K.N.0N.0+ ( K-N.0)mi- r tNt=KN0N0+(K−N0)e−rt N_t = \frac{ K N_0}{N_0 + (K -N_0)e^{-rt}} gdzie jest nośnością (osiągnięta maksymalna gęstość), jest gęstością początkową, jest szybkością wzrostu, jest czasem …
10 r  distributions  pdf  ecology 

2
Jak poprawnie traktować wiele punktów danych dla każdego przedmiotu
Obecnie spieram się z kimś, jak prawidłowo traktować dane za pomocą wielu pomiarów dla każdego przedmiotu. W tym przypadku zebrano dane dla każdego podmiotu w krótkim czasie dla różnych warunków dla każdego podmiotu. Wszystkie pomiary gromadzą dokładnie tę samą zmienną, tylko wielokrotność. Jedną z opcji jest teraz grupowanie danych według …

3
Modele Markowa z prawdopodobieństwami warunkowego przejścia
Po pierwsze, muszę przyznać, że nie jestem tak dobrze zorientowany w statystyce i matematyce, jak bym chciał. Niektórzy mogą powiedzieć, że mają wystarczającą wiedzę, aby być niebezpiecznym. : DI przepraszam, jeśli nie używam terminologii poprawnie. Próbuję modelować prawdopodobieństwo przejścia systemu z jednego stanu do drugiego. Prosty model Markowa to dobry …

3
Gdzie jest wspólna wariancja między wszystkimi IV w liniowym równaniu regresji wielokrotnej?
W równaniu regresji liniowej wielokrotnej, jeśli wagi beta odzwierciedlają udział każdej indywidualnej zmiennej niezależnej ponad udział wszystkich pozostałych IV, gdzie w równaniu regresji jest wariancja wspólna dla wszystkich IV, która przewiduje DV? Na przykład, jeśli diagram Venna wyświetlony poniżej (i wzięty ze strony „about” CV tutaj: https://stats.stackexchange.com/about ) zostałby oznaczony …

2
Jak symulować wyniki na wielu odmianach w R?
W większości sytuacji mamy do czynienia tylko z jedną zmienną wynik / odpowiedź, taką jak y= a + b x + ϵy=a+bx+ϵy = a + bx +\epsilon. Jednak w niektórych scenariuszach, szczególnie w danych klinicznych, zmienne wynikowe mogą być wielowymiarowe / wielowymiarowe. Jak na przykładY=βx+ϵY=βx+ϵ\mathsf{Y} = \beta{x} + \mathsf{\epsilon}, gdzie …

3
Odległość Mahalanobis przez PCA kiedy
Mam macierz , gdzie to liczba genów, a to liczba pacjentów. Każdy, kto pracował z takimi danymi, wie, że jest zawsze większe niż . Korzystając z wyboru funkcji, zredukowałem do bardziej rozsądnej liczby, jednak jest nadal większe niż .n × pn×pn\times ppppnnnpppnnnppppppnnn Chciałbym obliczyć podobieństwo pacjentów na podstawie ich profili …

2
AUC w porządkowej regresji logistycznej
Używam 2 rodzajów regresji logistycznej - jeden jest typem prostym do klasyfikacji binarnej, a drugi to porządkowa regresja logistyczna. Do obliczenia dokładności pierwszego użyłem walidacji krzyżowej, w której obliczyłem AUC dla każdego krotności, a następnie obliczyłem średnią AUC. Jak mogę to zrobić dla porządkowej regresji logistycznej? Słyszałem o uogólnionym ROC …

3
Jak stworzyć system rekomendujący, który integruje funkcje filtrowania grupowego i funkcje treści?
Tworzę system polecający i chcę uwzględnić zarówno oceny „podobnych” użytkowników, jak i cechy produktów. Dane wyjściowe to przewidywana ocena [0-1]. Rozważam sieć neuronową (na początek). Tak więc dane wejściowe są kombinacją cech elementów i ocen każdego użytkownika. Dla elementu A i użytkownika 1 system może zostać przeszkolony na podstawie połączonych …

1
Brakujące wartości w zmiennej odpowiedzi w JAGS
Gelman i Hill (2006) mówią: W Bugs brakujące wyniki w regresji można łatwo rozwiązać, po prostu włączając wektor danych, NA i wszystkie. Błędy jawnie modelują zmienną wynikową, dlatego użycie tego modelu jest banalne, aby w efekcie przypisywać brakujące wartości przy każdej iteracji. Brzmi to jak prosty sposób na wykorzystanie JAGS …

1
Zastrzeżenia do randomizacji
W badaniach klinicznych - perspektywa metodologiczna , pisze Steven Piantadosi (rozdz. 13, s. 334): W rozdziale 2 zwróciłem uwagę na zarzuty dotyczące randomizacji Abla i Kocha (1997) i Urbacha (1993) oraz wskazałem na wartość badania ich obaw i prawdopodobnych błędów. Odrzucają randomizację jako oznacza walidację niektórych testów statystycznych, podstawa wnioskowania …

1
Udowodnienie sekwencji zmniejsza się (obsługiwane przez wykreślenie dużej liczby punktów)
Wiele pytań, które opublikowałem na SE w ostatnim miesiącu, miało na celu pomóc mi rozwiązać ten konkretny problem. Na wszystkie pytania udzielono odpowiedzi, ale wciąż nie mogę znaleźć rozwiązania. Pomyślałem więc, że powinienem po prostu zapytać o problem, który próbuję rozwiązać bezpośrednio. Niech , gdzie , , (liczba całkowita), a …

1
vcovHC, vcovHAC, NeweyWest - jakiej funkcji użyć?
Próbuję zaktualizować mój model oparty na lm (), aby uzyskać poprawne standardowe błędy i testy. Jestem naprawdę zdezorientowany, której matrycy VC użyć. Do sandwichoferty pakietowe vcovHC, vcovHACi NeweyWest. Podczas gdy te pierwsze uwzględniają tylko heteroskedastyczność, drugie dwa uwzględniają zarówno szeregową korelację, jak i heteroskedastyczność. Jednak dokumentacja niewiele mówi o różnicy …

1
Filtr Kalmana a wygładzanie splajnów
P: Dla jakich danych właściwe jest stosowanie modelowania w przestrzeni stanów i filtrowania Kalmana zamiast wygładzania splajnów i odwrotnie? Czy istnieje jakaś relacja równoważności między nimi? Próbuję uzyskać ogólne zrozumienie, w jaki sposób te metody pasują do siebie. Przeglądałem nowe oszacowanie Gaussa: Modele sekwencyjne i wielorozdzielcze Johnstone'a . Zaskakujące było …


3
Regresja liniowa z czynnikami w R
Próbuję zrozumieć, jak dokładnie działają czynniki w R. Powiedzmy, że chcę uruchomić regresję przy użyciu przykładowych danych w R: > data(CO2) > colnames(CO2) [1] "Plant" "Type" "Treatment" "conc" "uptake" > levels(CO2$Type) [1] "Quebec" "Mississippi" > levels(CO2$Treatment) [1] "nonchilled" "chilled" > lm(uptake ~ Type + Treatment, data = CO2) Call: lm(formula …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.