Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

4
Brak przechodniości korelacji: korelacje między płcią a rozmiarem mózgu oraz między wielkością mózgu a ilorazem inteligencji, ale brak korelacji między płcią a ilorazem inteligencji
Na blogu znalazłem następujące wyjaśnienie i chciałbym uzyskać więcej informacji na temat nieprzechodniości korelacji: Mamy następujące niepodważalne fakty: Przeciętnie istnieje różnica w objętości mózgu między mężczyznami i kobietami Istnieje korelacja między IQ a rozmiarem mózgu; korelacja wynosi 0,33, a zatem odpowiada 10% zmienności IQ Z przesłanek 1 i 2 wynika …

4
Trenowanie ukrytego modelu Markowa, wiele instancji treningowych
Wdrożyłem dyskretny HMM zgodnie z tym samouczkiem http://cs229.stanford.edu/section/cs229-hmm.pdf Ten samouczek i inni zawsze mówią o szkoleniu HMM, biorąc pod uwagę sekwencję obserwacji. Co się stanie, gdy mam wiele sekwencji treningowych? Czy powinienem je kolejno uruchamiać, trenując model po drugim? Inną opcją jest łączenie sekwencji w jedną i trenowanie na niej, …


2
Dlaczego optymalizacja mieszanki Gaussa bezpośrednio jest trudna obliczeniowo?
Rozważ logarytmiczne prawdopodobieństwo mieszanki Gaussów: l(Sn;θ)=∑t=1nlogf(x(t)|θ)=∑t=1nlog{∑i=1kpif(x(t)|μ(i),σ2i)}l(Sn;θ)=∑t=1nlog⁡f(x(t)|θ)=∑t=1nlog⁡{∑i=1kpif(x(t)|μ(i),σi2)}l(S_n; \theta) = \sum^n_{t=1}\log f(x^{(t)}|\theta) = \sum^n_{t=1}\log\left\{\sum^k_{i=1}p_i f(x^{(t)}|\mu^{(i)}, \sigma^2_i)\right\} Zastanawiałem się, dlaczego trudno było obliczeniowo bezpośrednio zmaksymalizować to równanie? Szukałem albo wyraźnej, solidnej intuicji, dlaczego powinno być oczywiste, że jest to trudne, a może bardziej rygorystyczne wyjaśnienie, dlaczego jest trudne. Czy ten problem jest NP-zupełny, …

9
Zapytanie referencyjne: Uogólnione modele liniowe
Szukam książki wprowadzającej do poziomu średniego na temat ogólnych modeli liniowych. Idealnie, oprócz teorii leżącej u podstaw modeli, chciałbym, aby zawierały aplikacje i przykłady w języku R lub innym języku programowania - słyszę, że SAS jest również popularnym wyborem. Zamierzam przestudiować go na własną rękę, więc pomogłoby, gdyby dostarczył odpowiedzi …

1
Co dokładnie nazywa się „głównym składnikiem” w PCA?
Załóżmy, jest wektorem, który maksymalizuje odchylenie występu danych z matrycy projektu .XuuuXXX Teraz widziałem materiały, które określają jako (pierwszy) główny składnik danych, który jest również wektorem własnym o największej wartości własnej.uuu Widziałem jednak również, że głównym składnikiem danych jest .XuXuX u Oczywiście i to różne rzeczy. Czy ktoś może mi …

1
Algorytmy grupowania, które działają na rzadkich macierzach danych [zamknięte]
Zamknięte. To pytanie jest nie na temat . Obecnie nie przyjmuje odpowiedzi. Chcesz poprawić to pytanie? Zaktualizuj pytanie, aby było tematem dotyczącym weryfikacji krzyżowej. Zamknięte 5 lat temu . Próbuję skompilować listę algorytmów klastrowania, które są: Zaimplementowano w R Operuj na rzadkich macierzach danych (nie (nie) macierzach podobieństwa), takich jak …
18 r  clustering  sparse 

3
Jak obliczyć standardowe błędy współczynników regresji logistycznej
Korzystam ze scikit-learn Pythona do trenowania i testowania regresji logistycznej. scikit-learn zwraca współczynniki regresji zmiennych niezależnych, ale nie podaje standardowych błędów współczynników. Potrzebuję tych standardowych błędów, aby obliczyć statystykę Walda dla każdego współczynnika i z kolei porównać te współczynniki ze sobą. Znalazłem jeden opis, w jaki sposób obliczyć standardowe błędy …


9
Galeria wykresów, diagramów i typów wykresów
Co poleciłbyś jako obszerną galerię technik prezentacji danych? Źródło, do którego można się odwoływać, gdy zastanawiasz się nad lepszymi sposobami prezentacji danych? Zidentyfikowałem następujące, ale chętnie dodacie swoje: Galerie online: http://www.mathworks.com/discovery/gallery.html http://www.idlcoyote.com/gallery/ https://developers.google.com/chart/interactive/docs/gallery?csw=1 http://www.walkingrandomly.com/?p=4788 http://en.wikipedia.org/wiki/Category:Statistic_charts_and_diagrams (nie zapewnia jednostronicowej galerii graficznej) http://docs.ggplot2.org/current/ http://www.itl.nist.gov/div898/handbook/graphgal.htm http://scikit-learn.org/stable/auto_examples/index.html http://www.stata.com/support/faqs/graphics/gph/stata-graphs/ http://shiny.rstudio.com/gallery/ https://bl.ocks.org/ (grafika interaktywna i wektorowa) …


1
W jaki sposób MANOVA jest powiązana z LDA?
W kilku miejscach widziałem twierdzenie, że MANOVA jest jak ANOVA plus liniowa analiza dyskryminacyjna (LDA), ale zawsze była wykonywana w sposób machający ręką. Chciałbym wiedzieć, co to dokładnie znaczy. Znalazłem różne podręczniki opisujące wszystkie szczegóły obliczeń MANOVA, ale wydaje się, że bardzo trudno jest znaleźć dobrą ogólną dyskusję (nie mówiąc …


1
Klastrowe błędy standardowe a modelowanie wielopoziomowe?
Przejrzałem kilka książek (Raudenbush i Bryk, Snijders i Bosker, Gelman & Hill itp.) Oraz kilka artykułów (Gelman, Jusko, Primo i Jacobsmeier itp.), I nadal nie zawinąłem głowy główne różnice między używaniem klastrowanych błędów standardowych i wielopoziomowego modelowania. Rozumiem części, które muszą mieć do czynienia z pytaniem badawczym; istnieją pewne rodzaje …

2
Wpływ granic bin na podstawie danych na test dobroci dopasowania chi-kwadrat?
Pomijając oczywistą kwestię niskiej mocy chi-kwadrat w tego rodzaju okolicznościach, wyobraź sobie, że wykonujesz test dobroci chi-kwadrat dla pewnej gęstości z nieokreślonymi parametrami, poprzez binowanie danych. Dla konkretności, powiedzmy rozkład wykładniczy z nieznaną średnią i wielkość próby powiedzmy 100. Aby uzyskać rozsądną liczbę spodziewanych obserwacji na przedział, należałoby wziąć pod …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.