Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

1
Jaka jest dopuszczalna wartość kryterium Calinski & Harabasz (CH)?
Przeprowadziłem analizę danych, próbując zgrupować dane podłużne przy użyciu R i pakietu kml . Moje dane zawierają około 400 indywidualnych trajektorii (jak to się nazywa w artykule). Możesz zobaczyć moje wyniki na poniższym obrazku: Po przeczytaniu rozdziału 2.2 „Wybór optymalnej liczby klastrów” w odpowiednim artykule nie otrzymałem żadnych odpowiedzi. Wolałbym …

3
LSA vs. PCA (klastrowanie dokumentów)
Badam różne techniki stosowane w grupowaniu dokumentów i chciałbym wyjaśnić pewne wątpliwości dotyczące PCA (analiza głównego składnika) i LSA (utajona analiza semantyczna). Po pierwsze - jakie są między nimi różnice? Wiem, że w PCA rozkład SVD jest stosowany do macierzy kowariancji terminów, podczas gdy w LSA jest to matryca termin-dokument. …

1
Porównywanie poziomów czynników po GLM w R
Oto kilka informacji na temat mojej sytuacji: moje dane odnoszą się do liczby ofiar, które z powodzeniem zjadły drapieżniki. Ponieważ liczba ofiar jest ograniczona (25 dostępnych) w każdej próbie, miałem kolumnę „Próbka” reprezentującą liczbę dostępnej ofiary (czyli 25 w każdej próbie), a drugą o nazwie „Liczba”, która była liczbą powodzenia …

2
Jaki jest bayesowski odpowiednik ogólnego testu dopasowania?
Mam dwa zestawy danych, jeden z zestawu obserwacji fizycznych (temperatur), a drugi z zestawu modeli numerycznych. Robię analizę idealnego modelu, zakładając, że zespół modeli reprezentuje prawdziwą, niezależną próbkę i sprawdzam, czy obserwacje pochodzą z tego rozkładu. Statystyka, którą obliczyłem, jest znormalizowana i teoretycznie powinna być standardowym rozkładem normalnym. Oczywiście nie …

2
Jak sprawdzić, czy dane są zgodne z rozkładem Poissona w R?
Jestem studentem studiów licencjackich i mam projekt do mojej klasy prawdopodobieństwa. Zasadniczo mam zbiór danych o huraganach, które nawiedziły mój kraj przez szereg lat. W mojej Księdze prawdopodobieństwa (Prawdopodobieństwo i statystyka z R) znajduje się (niekompletny) przykład, jak sprawdzić, czy dane są zgodne z rozkładem Poissona, zaczynają próbować udowodnić, że …

3
Czy kod R jest produkcyjny (wdrożony)?
Przeczytałem wiele artykułów, które mówią o firmach takich jak Google, Facebook i wielu innych używających R. do badań. Innym scenariuszem, o którym czytałem, są firmy używające R do prototypowania rozwiązania analitycznego, a następnie ponownego wdrożenia go w innym języku. Próbuję znaleźć literaturę na temat firm używających języka R do rzeczywistego …
25 r  references 

5
Lektura wprowadzająca na temat Copulas
Od pewnego czasu szukam dobrej lektury wprowadzającej na temat Copulas na moje seminarium. Znajduję wiele materiałów, które mówią o aspektach teoretycznych, co jest dobre, ale zanim przejdę do nich, staram się zbudować dobre intuicyjne zrozumienie tego tematu. Czy ktoś mógłby zasugerować jakieś dobre artykuły, które stanowią dobry fundament dla początkującego …

3
Jak modelować ten dziwny rozkład (prawie odwrotny J)
Moja zmienna zależna pokazana poniżej nie pasuje do żadnej znanej mi dystrybucji. Regresja liniowa wytwarza nieco nienormalne, wypaczone w prawo resztki, które w dziwny sposób odnoszą się do przewidywanego Y (drugi wykres). Wszelkie sugestie dotyczące transformacji lub innych sposobów uzyskania najbardziej aktualnych wyników i najlepszej dokładności predykcyjnej? Jeśli to możliwe, …

2
Czy „Hunting of the Snark” Joela Spolsky'ego zawiera poprawną analizę treści statystycznych?
Jeśli ostatnio czytałeś biuletyny społecznościowe, prawdopodobnie widziałeś The Hunting of the Snark, post na oficjalnym blogu StackExchange autorstwa Joela Spolsky'ego, CEO sieci StackExchange. Omawia analizę statystyczną przeprowadzoną na próbie komentarzy SE w celu oceny ich „przyjazności” z perspektywy użytkownika zewnętrznego. Komentarze zostały losowo pobrane z StackOverflow, a analitycy treści byli …


6
Jak sieć neuronowa rozpoznaje obrazy?
To pytanie zostało przeniesione z przepełnienia stosu, ponieważ można na nie odpowiedzieć w ramach weryfikacji krzyżowej. Migrował 7 lat temu . Próbuję dowiedzieć się, jak sieć neuronowa działa na rozpoznawanie obrazów. Widziałem kilka przykładów i stałem się jeszcze bardziej zdezorientowany. W przykładzie rozpoznawania liter obrazu 20 x 20 wartości każdego …

3
Przedział ufności dla wariancji przy jednej obserwacji
Jest to problem z „7 Olimpiady Kołmogorowskiej w teorii prawdopodobieństwa”: Biorąc pod uwagę jedno spostrzeżenie z rozkładu nazwa z oboma parametrami nieznanymi, podaj przedział ufności dla z poziomem ufności co najmniej 99%.Normalna ( μ , σ 2 ) σ 2XXXNormal(μ,σ2)Normal⁡(μ,σ2)\operatorname{Normal}(\mu,\sigma^2)σ2σ2)\sigma^2 Wydaje mi się, że powinno to być niemożliwe. Mam rozwiązanie, …

2
Porównywanie wygładzających wypustów vs less do wygładzania?
Chciałbym lepiej zrozumieć zalety / wady stosowania splajnów less lub wygładzających do wygładzania niektórych krzywych. Inną odmianą mojego pytania jest to, czy istnieje sposób na skonstruowanie wygładzającego splajnu w sposób, który da takie same wyniki, jak użycie lessa. Wszelkie odniesienia lub informacje są mile widziane.


3
Jak zmierzyć gładkość szeregu czasowego w R?
Czy istnieje dobry sposób pomiaru gładkości szeregu czasowego w R? Na przykład, -1, -0.8, -0.6, -0.4, -0.2, 0, 0.2, 0.4, 0.6, 0.8, 1.0 jest znacznie gładszy niż -1, 0.8, -0.6, 0.4, -0.2, 0, 0.2, -0.4, 0.6, -0.8, 1.0 chociaż mają takie same średnie i standardowe odchylenie. Byłoby fajnie, gdyby istniała …
25 r  time-series 

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.