Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

2
Jak ustawić pionowo dwa wykresy o tej samej skali x, ale innej skali Y w R?
Pozdrowienia, Obecnie wykonuję następujące czynności w języku R: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) Snip of summary.csv: date,revision,file,lines,nclass,nattr,nrel,bytes,compressed,diff,dcomp 2007-07-25,16,model.xml,96,11,22,5,4035,991,0,0 2007-07-27,17,model.xml,115,16,26,6,4740,1056,53,777 …

4
Jak znaleźć przedział ufności dla całkowitej liczby zdarzeń
Mam detektor, który wykryje zdarzenie z pewnym prawdopodobieństwem p . Jeśli wykrywacz powie, że zdarzenie miało miejsce, zawsze tak jest, więc nie ma fałszywych trafień. Po uruchomieniu przez pewien czas wykryto k zdarzeń. Chciałbym obliczyć całkowitą liczbę zdarzeń, które miały miejsce, zostały wykryte lub w inny sposób, z pewną pewnością, …


2
Wizualizacja wielu „histogramów” (wykresy słupkowe)
Mam trudności z wyborem właściwego sposobu wizualizacji danych. Załóżmy, że mamy księgarnie, które sprzedają książki , a każda książka ma co najmniej jedną kategorię . W przypadku księgarni, jeśli policzymy wszystkie kategorie książek, uzyskamy histogram pokazujący liczbę książek należących do określonej kategorii dla tej księgarni. Chcę wyobrazić sobie zachowanie księgarni, …

5
Czy zmienna ma znaczenie w modelu regresji liniowej?
Mam model regresji liniowej z obserwacjami próbki i zmiennych i chcę wiedzieć: Czy określona zmienna jest wystarczająco istotna, aby pozostać uwzględniona w modelu. Czy inna zmienna (z obserwacjami) powinna być uwzględniona w modelu. Jakie statystyki mogą mi pomóc? Jak uzyskać je najbardziej wydajnie?



7
Rozkład normalny i przekształcenia monotoniczne
Słyszałem, że wiele ilości występujących w przyrodzie jest zwykle dystrybuowanych. Jest to zazwyczaj uzasadnione przy użyciu centralnego twierdzenia o limicie, które mówi, że gdy uśrednisz dużą liczbę zmiennych losowych iid, otrzymasz rozkład normalny. Na przykład cecha, która jest określana przez efekt addytywny dużej liczby genów, może być w przybliżeniu normalnie …

4
Obliczanie stosunku przykładowych danych wykorzystywanych do dopasowania / szkolenia modelu i walidacji
Podano wielkość próby „N”, której planuję użyć do prognozowania danych. Jakie są niektóre sposoby podziału danych, aby wykorzystać niektóre z nich do ustanowienia modelu, a pozostałe dane do zweryfikowania modelu? Wiem, że nie ma czarno-białej odpowiedzi na to pytanie, ale byłoby interesujące znać pewne „ogólne zasady” lub zwykle używane proporcje. …





1
Różnica między Naive Bayes a Recurrent Neural Network (LSTM)
Chcę przeprowadzić analizę sentymentu na tekście, przejrzałem kilka artykułów, niektóre z nich używają „Naive Bayes”, a inne to „Recurrent Neural Network (LSTM)” , z drugiej strony widziałem bibliotekę Pythona do analizy sentymentów, która jest nltk. Używa „Naive Bayes”. Czy ktoś może wyjaśnić, jaka jest różnica między używaniem tych dwóch? Przeczytałem …

4
Oczekiwana wartość robaka i jabłka
Jabłko znajduje się na wierzchołku z pięciokąta , a robak znajduje się dwa wierzchołki z dala, na . Każdego dnia robak czołga się z jednakowym prawdopodobieństwem do jednego z dwóch sąsiadujących wierzchołków. Tak więc po jednym dniu robak znajduje się w wierzchołku lub , każdy z prawdopodobieństwem . Po dwóch …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.