Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Modelowanie matematyczne sieci neuronowych jako modeli graficznych
Usiłuję stworzyć matematyczne połączenie między siecią neuronową a modelem graficznym. W modelach graficznych pomysł jest prosty: rozkład prawdopodobieństwa jest rozkładany na czynniki według klików na wykresie, przy czym potencjały zwykle należą do rodziny wykładniczej. Czy istnieje równoważne uzasadnienie dla sieci neuronowej? Czy można wyrazić rozkład prawdopodobieństwa dla jednostek (zmiennych) w …

2
Jak stwierdzić, czy reszty są autokorelowane z grafiką
Kiedy wykonujesz regresję OLS i wykreślasz wynikowe reszty, w jaki sposób możesz stwierdzić, czy reszty są autokorelowane? Wiem, że istnieją na to testy (Durbin, Breusch-Godfrey), ale zastanawiałem się, czy możesz po prostu spojrzeć na wykres, aby ocenić, czy autokorelacja może stanowić problem (ponieważ dla heteroskedastyczności jest to dość łatwe).

1
Jaka jest różnica między statystykami / metodami bez dystrybucji a statystykami nieparametrycznymi?
Z Wikipedii Pierwsze znaczenie nieparametryczne obejmuje techniki, które nie opierają się na danych należących do określonego rozkładu. Należą do nich między innymi: metody bez dystrybucji, które nie opierają się na założeniach, że dane pochodzą z danego rozkładu prawdopodobieństwa. Jako taki jest przeciwieństwem statystyki parametrycznej. Obejmuje nieparametryczne modele statystyczne, wnioskowanie i …

4
Jakie zalety ma regresja Poissona w porównaniu z regresją liniową w tym przypadku?
Otrzymałem zestaw danych, który zawiera liczbę nagród zdobytych przez uczniów w jednym liceum, gdzie predyktory liczby zdobytych nagród obejmują rodzaj programu, w którym uczeń został zapisany, oraz wynik z egzaminu z matematyki. Zastanawiałem się, czy ktoś mógłby mi powiedzieć, dlaczego model regresji liniowej może być nieodpowiedni w tym przypadku i …


1
dopasowanie funkcji wykładniczej przy użyciu najmniejszych kwadratów vs. uogólnionego modelu liniowego vs. nieliniowych najmniejszych kwadratów
Mam zestaw danych, który reprezentuje rozkład wykładniczy. Chciałbym dopasować funkcję wykładniczą do tych danych. Próbowałem log przekształcić zmienną odpowiedzi, a następnie użyć najmniejszych kwadratów, aby dopasować linię; z zastosowaniem uogólnionego modelu liniowego z funkcją logarytmiczną i rozkładem gamma wokół zmiennej odpowiedzi; i używając nieliniowych najmniejszych kwadratów. Otrzymuję inną odpowiedź dla …

2
Interpretacja wyniku k-średnich w R
Użyłem kmeansinstrukcji R do wykonania algorytmu k-średnich w zestawie danych tęczówki Andersona. Mam pytanie dotyczące niektórych parametrów, które otrzymałem. Wyniki są następujące: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 W takim przypadku, co oznacza „klaster”? Czy jest to średnia odległości wszystkich obiektów w klastrze? Również w …


2
Jak połączyć wyniki regresji logistycznej i losowego lasu?
Jestem nowy w uczeniu maszynowym. Zastosowałem regresję logistyczną i losowy las w tym samym zbiorze danych. Dostaję więc zmienne znaczenie (współczynnik bezwzględny dla regresji logistycznej i zmienne znaczenie dla losowego lasu). Myślę o połączeniu tych dwóch, aby uzyskać ostateczną zmienną ważność. Czy ktoś może podzielić się swoim doświadczeniem? Sprawdziłem workowanie, …

2
Porównanie dwóch modeli regresji liniowej
Chciałbym porównać dwa modele regresji liniowej, które reprezentują szybkości degradacji mRNA w czasie w dwóch różnych warunkach. Dane dla każdego modelu zbierane niezależnie. Oto zestaw danych. Rejestr czasu (godziny) (leczenie A) dziennik (leczenie B) 0 2,02 1,97 0 2,04 2,06 0 1,93 1,96 2 2,02 1,91 2 2,00 1,95 2 …

1
Kernelised k Nearest Neighbor
Jestem nowy w jądrach i wpadłem w kłopoty podczas próby jądra kNN. Czynności wstępne Używam wielomianowego jądra: K(x,y)=(1+⟨x,y⟩)dK(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d Twój typowy euklidesowy kNN używa następującej miary odległości: d(x,y)=||x−y||d(x,y)=||x−y||d(\mathbf{x}, \mathbf{y}) = \vert\vert \mathbf{x} - \mathbf{y} \vert\vert Niech f(x)f(x)f(\mathbf{x}) mapa xx\mathbf{x} do jakiejś wyższej wymiarowej przestrzeni cech. …

2
Czy rozwiązania PCA są wyjątkowe?
Czy po uruchomieniu PCA na określonym zestawie danych rozwiązanie jest dla mnie wyjątkowe? To znaczy, otrzymuję zestaw współrzędnych 2d na podstawie odległości między punktami. Czy można znaleźć co najmniej jeszcze jeden układ punktów, który spełniałby te ograniczenia? Jeśli odpowiedź brzmi „tak”, jak mogę znaleźć tak różne rozwiązanie?
12 pca 

1
Przewidywanie uporządkowanego loginu w R.
Próbuję wykonać uporządkowaną regresję logit. Korzystam z takiego modelu (tylko głupi, mały model szacujący liczbę firm na rynku na podstawie miar dochodów i populacji). Moje pytanie dotyczy prognoz. nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) Kiedy uruchamiam przewidywanie (którego próbuję użyć, aby uzyskać przewidywaną wartość y), dane wyjściowe wynoszą 0, 3 lub …

1
Gęstość Y = log (X) dla X rozproszonego gamma
To pytanie jest ściśle związane z tym postem Załóżmy, że mam losową zmienną i zdefiniuję . Chciałbym znaleźć funkcję gęstości prawdopodobieństwa .X∼Gamma(k,θ)X∼Gamma(k,θ)X \sim \text{Gamma}(k, \theta)Y=log(X)Y=log⁡(X)Y = \log(X)YYY Początkowo myślałem, że po prostu zdefiniuję funkcję rozkładu skumulowanego X, dokonam zmiany zmiennej i wezmę „wnętrze” całki jako moją gęstość, podobnie jak P(X≤c)P(Y≤logc)=∫c01θk1Γ(k)xk−1e−xθdx=∫log(c)log(0)1θk1Γ(k)exp(y)k−1e−exp(y)θexp(y)dyP(X≤c)=∫0c1θk1Γ(k)xk−1e−xθdxP(Y≤log⁡c)=∫log⁡(0)log⁡(c)1θk1Γ(k)exp⁡(y)k−1e−exp⁡(y)θexp⁡(y)dy\begin{align} …

2
Wybór funkcji i dostrajanie parametrów z karetką losowego lasu
Mam dane z kilkoma tysiącami funkcji i chcę dokonać rekurencyjnego wyboru funkcji (RFE), aby usunąć te nieinformacyjne. Robię to z karetką i RFE. Jednak zacząłem myśleć, jeśli chcę uzyskać najlepsze dopasowanie regresji (na przykład losowy las), kiedy powinienem przeprowadzić strojenie parametrów ( mtrydla RF)? Tak więc, jak rozumiem, Caret trenuje …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.