Statystyki i duże zbiory danych

Pytania i odpowiedzi dla osób zainteresowanych statystyką, uczeniem maszynowym, analizą danych, eksploracją danych i wizualizacją danych

3
Jak rozumieć dane wyjściowe z funkcji polr R (uporządkowana regresja logistyczna)?
Jestem nowy w R, uporządkowałem regresję logistyczną i polr. Sekcja „Przykłady” u dołu strony pomocy dla polr (która pasuje do modelu regresji logistycznej lub probitowej do uporządkowanej odpowiedzi czynnikowej) pokazuje options(contrasts = c("contr.treatment", "contr.poly")) house.plr <- polr(Sat ~ Infl + Type + Cont, weights = Freq, data = housing) pr …
26 r  logistic 


7
Jak zdecydować, jakiego zakresu użyć w regresji LOESS w R?
Korzystam z modeli regresji LOESS w R i chcę porównać wyniki 12 różnych modeli o różnych wielkościach próbek. Potrafię opisać rzeczywiste modele bardziej szczegółowo, jeśli pomoże to w udzieleniu odpowiedzi na pytanie. Oto przykładowe rozmiary: Fastballs vs RHH 2008-09: 2002 Fastballs vs LHH 2008-09: 2209 Fastballs vs RHH 2010: 527 …
26 r  regression  loess 

5
Kiedy podejście Fishera do „zdobywaj więcej danych” ma sens?
Cytując świetną odpowiedź Gunga Podobno badacz zwrócił się kiedyś do Fishera z „nieistotnymi” wynikami, pytając go, co powinien zrobić, a Fisher powiedział „idź zdobyć więcej danych”. Z punktu widzenia Neymana-Pearsona jest to rażące hakowanie ppp , ale czy istnieje przypadek użycia, w którym podejście Fishera do pobierania większej ilości danych …


1
Strata treningowa spada i rośnie. Co się dzieje?
Moja strata treningowa spada, a potem znowu rośnie. To jest bardzo dziwne. Strata weryfikacji krzyżowej śledzi utratę treningu. Co się dzieje? Mam dwa skumulowane LSTMS w następujący sposób (na Keras): model = Sequential() model.add(LSTM(512, return_sequences=True, input_shape=(len(X[0]), len(nd.char_indices)))) model.add(Dropout(0.2)) model.add(LSTM(512, return_sequences=False)) model.add(Dropout(0.2)) model.add(Dense(len(nd.categories))) model.add(Activation('sigmoid')) model.compile(loss='binary_crossentropy', optimizer='adadelta') Trenuję to przez 100 epok: …


5
Wpis w Wikipedii dotyczący prawdopodobieństwa wydaje się niejednoznaczny
Mam proste pytanie dotyczące „prawdopodobieństwa warunkowego” i „prawdopodobieństwa”. (Sprawdziłem już to pytanie tutaj, ale bezskutecznie). Zaczyna się od strony Wikipedii dotyczącej prawdopodobieństwa . Mówią to: Prawdopodobieństwo zestaw wartości parametrów, , biorąc pod uwagę efekty jest równa prawdopodobieństwu tych zaobserwowanych wyników podanych wartości tych parametrów, to jestθθ\thetaxxx L(θ∣x)=P(x∣θ)L(θ∣x)=P(x∣θ)\mathcal{L}(\theta \mid x) = …


3
Czy priory bayesowskie stają się nieistotne przy dużej liczebności próby?
Podczas przeprowadzania wnioskowania bayesowskiego działamy, maksymalizując naszą funkcję prawdopodobieństwa w połączeniu z priorytetami dotyczącymi parametrów. Ponieważ prawdopodobieństwo logarytmiczne jest wygodniejsze, skutecznie maksymalizujemy ∑ln(prior)+∑ln(likelihood)∑ln⁡(prior)+∑ln⁡(likelihood)\sum \ln (\text{prior}) + \sum \ln (\text{likelihood}) za pomocą MCMC lub w inny sposób, który generuje rozkłady późniejsze (używając pdf dla każdego parametru przed prawdopodobieństwem przed i dla …
26 bayesian  prior 


7
Łączenie prawdopodobieństwa / informacji z różnych źródeł
Powiedzmy, że mam trzy niezależne źródła i każde z nich przewiduje prognozy pogody na jutro. Pierwszy mówi, że prawdopodobieństwo jutra deszczu wynosi 0, następnie drugi mówi, że prawdopodobieństwo wynosi 1, a na koniec ostatni mówi, że prawdopodobieństwo wynosi 50%. Chciałbym poznać całkowite prawdopodobieństwo, biorąc pod uwagę tę informację. Jeśli zastosuję …

4
Dlaczego ktoś miałby używać KNN do regresji?
Z tego, co rozumiem, możemy zbudować funkcję regresji, która mieści się w przedziale danych treningowych. Na przykład (potrzebny jest tylko jeden panel): Jak przewidzieć przyszłość za pomocą regresora KNN? Ponownie wydaje się, że przybliża tylko funkcję mieszczącą się w przedziale danych treningowych. Moje pytanie: Jakie są zalety korzystania z regresora …



Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.