Pytania otagowane jako machine-learning

Algorytmy uczenia maszynowego budują model danych szkoleniowych. Termin „uczenie maszynowe” jest niejasno zdefiniowany; obejmuje to tak zwane uczenie statystyczne, uczenie wzmacniające, uczenie bez nadzoru itp. ZAWSZE DODAJ SZCZEGÓŁOWĄ TAGĘ.

2
Uczenie się na podstawie danych relacyjnych
Ustawienia Wiele algorytmów działa na jednej relacji lub tabeli, podczas gdy wiele rzeczywistych baz danych przechowuje informacje w wielu tabelach (Domingos, 2003). Pytanie Jakie typy algorytmów uczą się dobrze z wielu (relacyjnych) tabel. W szczególności interesują mnie algorytmy, które mają zastosowanie do zadań regresji i klasyfikacji (nie te zorientowane na …

1
Parellel między LSA i pLSA
W oryginalnej pracy pLSA autor, Thomas Hoffman, rysuje paralelę między strukturami danych pLSA i LSA, o których chciałbym z tobą porozmawiać. Tło: Czerpiąc inspirację z wyszukiwania informacji, załóżmy, że mamy kolekcję NNN dokumenty D={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbrace i słownictwo MMM warunki Ω={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega = \lbrace \omega_1, \omega_2, …

5
Czy klastrowanie wstępne pomaga zbudować lepszy model predykcyjny?
Do zadania modelowania rezygnacji rozważałem: Oblicz k klastrów dla danych Zbuduj k modeli dla każdego klastra osobno. Uzasadnieniem tego jest to, że nie ma nic do udowodnienia, że ​​populacja subskrybentów jest jednorodna, więc uzasadnione jest założenie, że proces generowania danych może być różny dla różnych „grup” Moje pytanie brzmi, czy …


1
Jak porównać obserwowane i oczekiwane zdarzenia?
Załóżmy, że mam jedną próbkę częstotliwości 4 możliwych zdarzeń: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 i mam spodziewane prawdopodobieństwo wystąpienia moich zdarzeń: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 Dzięki sumie obserwowanych częstotliwości moich czterech zdarzeń (18) mogę obliczyć …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

2
Dynamiczne dostosowywanie architektury NN: wymyślanie niepotrzebnego?
Zaczynam od podróży doktorskiej, a ostatecznym celem, jaki sobie wyznaczyłem, jest opracowanie ANN, które monitorowałyby środowisko, w którym pracują, i dynamicznie dostosowywały swoją architekturę do problemu. Oczywistą konsekwencją jest czasowość danych: jeśli zbiór danych nie jest ciągły i nie zmienia się z czasem, po co w ogóle się dostosowywać? Najważniejsze …

2
Parametryczne, półparametryczne i nieparametryczne ładowanie początkowe dla modeli mieszanych
Z tego artykułu pochodzą następujące przeszczepy . Jestem nowicjuszem w bootstrapie i próbuję zaimplementować parametryczne, semiparametryczne i nieparametryczne bootstrapowanie dla liniowego modelu mieszanego z R bootpakietem. Kod R. Oto mój Rkod: library(SASmixed) library(lme4) library(boot) fm1Cult <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=Cultivation) fixef(fm1Cult) boot.fn <- function(data, …
9 r  mixed-model  bootstrap  central-limit-theorem  stable-distribution  time-series  hypothesis-testing  markov-process  r  correlation  categorical-data  association-measure  meta-analysis  r  anova  confidence-interval  lm  r  bayesian  multilevel-analysis  logit  regression  logistic  least-squares  eda  regression  notation  distributions  random-variable  expected-value  distributions  markov-process  hidden-markov-model  r  variance  group-differences  microarray  r  descriptive-statistics  machine-learning  references  r  regression  r  categorical-data  random-forest  data-transformation  data-visualization  interactive-visualization  binomial  beta-distribution  time-series  forecasting  logistic  arima  beta-regression  r  time-series  seasonality  large-data  unevenly-spaced-time-series  correlation  statistical-significance  normalization  population  group-differences  demography 

3
Oczekiwana najlepsza możliwa wydajność zestawu danych
Powiedzmy, że mam prosty problem z uczeniem maszynowym, taki jak klasyfikacja. Z pewnymi punktami odniesienia w rozpoznawaniu obrazu lub dźwięku, jako człowiek jestem bardzo dobrym klasyfikatorem. Mam zatem intuicję, jak dobry może być klasyfikator. Ale przy dużej ilości danych jednym punktem jest to, że nie wiem, jak dobry jest klasyfikator, …

2
Zrozumienie i zastosowanie analizy nastrojów
Właśnie przydzielono mi projekt przeprowadzania analizy sentymentu dla niektórych zbiorów dokumentów. Przez Googling pojawiło się wiele badań związanych z sentymentem. Moje pytania to: Jakie są główne metody / algorytmy analizy sentymentów w dziedzinie uczenia maszynowego i analizy statystycznej? Czy są jakieś ugruntowane wyniki? Czy istnieje jakieś oprogramowanie typu open source, …

1
Klasyfikacja z jednym dominującym predyktorem
Mam problem z klasyfikacją ( klasy), rzędu 100 prawdziwych predyktorów, z których jeden wydaje się mieć znacznie większą moc wyjaśniającą niż jakikolwiek inny. Chciałbym głębiej zapoznać się z efektami innych zmiennych. Jednak standardowe techniki uczenia maszynowego (losowe lasy, maszyny SVM itp.) Wydają się być zatapiane przez jeden silny predyktor i …

2
Jak przeprowadzić selekcję zmiennych algorytmu genetycznego w R dla zmiennych wejściowych SVM?
Używam kernlab paczkę w R zbudować SVM klasyfikowania niektórych danych. SVM działa dobrze, ponieważ zapewnia „przewidywania” przyzwoitej dokładności, jednak moja lista zmiennych wejściowych jest większa niż chciałbym i nie jestem pewien co do względnej ważności różnych zmiennych. Chciałbym zaimplementować algorytm genetyczny, aby wybrać podzestaw zmiennych wejściowych, który tworzy najlepiej wyszkolony …


1
Tworzenie modelu maksymalnej entropii Markowa na podstawie istniejącego klasyfikatora maksymalnego entropii z wieloma wejściami
Intryguje mnie koncepcja modelu Maksymalnej Entropii Markowa (MEMM) i zastanawiam się nad użyciem go do taggera części mowy (POS). W tej chwili używam konwencjonalnego klasyfikatora Maximum Entropy (ME) do oznaczania każdego słowa. Wykorzystuje szereg funkcji, w tym dwa poprzednie tagi. MEMM używają algorytmu Viterbi do znalezienia optymalnej ścieżki w łańcuchu …

1
Kiedy wybrać PCA vs. LSA / LSI
Pytanie: Czy istnieją jakieś ogólne wytyczne dotyczące charakterystyki danych wejściowych, które można wykorzystać do podjęcia decyzji między zastosowaniem PCA a LSA / LSI? Krótkie streszczenie PCA vs. LSA / LSI: Zasada analizy składowej (PCA) i analizy utajonej semantycznej (LSA) lub utajonej indeksacji semantycznej (LSI) są podobne w tym sensie, że …

1
Najlepszy sposób obsługi niezbilansowanego zestawu danych wieloklasowych za pomocą SVM
Próbuję zbudować model predykcyjny za pomocą maszyn SVM na dość niezrównoważonych danych. Moje etykiety / wyniki mają trzy klasy: pozytywną, neutralną i negatywną. Powiedziałbym, że pozytywny przykład stanowi około 10-20% moich danych, neutralny około 50-60%, a negatywny około 30-40%. Próbuję zrównoważyć klasy, ponieważ koszty związane z niepoprawnymi prognozami między klasami …

Korzystając z naszej strony potwierdzasz, że przeczytałeś(-aś) i rozumiesz nasze zasady używania plików cookie i zasady ochrony prywatności.
Licensed under cc by-sa 3.0 with attribution required.