Performanța oricărui algoritm de învățare automată (ML) depinde de alegerea reprezentărilor datelor. Prin urmare, aceste reprezentări ale datelor, cunoscute și sub numele de caracteristici, sunt esențiale pentru învățare și înțelegere, prin urmare, mult efort în ML se depune în proiectarea conductelor de preprocesare și în transformările și mapările datelor care au ca rezultat o reprezentare respectivă ce susține ML eficient.
Algoritmii de învățare actuali au încă o slăbiciune enormă: nu sunt capabili să extragă cunoștințele discriminative din date. Prin urmare, este de o importanță capitală extinderea aplicabilității universale a algoritmilor de învățare, prin urmare, să îi facem mai puțin dependenți de ingineria caracteristicilor (create manual).
Bengio, Courville și Vincent (2013) [30] susțin că acest lucru poate fi realizat numai dacă algoritmii pot învăța să identifice și să separe factorii exploratori subiacenți deja existenți printre datele de nivel scăzut. Aceasta implică faptul că este necesar un algoritm cu adevărat inteligent pentru a înțelege contextul și pentru a putea discrimina între caracteristicile relevante și cele irelevante – similar cu ceea ce putem face noi, oamenii. „Ce este interesant?” și „Ce este relevant?” sunt întrebări dificile și, atâta timp cât nu putem atinge acest obiectiv măreț cu abordări automate, trebuie să dezvoltăm algoritmi care pot fi aplicați de un expert în domeniu.
Un astfel de expert este probabil conștient de ceea ce este interesant și relevant în domeniul său, putând astfel proiecta caracteristici mai adecvat decât un inginer de învățare automată, care în mare parte nu este expert în domeniu. Acest lucru necesită un nou tip de utilizabilitate a algoritmilor [31].
Revenind la perspectiva noastră probabilistică, aceasta ar însemna că învățarea caracteristicilor din date poate fi văzută ca recuperarea unui set parcimonios de variabile aleatorii latente (adică, conform teoremei lui Occams, vezi [32] pentru o discuție critică), reprezentând o distribuție peste datele observate pentru a exprima un model probabilistic p(x,h) peste spațiul comun al variabilelor latente, h, și al datelor observate x. De asemenea, această abordare se încadrează bine în perspectiva științei cognitive [33].
Referințe
- Bengio, Y.; Courville, A.; Vincent, P. Representation learning: A review and new perspectives. IEEE Trans. Pattern Anal. Mach. Intell. 2013, 35,1798-1828, doi:10.1109/TPAMI.2013.50.
- Neumann, M.; Huang, S.; Marthaler, D.E.; Kersting, K. pyGPs: A Python library for Gaussian process regression and classification. J. Mach. Learn. Res. 2015,16, 2611-2616.
- Domingos, P. The Role of Occam’s Razor in Knowledge Discovery. Data Min. Knowl. Discov. 1999, 3,409-425, doi:10.1023/a:1009868929893.
- Wilson, A.G.; Dann, C.; Lucas, C.G.; Xing, E.P. The Human Kernel. arXiv 2015, arXiv:1510.07389.
Sursa: Holzinger, A. Introduction to MAchine Learning & Knowledge Extraction (MAKE). Mach. Learn. Knowl. Extr. 2019, 1, 1-20. https://doi.org/10.3390/make1010001. Licența CC BY 4.0. Traducere și adaptare © 2024 Nicolae Sfetcu
Descoperă mai multe la MultiMedia
Abonează-te ca să primești ultimele articole prin email.



Lasă un răspuns