Sursa: Jacob Andreas (2022), Language Models as Agent Models, https://doi.org/10.48550/arXiv.2212.01681 (Rezumat)
Articolul „Language Models as Agent Models”, semnat de Jacob Andreas și publicat în Findings of EMNLP 2022, analizează în ce măsură modelele de limbaj pot fi privite nu doar ca sisteme statistice care prezic următorul cuvânt, ci și ca modele aproximative ale agenților umani care produc limbajul. Autorul pornește de la observația că modelele lingvistice sunt antrenate exclusiv pe texte și nu au acces direct la stările mentale, scopurile sau intențiile persoanelor care au scris acele texte. Cu toate acestea, susține Andreas, pentru a prezice corect continuarea unui document, un model trebuie adesea să deducă implicit anumite caracteristici ale autorului – credințe, dorințe și intenții comunicative – și să folosească aceste reprezentări în generarea textului.
Teza principală este formulată prin două afirmații. Prima, C1, susține că, în procesul de predicție a următorului cuvânt, modelele lingvistice pot construi reprezentări aproximative și parțiale ale credințelor, dorințelor și intențiilor agentului care a produs contextul sau ale agenților descriși în acesta. A doua, C2, afirmă că aceste reprezentări nu sunt simple corelații interne, ci pot influența cauzal predicțiile modelului, într-un mod asemănător celui în care stările intenționale ale unei persoane îi influențează acțiunile comunicative. Autorul subliniază însă că aceasta nu înseamnă că modelele actuale sunt „umane” sau că posedă în sens general credințe și scopuri proprii; ele pot doar simula, în anumite contexte, comportamente orientate către scop.
Pentru a ilustra această idee, Andreas introduce experimentul simplificat al unei „enciclopedii incoerente”, scrise de autori cu sisteme diferite de credințe. Deși corpusul global conține contradicții, fiecare document este intern coerent, deoarece este produs de un singur autor. Un model LSTM antrenat pe aceste documente reușește să deducă implicit tipul autorului: identitatea acestuia poate fi recuperată din reprezentările interne ale modelului cu o acuratețe de 98%. Mai mult, modificarea stării interne a modelului permite generarea preferențială de texte conforme cu un anumit tip de autor. Experimentul sugerează astfel că un model poate învăța structura latentă care leagă identitatea și credințele unui autor de textul pe care acesta îl produce, chiar fără a primi explicit informații despre autor.
Pentru lumea reală, autorul adoptă cadrul Belief–Desire–Intention (BDI). În acest model, un agent are credințe despre starea lumii, dorințe referitoare la stările viitoare și intenții prin care încearcă să-și realizeze dorințele. Unele intenții sunt comunicative și generează enunțuri destinate să influențeze alți agenți. Textele disponibile pe internet pot fi privite astfel drept rezultate observabile ale unui proces latent în care credințele și dorințele autorilor determină intențiile comunicative, iar acestea generează enunțurile. Modelul lingvistic vede numai produsul final, dar pentru a-l modela eficient poate ajunge să reconstruiască implicit o parte dintre variabilele ascunse care l-au produs.
Articolul examinează apoi trei tipuri de dovezi empirice. Prima privește intenția comunicativă, prin celebrul „sentiment neuron”: într-un LSTM antrenat pe milioane de recenzii, un singur neuron ajunge să codifice sentimentul pozitiv sau negativ și permite prezicerea evaluării recenziei cu o acuratețe de aproximativ 92%. Manipularea artificială a acestui neuron schimbă sentimentul textului generat, ceea ce sprijină ideea unei legături cauzale între reprezentarea intenției și producerea limbajului.
A doua categorie privește credințele despre starea lumii. Experimentele realizate cu BART și T5 arată că reprezentările interne ale entităților pot codifica cu o acuratețe de până la 97% proprietăți și relații, inclusiv informații care trebuie deduse și nu sunt menționate explicit. Mai important, aceste reprezentări pot fi editate: dacă reprezentarea unui recipient este modificată astfel încât acesta să fie considerat gol, modelul începe să genereze acțiuni compatibile cu această stare. Astfel, reprezentările interne par să funcționeze ca forme rudimentare de „credințe” utilizate pentru selectarea acțiunilor.
A treia categorie se referă la dorințe sau scopuri, analizate prin experimentele TruthfulQA. Cu un prompt generic, modelele reproduc adesea răspunsurile greșite întâlnite frecvent pe internet. Dacă însă promptul descrie un agent al cărui scop este să ofere răspunsuri adevărate și bine cercetate, proporția răspunsurilor corecte crește de la aproximativ 38% la 58%; în sens invers, prompturile care definesc un agent orientat spre teorii false sau pseudoștiințifice reduc acuratețea sub 20%. Autorul interpretează aceste rezultate ca indicii că prompturile eficiente specifică mai clar ce tip de agent trebuie simulat, cu anumite credințe și scopuri.
Andreas insistă însă asupra limitelor actuale. Modelele fac încă erori serioase de factualitate și coerență; reprezentările lor despre credințe, dorințe și intenții sunt locale și fragile, iar ferestrele de context nu pot cuprinde stările complexe și de lungă durată caracteristice oamenilor. În plus, arhitecturile actuale nu sunt concepute pentru planificare complexă, căutare ramificată sau raționament nelimitat. Autorul sugerează îmbogățirea datelor de antrenare cu informații despre autori și context, dezvoltarea unor mecanisme de memorie pe termen lung și combinarea modelelor lingvistice cu forme explicite de raționament și planificare.
Concluzia articolului este una prudent optimistă: modelele lingvistice actuale nu sunt agenți autonomi compleți, dar pre-antrenarea pe texte le permite să învețe deja fragmente din relația dintre credințe, dorințe, intenții și limbaj. Aceste capacități ar putea constitui o infrastructură inițială pentru construirea unor sisteme viitoare care să aibă memorie, să planifice și să acționeze orientat către scopuri. Totodată, aceeași capacitate de a simula intenții poate genera riscuri, deoarece modelele pot fi condiționate să imite și agenți cu scopuri nocive. În acest sens, problema fundamentală pentru cercetarea viitoare nu este doar de a crea modele mai puternice, ci de a înțelege mecanistic cum reprezintă acestea stările agenților și cum pot fi controlate în mod sigur.
Descoperă mai multe la MultiMedia
Abonează-te ca să primești ultimele articole prin email.



Lasă un răspuns