În ultimul capitol am văzut cum rețelele neuronale pot depăși greutățile și părtinirile folosind algoritmul de scădere a gradientului. A existat, totuși, un decalaj în explicația noastră: nu am discutat cum să calculăm gradientul funcției de cost. E un decalaj destul de mare! În acest capitol voi explica un algoritm rapid pentru calcularea unor astfel de gradienți, un algoritm cunoscut sub numele de retropropagare.
Algoritmul de retropropagare a fost introdus inițial în anii 1970, dar importanța sa nu a fost pe deplin apreciată până la o lucrare celebră din 1986 a lui David Rumelhart, Geoffrey Hinton și Ronald Williams. Acea lucrare descrie mai multe rețele neuronale în care retropropagarea funcționează mult mai rapid decât abordările anterioare ale învățării, făcând posibilă utilizarea rețelelor neuronale pentru a rezolva probleme care fuseseră anterior insolubile. Astăzi, algoritmul de retropropagare este baza de lucru al învățării în rețelele neuronale.
În centrul retropropagării se află o expresie pentru derivata parțială ∂C/∂w a funcției de cost C în raport cu orice pondere w (sau părtinire b) în rețea. Expresia ne spune cât de repede se schimbă costul atunci când modificăm ponderile și părtinirile. Și în timp ce expresia este oarecum complexă, are și o frumusețe, fiecare element având o interpretare naturală, intuitivă. Și astfel, retropropagarea nu este doar un algoritm rapid pentru învățare. De fapt, ne oferă perspective detaliate asupra modului în care modificarea ponderilor și a prejudecăților schimbă comportamentul general al rețelei. Merită studiat în detaliu.
Sursa: Michael Nielson (2024). Neural Networks and Deep Learning, LibreTexts, licența CC BY-NC 3.0. Traducerea și adaptarea Nicolae Sfetcu
Descoperă mai multe la MultiMedia
Abonează-te ca să primești ultimele articole prin email.



Lasă un răspuns