Home » Articole » Articole » Afaceri » Știința datelor (Data Science) » Învățarea automată (Machine learning) » Clasificatori în învățarea automată: Bayesieni naivi – Algoritmul

Clasificatori în învățarea automată: Bayesieni naivi – Algoritmul

Pentru unii oameni, cele mai interesante și mai incitante părți ale Științei Datelor sunt algoritmii de învățare automată (ML). Acestea sunt tehnicile de bază pentru a face predicții și analize. Vom analiza pe scurt câteva dintre ele în acest curs și le veți aprofunda mai mult în cursurile ulterioare.

Reamintim că un clasificator este un algoritm/program care prezice care dintre mai multe etichete (sau clase) să fie atribuite unui punct de date. Poate încercăm să prezicem la ce partid politic este afiliat cineva, iar etichetele noastre sunt „Democrat”, „Republican” și „Ecologist”. Poate încercăm să prezicem dacă cineva nu va mai plăti un împrumut, iar etichetele sunt „sigur” și „risc ridicat”.

Există mulți algoritmi diferiți pentru clasificare, dar toți folosesc un set de exemple etichetate ca „date de antrenament”. Ideea este că, prin examinarea unui grup de exemple pentru care cunoaștem eticheta, putem descoperi în mod inteligent ce etichetă să atribuim exemplelor noi, neetichetate.

Atributele datelor noastre de antrenament (și ale datelor noi) pe care le vom folosi pentru predicție sunt uneori numite caracteristici. Dacă datele noastre de antrenament se află într-un DataFrame, caracteristicile sunt practic toate coloanele relevante, cu excepția uneia, care este ținta. Scopul nostru, având în vedere un nou punct de date care are valori pentru toate caracteristicile, este de a eticheta ținta sa cu eticheta pe care este cel mai probabil să o aibă, presupunând că datele de antrenament sunt exemple reprezentative.

Performanța unui clasificator poate fi măsurată în mai multe moduri, dar cel mai simplu este de a puncta câte exemple neetichetate le dă eticheta corectă. Acest lucru ridică, desigur, întrebarea: dacă exemplul este neetichetat, cum putem ști dacă eticheta clasificatorului a fost corectă sau nu? Ceea ce trebuie să facem în practică este să punem deoparte o parte din datele noastre (prețioase) etichetate ca un set de date de test. Ne prefacem cumva că nu știm răspunsurile pentru datele de test, le furnizăm algoritmului care a fost antrenat pe punctele de antrenament și apoi punctăm cât de bine s-a descurcat.

Unul dintre cei mai simpli (și mai rapizi) clasificatori existenți se numește clasificatorul bayesian naiv, din motive care vor deveni evidente. Într-un fel, este algoritmul implicit, fără a ne complica, pentru clasificare. Un motiv pentru care este important este că este simplu și funcționează surprinzător (chiar jenant) de bine în multe cazuri. Un alt motiv este că, chiar și atunci când nu se dovedește a avea cea mai bună performanță, este totuși o bază cu care se poate compara performanța altor algoritmi. Un cercetător ar putea raporta: „algoritmul nostru extraordinar X a obținut 89,4% din exemple corecte pe acest set de teste, comparativ cu 83,7% pentru clasificarea bayesiană naivă directă.”

Algoritmul bayesian naiv

Să presupunem că proiectăm un sistem de securitate pentru un Crucișător Galactic. Un lucru pe care trebuie să-l facem este să identificăm posibilii răufăcători pe camerele noastre de securitate. Având în vedere ceea ce putem observa despre ei, putem deosebi oamenii buni de cei răi?

▌face height demeanor lightsaber type
▌clean short menacing green Sith
▌beard medium calm green Jedi
▌clean tall menacing red Sith
▌beard medium calm blue Jedi
▌beard medium calm blue Jedi
▌clean medium calm blue Sith
▌clean tall menacing red Jedi
▌clean medium menacing red Sith
▌clean short calm blue Jedi

Datele de antrenament de mai sus, într-un DataFrame numit „t” (de la „trainig”), au patru caracteristici: dacă fața persoanei în cauză are barbă sau este complet bărbierită, care este înălțimea sa (grupată în trei mari intervale), dacă comportamentul lor este amenințător sau calm și ce culoare de sabie laser mânuiesc. Ultima coloană este eticheta noastră: această persoană este cunoscută ca fiind un Jedi (tip bun) sau un Sith (tip rău).

Un punct de testare pe care am putea dori să-l evaluăm arată astfel:

▌face height demeanor lightsaber type
▌beard short menacing red ??

Cu alte cuvinte, o persoană scundă, amenințătoare, cu barbă, cu o sabie laser roșie tocmai a apărut pe camera de securitate #305. Ar trebui să declanșăm alarma? Aceasta, desigur, depinde de tipul lor (încă necunoscut). Vrem să prezicem acest lucru pe baza exemplelor noastre anterioare.

Algoritmul de clasificare bayesiană naivă aplică probabilitatea condiționată la această întrebare. De fapt, ceea ce întrebăm este: „care dintre următoarele două cantități este mai mare:

  • P(Jedi S beard,short,menacing,red), sau
  • P(Sith S beard,short,menacing,red)?”

Rețineți că aici combinăm probabilitățile comune și condiționale. Având în vedere că avem evenimentul comun „bărbos, scund, amenințător și roșu”, care este probabilitatea condiționată ca aceștia să fie Jedi (sau Sith)? Dacă estimăm prima la 0,8 și a doua la 0,2, de exemplu, nu vom declanșa alarma.

Sursa: Stephen Davies, The Crystal Ball – Instruction Manual, Vol. 2: Introduction to Data Science, v. 1.1. Copyright © 2020 Stephen Davies. Licența CC BY-SA 4.0. Traducere și adaptare: Nicolae Sfetcu. © 2026 MultiMedia Publishing, Introducere în Știința Datelor, Volumul 2

Mecanica cuantică fenomenologică
Mecanica cuantică fenomenologică

Intră în lumea fascinantă a mecanicii cuantice. Nu rata ocazia de a explora frontierele științei!

Nu a fost votat Interval de prețuri: 22.92 lei până la 100.70 lei Selectează opțiunile Acest produs are mai multe variații. Opțiunile pot fi alese în pagina produsului.
Texte
Texte

Textele convorbirilor colonelului (rezervă) Tristan Danubius cu Sache Isache, înregistrate de serviciile secrete ale Imperiului (Cu extrase din Enciclopedia GALACTICA) ”- Chiar aşa, Dom’ Tristan, hai să bem, cui îi facem rău? – Măi Sache, exact aşa a spus şi … Citeşte mai mult

Nu a fost votat Citește mai mult
Istoria timpurie a cafelei
Istoria timpurie a cafelei

Descoperă originile fascinante ale cafelei – o poveste captivantă care a modelat istoria mondială.

Nu a fost votat 13.74 lei Selectează opțiunile Acest produs are mai multe variații. Opțiunile pot fi alese în pagina produsului.


Descoperă mai multe la MultiMedia

Abonează-te ca să primești ultimele articole prin email.

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *