Home » Articole » Articole » Afaceri » Știința datelor (Data Science) » Știința datelor: Evaluarea unui clasificator

Știința datelor: Evaluarea unui clasificator

Odată ce am construit un clasificator – fie că este vorba de un arbore decizional sau de orice alt tip – următorul pas este să îl evaluăm pentru a vedea cât de bine funcționează. Aceasta se numește uneori performanța clasificatorului. Aceasta va determina dacă îl considerăm suficient de precis pentru a-l folosi pe teren și, dacă da, cât de precise ne putem aștepta să fie predicțiile sale.

Cu riscul de a mă repeta (amintiți-vă de prelegerea mea din secțiunea 26.2), trebuie să vă evaluați clasificatorul testându-l pe date care nu au fost utilizate pentru a-l antrena. Anterior am învățat cum să împărțim aleatoriu un set de date în seturi separate de antrenament și testare.

Să presupunem că am făcut asta. Să presupunem că DataFrame students din capitolele 27 și 28 a fost rezultatul alegerii aleatorii a 70% din exemplele etichetate dintr-un set de date original și că am păstrat restul de 30% din rânduri dintr-un DataFrame numit students_test, care conține:

Disciplina Vârsta Gen Jucător
0 CPSC tânăr F Nu
1 CPSC bătrân O Nu
2 MATH bătrân F Nu
3 CPSC mijlociu M Nu
4 PSYC mijlociu F Da
5 PSYC tânăr F Nu
6 MATH bătrân M Da
7 CPSC mijlociu M Da

 

Întrebarea noastră este: „cât de bine se descurcă clasificatorul nostru cu aceste date de test?”

29.1 Ce înseamnă „a se descurca bine”

Cel mai comun (și mai simplu) mod de a măsura performanța unui clasificator este pur și simplu să numărăm câte puncte de test clasifică corect și să împărțim la numărul total de puncte de test. Aceasta ne oferă acuratețea clasificării ca o fracție între 0 și 1 (sau, dacă vrem să înmulțim cu 100, o „precizie procentuală” de la 0% la 100%). Este posibil să facem acest lucru deoarece, după cum vă amintiți, datele noastre de test sunt compuse din exemple etichetate, la fel ca datele noastre de antrenament. Prin urmare, știm „răspunsul corect” pentru fiecare punct de test și îl putem pur și simplu compara cu predicția clasificatorului nostru.

Chiar dacă aceasta este cea mai comună abordare, merită să ne acordăm un moment pentru a lua în considerare alternativele. Presupunerea cheie a acestei măsuri de precizie este că toate tipurile de erori de predicție sunt egale. În cazul jocurilor video, spunem că etichetarea greșită a unui jucător video drept non-jucător video este „la fel de rea” ca și etichetarea greșită a unui non-jucător video drept jucător video. Și acesta ar putea fi exact lucrul corect pe care ar trebui să-l facă firma noastră de jocuri.

Dar luați în considerare alte situații. Să presupunem că datele de intrare ale clasificatorului nostru sunt caracteristici dintr-o imagine RMN, iar predicția noastră este „cancer” sau „fără cancer”. Acum, este o poveste cu totul diferită. Prezicerea greșită că un anumit pacient că are cancer când de fapt nu are l-ar putea speria inutil. Asta e rău. Dar este mult mai rău în direcția opusă: oferirea greșită a unui certificat de sănătate bună unui pacient care are de fapt cancer în stadiu incipient riscă să se piardă o viață. În astfel de cazuri, ar trebui să penalizam clasificatorul nostru mai dur pentru rezultatele fals negative decât pentru cele fals pozitive.

De asemenea, este o poveste diferită atunci când etichetele nu sunt reprezentate în mod egal. Reamintiți-vă de problema predicției fanilor NFL din Figura 26.1. Să luăm în considerare faptul că am efectua predicții despre fani într-un oraș precum Dallas, care este compus (să zicem) din 99% fani Cowboys și doar 1% fani Ravens. Dacă am penaliza un clasificator în mod egal pentru predicțiile greșite despre Cowboys și predicțiile greșite despre Ravens, un clasificator pe o singură linie ar putea obține un scor destul de bun:

def predict(age, hometown, current_residence, yrs_in_residence):

return "Cowboys"

Nici măcar nu merită să ne străduim să identificăm puținii fani Ravens dacă vom fi ratat un punct de fiecare dată când îndrăznim să prezicem unul. Sunt pur și simplu prea rari. Singura modalitate de a face un clasificator să fie tare și să încerce să identifice mica populație de fani Ravens este să îl penalizeze mai puternic când îi omite decât când îi identifică în mod fals.

Sursa: Stephen Davies, The Crystal Ball – Instruction Manual, Vol. 1: Introduction to Data Science, v. 1.1. Copyright © 2021 Stephen Davies. Licența CC BY-SA 4.0. Traducere și adaptare: Nicolae Sfetcu. © 2025 MultiMedia Publishing, Introducere în Știința Datelor, Volumul 1

Cărări și Gânduri, Volumul 2
Cărări și Gânduri, Volumul 2

După îndemnul unui cunoscut dicton, e bine să răsfoim, măcar din când în când, cărţile celor vechi. Am zăbovit, în Antologia poeziei latine, asupra versurilor despre virtute, dedicate lui Albinus, de Caius Lucilius (I 80-103 iHr.), şi am rămas oarecum … Citeşte mai mult

Nu a fost votat Citește mai mult
Cunoașterea Științifică, Volumul 4, Numărul 2, Iunie 2025
Cunoașterea Științifică, Volumul 4, Numărul 2, Iunie 2025 – Rezumate

Revista Cunoașterea Științifică este o publicație trimestrială din domeniile științei și filosofiei, și domenii conexe de studiu și practică. Cuprins: EDITORIAL / EDITORIAL Nicolae SFETCU The books on the History of Science: Global Evolution, Romanian Contributions, and Perspectives Cărțile despre … Citeşte mai mult

Nu a fost votat 0.00 lei Adaugă în coș
Prințesa Sofia, croșetată manual
Prințesa Sofia, croșetată manual, 37 cm

Prințesa Sofia este un personaj din desenele animate, înălțime 37 cm, material folosit bumbac cu părul din acril , umplutură non- alergică, ochi aplicați, haine detașabile.

Nu a fost votat 404.22 lei Adaugă în coș


Descoperă mai multe la MultiMedia

Abonează-te ca să primești ultimele articole prin email.

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *