Home » Articole » Articole » Afaceri » Știința datelor (Data Science) » Data mining » Clasificări statistice în mineritul datelor

Clasificări statistice în mineritul datelor

În învățarea automată și statistică, clasificarea statistică este problema identificării căruia dintr-un set de categorii (subpopulații) îi aparține o nouă observație, pe baza unui set de antrenament de date care conține observații (sau instanțe) a căror apartenență la categorie este cunoscută.

Un exemplu ar fi atribuirea unui anumit e-mail în clase „spam” sau „non-spam” sau atribuirea unui diagnostic unui anumit pacient, așa cum este descris de caracteristicile observate ale pacientului (sex, tensiune arterială, prezența sau absența anumitor simptome etc. ). Clasificarea este un exemplu de recunoaștere a modelelor.

În terminologia învățării automate, clasificarea este considerată o instanță de învățare supravegheată, adică învățarea în care este disponibil un set de antrenament de observații identificate corect.  Procedura nesupravegheată corespunzătoare este cunoscută sub denumirea de clustering și implică gruparea datelor în categorii pe baza unei anumite măsuri de similitudine inerentă sau distanță.

Adesea, observațiile individuale sunt analizate într-un set de proprietăți cuantificabile, cunoscute sub denumirea de variabile sau caracteristici explicative. Aceste proprietăți pot fi de diferite tipuri: categorice (de exemplu, „A”, „B”, „AB” sau „O”, pentru grupa de sânge), ordinale (de exemplu, „mare”, „mediu” sau „mic”), cu valori întregi (de ex. numărul de apariții ale unui anumit cuvânt într-un e-mail) sau cu valoare reală (de exemplu, o măsurare a tensiunii arteriale). Alți clasificatori funcționează prin compararea observațiilor cu observațiile anterioare prin intermediul unei funcții de similaritate sau distanță.

Un algoritm care implementează clasificarea, în special într-o implementare concretă, este cunoscut sub numele de clasificator. Termenul „clasificator” se referă uneori și la funcția matematică, implementată de un algoritm de clasificare, care mapează datele de intrare la o categorie.

Terminologia între domenii este destul de variată. În statistică, unde clasificarea se face adesea cu regresie logistică sau o procedură similară, proprietățile observațiilor sunt denumite variabile explicative (sau variabile independente, regresori etc.), iar categoriile care trebuie prezise sunt cunoscute ca rezultate, care sunt considerate a fi valori posibile ale variabilei dependente. În învățarea automată, observațiile sunt adesea cunoscute ca instanțe, variabilele explicative sunt denumite caracteristici (grupate într-un vector de caracteristici), iar categoriile posibile care trebuie prezise sunt clase. Alte câmpuri pot folosi o terminologie diferită: de ex. în ecologia comunității, termenul „clasificare” se referă în mod normal la analiza de grup, adică un tip de învățare nesupravegheată, mai degrabă decât la învățarea supravegheată descrisă în acest articol.

Relația cu alte probleme

Clasificarea și clusteringul sunt exemple ale problemei mai generale a recunoașterii modelelor, care constă în atribuirea unui fel de valoare de ieșire unei anumite valori de intrare. Alte exemple sunt

  • regresia, care atribuie o ieșire cu valoare reală fiecărei intrări;
  • etichetarea secvenței, care atribuie o clasă fiecărui membru al unei secvențe de valori (de exemplu, etichetarea unei părți a vorbirii, care atribuie o parte a vorbirii fiecărui cuvânt dintr-o propoziție de intrare);
  • analizarea, care atribuie un arbore de analiză unei propoziții de intrare, care descrie structura sintactică a propoziției;
  • etc.

O subclasă comună de clasificare este clasificarea probabilistică. Algoritmii de această natură folosesc inferența statistică pentru a găsi cea mai bună clasă pentru o anumită instanță. Spre deosebire de alți algoritmi, care pur și simplu scot o clasă „cea mai bună”, algoritmii probabilistici produc o probabilitate ca instanța să fie un membru al fiecăreia dintre clasele posibile. În mod normal, cea mai bună clasă este selectată ca fiind cea cu cea mai mare probabilitate. Cu toate acestea, un astfel de algoritm are numeroase avantaje față de clasificatorii neprobabiliști:

  • Poate scoate o valoare de încredere asociată cu alegerea sa (în general, un clasificator care poate face acest lucru este cunoscut sub numele de clasificator ponderat în funcție de încredere).
  • În mod corespunzător, se poate abține atunci când încrederea în alegerea unui anumite rezultat este prea scăzută.
  • Din cauza probabilităților care sunt generate, clasificatorii probabilistici pot fi încorporați mai eficient în sarcini mai mari de învățare automată, într-un mod care evită parțial sau complet problema propagării erorilor.

Sursa: Drew Bentley, Business Intelligence and Analytics. © 2017 Library Press, Licență CC BY-SA 4.0. Traducere și adaptare: Nicolae Sfetcu

Introducere în Business Intelligence
Introducere în Business Intelligence

O resursă esențială pentru toți cei interesați de analiza datelor și de optimizarea proceselor de afaceri.

Nu a fost votat Interval de prețuri: 13.84 lei până la 24.85 lei Selectează opțiunile Acest produs are mai multe variații. Opțiunile pot fi alese în pagina produsului.
Etica Big Data în cercetare
Etica Big Data în cercetare

O explorare critică a provocărilor etice și a implicațiilor legale asociate Big Data.

Nu a fost votat Interval de prețuri: 0.00 lei până la 10.87 lei Selectează opțiunile Acest produs are mai multe variații. Opțiunile pot fi alese în pagina produsului.
Căutarea, extragerea, organizarea și evaluarea informațiilor
Căutarea, extragerea, organizarea și evaluarea informațiilor

Transformă informația în putere cu ajutorul acestei cărți indispensabile!

Nu a fost votat Interval de prețuri: 18.46 lei până la 44.47 lei Selectează opțiunile Acest produs are mai multe variații. Opțiunile pot fi alese în pagina produsului.


Descoperă mai multe la MultiMedia

Abonează-te ca să primești ultimele articole prin email.

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *