„Bază de date” este un termen foarte vag pentru „un depozit de informații care poate fi accesat cu ușurință”. Când folosim acest termen în știința datelor, ne referim la o sursă de date gestionată de un software numit SGBD sau sistem de gestionare a bazelor de date. (Adevărat, listele, dicționarele sau Pandas DataFrame simple sunt, de asemenea, „depozite de informații care pot fi accesate”, dar când folosim termenul bază de date, nu vorbim despre asta.)
Există în principal două motive pentru a învăța cum să accesați datele din bazele de date:
- Uneori, datele noastre sunt disponibile doar în această formă. Am putea dori să le importăm în Python/Pandas și să le gestionăm folosind tehnicile din prima jumătate a semestrului, dar pentru a le introduce acolo, trebuie să interacționăm (pe scurt) cu baza de date și să emitem comenzile corespunzătoare.
- Uneori, datele noastre sunt pur și simplu de dimensiuni foarte mari. Există o limită a cantității de date pe care Spyder le poate stoca în memorie și gestiona pe loc. Să presupunem că ar trebui să analizați toate tranzacțiile eBay din ultimii doi ani? Sau toate tweet-urile făcute în lume în ultima lună? Aceste informații nu încap nici pe departe în memoria sistemului dumneavoastră. Prin urmare, trebuie să le accesăm printr-o bază de date care va gestiona dimensiunea și domeniul de aplicare pentru noi și să lucrăm cu ele puțin câte puțin.
Două tipuri de baze de date
Există în esență două tipuri de baze de date în lume: relaționale și NoSQL.
Anterior, în acest semestru, am lucrat cu date răspândite pe mai multe DataFrame pe care trebuie să le unim într-un fel. Această structură este extrem de comună, atât de mult încât cea mai mare parte a teoriei tradiționale a schemelor de baze de date se bazează direct pe ea. O bază de date relațională este un depozit de informații în care datele sunt stocate în tabele (un tabel este practic un DataFrame în spirit) și pe care se poate utiliza limbajul SQL[1] pentru a le interoga și manipula. Un sistem software care permite unui utilizator să creeze și să lucreze cu baze de date relaționale se numește SGBDR, sau sistem de gestionare a bazelor de date relaționale.
Există foarte, foarte multe SGBDR: Oracle, Sybase, Microsoft SQL Server, MySQL, MariaDB, PostgreSQL și literalmente zeci de altele. Toate funcționează în mare parte la fel: stochează date în tabele și sunt manipulate prin SQL. Încă de când Ted Codd a inventat modelul relațional în 1970, această paradigmă organizațională s-a dovedit a fi atât de puternică și eficientă din punct de vedere computațional încât a dominat lumea bazelor de date. Abia recent au câștigat teren unele paradigme alternative (așa-numitele baze de date „NoSQL”), dar chiar și așa, majoritatea datelor structurate din lume se află în baze de date relaționale de un anumit fel. SGBDR sunt mult mai similare între ele decât sunt sistemele NoSQL între ele. Marea varietate de SGBD-uri NoSQL (Cassandra, MongoDB, Redis, Neo4j etc.) înseamnă că învățarea modului de utilizare a unuia nu vă oferă prea multe cunoștințe despre cum să utilizați pe celelalte. Unele stochează perechi cheie/valoare; altele stochează obiecte și date binare; unele stochează informații sub formă de graf (rețea). O parte din marea putere a modelului relațional constă în faptul că SQL s-a dovedit a fi un limbaj de interogare comun, flexibil și cu aplicabilitate largă, pe care mulți furnizori diferiți l-au adoptat și care se potrivește multor nevoi de date.
Nota
[1] Unii oameni pronunță acronimul SQL ca cele trei litere „ess-queueell”, iar alții ca cuvântul „sequel”. Oricare dintre ele este acceptabilă (eu o prefer pe prima).
Sursa: Stephen Davies, The Crystal Ball – Instruction Manual, Vol. 2: Introduction to Data Science, v. 1.1. Copyright © 2020 Stephen Davies. Licența CC BY-SA 4.0. Traducere și adaptare: Nicolae Sfetcu. © 2025 MultiMedia Publishing, Introducere în Știința Datelor, Volumul 2
Descoperă mai multe la MultiMedia
Abonează-te ca să primești ultimele articole prin email.



Lasă un răspuns