În cazul extragerii datelor de pe ecran, dacă datele de pe pagina web pe care doriți să o importați se află în rânduri <table>, puteți (relativ) pur și simplu să utilizați funcția read_html() a Pandas pentru a le extrage în Python.
Pentru orice altceva, va trebui să analizați structura HTML, descoperind cum să extrageți chirurgical ceea ce căutați. Este o mare bătaie de cap, dar există o bibliotecă Python cu numele scandalos „BeautifulSoup”, care face lucrurile puțin mai puțin dificile. Acest capitol conține o prezentare generală a modului de lucru cu aceasta.
În primul rând, permiteți-mi să spun că Firefox, Chrome și alte câteva browsere sunt echipate cu „instrumente pentru dezvoltatori web” foarte sofisticate, care vă permit să răsfoiți pagina HTML, CSS și cea redată și să aflați ce elemente au fost redate prin care porțiuni ale ecranului. Sunt foarte utile și, atunci când faceți extragerea datelor de pe ecran, ar trebui să vă obișnuiți să le utilizați. În Firefox, acestea sunt disponibile prin intermediul opțiunii de meniu „Tools | Web Developer | Toggle tools…”. În Chrome, accesați cele trei puncte verticale mici, apoi alegeți „More Tools | Developer Tools.”.
Sursa: Stephen Davies, The Crystal Ball – Instruction Manual, Vol. 2: Introduction to Data Science, v. 1.1. Copyright © 2020 Stephen Davies. Licența CC BY-SA 4.0. Traducere și adaptare: Nicolae Sfetcu. © 2025 MultiMedia Publishing, Introducere în Știința Datelor, Volumul 2
Descoperă mai multe la MultiMedia
Abonează-te ca să primești ultimele articole prin email.



Lasă un răspuns