Extraire du HTML sans Selenium : quand les données sont plus proches qu'on le croit
Pour constituer un corpus de poésie hindi, un développeur a découvert que le site cible chargeait les données directement dans le HTML statique, rendant superflu l'usage de Selenium ou JavaScript.
Une analyse préalable de la structure du site évite souvent 80 % du travail de scraping automatisé.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.