1
Récupérer la page
Envoyer une requête HTTP et recevoir du HTML.
2
Afficher la page
Exécuter le JavaScript de la page dans un véritable navigateur.
3
Localiser les données
Cibler les éléments avec XPath ou des sélecteurs CSS.
4
Extraire et affiner
Récupérer les valeurs, puis les nettoyer avec des expressions régulières.
5
Parcourir le site
Gérer la pagination et les pages protégées par une connexion.
6
Stocker le résultat
CSV, JSON, base de données ou API en aval.
Récupérer la page
Tout commence par une requête. L’outil envoie une requête HTTP à une URL et reçoit une réponse, généralement du HTML, parfois du JSON. Pour les pages simples affichées côté serveur, cette seule étape fournit tout le nécessaire. Mais la réponse ne constitue que la charge utile initiale envoyée par le serveur ; sur de nombreux sites modernes, il ne s’agit presque que d’une coquille vide.Afficher la page
Lorsqu’un site génère son contenu avec JavaScript, les données recherchées ne figurent pas dans le HTML initial : elles n’apparaissent qu’après l’exécution des scripts de la page. Cette étape exécute ces scripts dans un véritable navigateur afin d’afficher l’intégralité du contenu. L’environnement d’exécution du navigateur choisi détermine la fidélité de chargement de la page ainsi que son coût en mémoire et en vitesse ; il est au cœur du scraping des pages affichées par JavaScript.Localiser les données
Une fois la page entièrement chargée, l’outil doit cibler précisément les éléments voulus : un prix, un titre ou une ligne de tableau. Pour cela, il utilise XPath ou des sélecteurs CSS, qui décrivent où se trouve un élément dans la structure de la page. De bons sélecteurs font la différence entre un outil qui résiste aux petites modifications de mise en page et un autre qui cesse de fonctionner à chaque mise à jour du site.Extraire et affiner
La localisation d’un élément donne accès à son contenu brut ; l’extraction en récupère la valeur et l’affinage la nettoie. Un prix extrait peut être"$1,299.00 USD" alors que seul le nombre vous intéresse. Les expressions régulières et règles de post-traitement suppriment, divisent et remettent en forme le texte brut pour produire les champs structurés que vous souhaitez réellement stocker.