> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Qu'est-ce que le web scraping par IA ?

> Le web scraping par IA détecte la structure des pages, génère des règles et extrait les données du HTML brut avec plus de résilience.

Le scraping traditionnel repose sur des règles définies manuellement : vous indiquez des [sélecteurs CSS, des expressions XPath](/docs/fr/academy/xpath-css-selectors) ou des [expressions régulières](/docs/fr/academy/refining-data-with-regex) précises pour localiser les données. À l'inverse, le scraping assisté par IA comprend plus souplement la structure et le contenu des pages, ce qui réduit la configuration manuelle et facilite la gestion de leurs variations.

## Trois utilisations de l'IA dans le scraping

L'IA est aujourd'hui appliquée au web scraping de plusieurs manières. Elle peut détecter automatiquement la structure d'une page : au lieu de demander à l'utilisateur de cliquer sur chaque champ, l'outil analyse la mise en page, repère des motifs de données répétitifs comme des listes de produits, des flux d'articles ou des annuaires de contacts, puis génère seul la logique d'extraction. Elle peut aussi écrire des règles de correspondance complexes telles que les expressions régulières, souvent difficiles à composer manuellement : il suffit alors de décrire le besoin en langage naturel. Enfin, il est possible de transmettre directement le HTML brut à un modèle d'IA pour qu'il en extraie des données structurées selon une instruction ou un modèle, en traitant le HTML comme du texte non structuré.

## Comment Octoparse utilise l'IA

Octoparse réunit ces trois approches. Sa fonction d'[Auto-détection](/docs/fr/platform/auto-detect) analyse une page cible et génère automatiquement un flux de travail de scraping, en identifiant les champs de données et la [pagination](/docs/fr/academy/handle-pagination) sans configuration manuelle. La plateforme propose également la génération d'expressions régulières assistée par IA et des modèles d'extraction HTML qui analysent directement le contenu à l'aide d'un modèle de langage. Ces fonctions complètent ses [outils de configuration visuelle](/docs/fr/platform/no-code-builder), afin que chacun choisisse le degré d'automatisation adapté à sa tâche.

## Avantages et limites

Le principal avantage de l'IA est sa résilience. Les [outils traditionnels fondés sur des règles](/docs/fr/academy/ai-vs-traditional-scraping) cessent souvent de fonctionner lorsqu'un site change de mise en page, car les sélecteurs codés en dur ne correspondent plus. Les approches assistées par IA peuvent souvent s'adapter à de petites modifications structurelles sans intervention manuelle, ce qui facilite la maintenance des tâches de longue durée. Elles ne constituent toutefois pas une solution miracle : certains cas limites peuvent produire des résultats imprévisibles et des règles explicites restent parfois plus fiables pour une extraction très précise. Dans la pratique, les meilleurs résultats associent souvent automatisation par IA et ajustements manuels.
