Skip to main content
L’Auto-détection analyse une page web, identifie les motifs de données répétés et génère un premier workflow d’extraction, avec les champs de données et la logique de pagination. En matière d’effort et de flexibilité, elle se situe entre les Modèles, plus rapides mais limités aux sites pris en charge, et l’outil de création no-code, qui offre un contrôle manuel complet.

Quand utiliser l’Auto-détection

Utilisez l’Auto-détection lorsque :
  • La page contient des éléments répétés, tels que des produits, des annonces, des avis ou des résultats de recherche
  • Vous souhaitez obtenir rapidement un premier workflow
  • Vous ne savez pas quels éléments sélectionner manuellement
  • Vous voulez qu’Octoparse suggère des champs et une logique de pagination
  • Vous souhaitez prévisualiser rapidement les données extractibles d’un site cible avant de procéder à une configuration complète
  • Vous prévoyez d’examiner et d’ajuster ensuite le workflow généré
L’Auto-détection constitue un point de départ ; elle ne garantit pas que chaque champ ou chaque action sera correct.

Fonctionnement de l’Auto-détection

L’Auto-détection analyse la structure DOM et la disposition visuelle de la page, puis utilise le calcul de similarité et la combinaison de caractéristiques pour repérer les zones de données répétées et générer automatiquement les règles d’extraction.
1

Ouvrir la page cible

Commencez sur la page qui contient les données à extraire.
2

Lancer l’Auto-détection

Octoparse analyse la page, détecte les zones de données répétées et génère les champs d’extraction. Il tente également d’identifier la pagination ou les boutons de page suivante afin que la tâche puisse parcourir automatiquement plusieurs pages de résultats.
3

Examiner les champs détectés

Vérifiez que les champs suggérés correspondent aux données dont vous avez besoin.
4

Vérifier la navigation entre les pages

Examinez la pagination, le défilement ou les actions de passage à la page suivante. L’Auto-détection peut identifier un bouton de page suivante ou un défilement infini : vérifiez son bon fonctionnement avant une exécution à grande échelle.
5

Tester la tâche

Exécutez un échantillon et vérifiez les résultats avant d’augmenter l’échelle de l’extraction.

Éléments à examiner après la détection

Après la génération du workflow, vérifiez les points suivants :

Limites connues

L’Auto-détection fonctionne mieux sur les pages dont la structure de données est claire et répétitive. Elle peut produire des résultats incomplets ou inexacts dans certaines situations : Une erreur d’exécution fréquente après l’Auto-détection est “[Loop Item] failed to find current loop item, exiting loop now”. Elle signifie généralement que le XPath généré ne correspond plus aux éléments réels de la page. Relancer l’Auto-détection ou ajuster manuellement le sélecteur dans l’outil de création no-code résout généralement le problème.

Quand effectuer des modifications manuelles

Des ajustements manuels peuvent être nécessaires lorsque :
  • La disposition de la page est irrégulière
  • Des champs importants se trouvent en dehors de la liste détectée
  • Le site charge le contenu de manière dynamique
  • La pagination n’est pas correctement détectée
  • La page exige une connexion, des filtres, des fenêtres contextuelles ou une interaction de l’utilisateur
  • Vous devez extraire des données depuis des pages de détail
Utilisez l’outil de création no-code pour affiner le workflow généré.
Ne considérez pas les résultats de l’Auto-détection comme prêts pour la production. Examinez toujours les champs, exécutez un échantillon et vérifiez les données exportées.

Pages associées

Modèles

Commencez avec un workflow prédéfini pour les sites web courants.

Outil de création no-code

Ajustez ou créez manuellement des workflows après l’Auto-détection.

Affiner les données

Nettoyez et reformatez les champs extraits avant l’export.