Skip to main content
Les données brutes collectées sont rarement prêtes à l’emploi. Octoparse permet d’affiner les champs extraits avant l’export afin de nettoyer le texte, transformer les valeurs, supprimer les caractères indésirables et ne conserver que la partie utile d’un champ. Si le mauvais élément est extrait, corrigez d’abord la sélection du champ. Si le bon élément est sélectionné, mais que son format est désordonné, utilisez les règles d’affinement.

Scénarios pris en charge

Nettoyer des valeurs désordonnées

Supprimez, remplacez, rognez ou reformatez le texte avant l’export.

Extraire une partie d’une valeur

Utilisez des règles de correspondance ou expressions régulières pour ne garder que le motif nécessaire.

Uniformiser les lignes

Ajoutez des préfixes, supprimez du texte répété ou normalisez les valeurs incohérentes.

Reformater dates et horodatages

Convertissez les formats de date, dates relatives, horodatages Unix ou décalages horaires en une sortie cohérente.
Exemples courants :
  • Supprimer des libellés comme Price: ou Rating:
  • Remplacer des caractères indésirables ou espaces superflus
  • Ajouter un préfixe ou suffixe à chaque valeur
  • Reformater les dates ou convertir les fuseaux horaires
  • Décoder les entités HTML en texte brut

Accéder à Nettoyer les données

1

Sélectionner le champ

Dans l’Aperçu des données ou la liste des champs, sélectionnez le champ extrait à nettoyer.
2

Ouvrir le menu du champ

Cliquez sur le menu ... du champ.
3

Choisir Nettoyer les données

Sélectionnez Nettoyer les données pour ouvrir le Flux de travail.
4

Ajouter une étape de nettoyage

Cliquez sur Ajouter une étape, puis choisissez l’opération à appliquer.
5

Prévisualiser le résultat

Vérifiez la valeur obtenue avant d’enregistrer la règle.

Opérations d’affinement courantes

Une chaîne est une suite de caractères : mot, nombre, espace, symbole ou signe de ponctuation. Une chaîne vide ne contient aucun caractère. Remplacer une valeur par une chaîne vide la supprime donc de la sortie.

Utiliser les regex pour le nettoyage par motif

Les expressions régulières sont utiles lorsque la valeur suit un motif qu’une simple règle de remplacement ou de rognage ne peut pas nettoyer de façon fiable :
  • Extraire un nombre ou un prix dans une phrase
  • Trouver le texte avant ou après un séparateur connu, par exemple :, | ou -
  • Ne garder qu’une partie d’un attribut HTML
  • Supprimer des motifs dont la forme varie entre les lignes
  • Isoler une sous-chaîne dont la valeur change légèrement selon la page
L’outil RegEx est accessible depuis le flux Nettoyer les données ou la zone Outils de la barre latérale. Octoparse comprend aussi un générateur RegEx par IA : décrivez en langage naturel ce que vous souhaitez extraire, et l’outil crée le motif sans que vous ayez à écrire l’expression. Pour obtenir la liste complète des motifs et de la syntaxe, consultez l’aide-mémoire RegEx pour l’extraction de données dans le Centre d’aide.
N’utilisez RegEx que si les règles simples ne suffisent pas. Pour un nettoyage direct, remplacer, rogner, ajouter un préfixe ou un suffixe est plus facile à maintenir.

Exemple : extraire une valeur d’un attribut

Certains sites stockent des données utiles dans des attributs plutôt que dans le texte visible. Une note peut, par exemple, se trouver dans alt="5 stars" ou dans une valeur source comme src.
1

Sélectionner l’élément

Sélectionnez l’élément contenant la valeur, par exemple une icône de note ou un bloc de texte.
2

Choisir la valeur source

Selon l’emplacement, utilisez URL de l’image, OuterHTML ou Autres attributs.
3

Personnaliser le champ

Ouvrez le menu du champ et choisissez Personnaliser le champ ou Nettoyer les données.
4

Extraire la valeur cible

Sélectionnez l’attribut utile ou utilisez RegEx pour ne conserver que la partie voulue du HTML.
5

Prévisualiser avant d’enregistrer

Vérifiez que l’aperçu affiche la valeur attendue avant d’exécuter la tâche.

Limites de l’affinement des champs

Les règles nettoient une valeur déjà extraite ; elles ne modifient pas la structure de la page. Par exemple, un bloc affiché sur plusieurs lignes peut constituer un seul élément dans le code source. Octoparse peut alors le traiter comme un seul champ, impossible à diviser en se fondant uniquement sur les retours à la ligne visuels. Examinez la structure source et utilisez la sélection de champ, les paramètres d’extraction ou une regex selon le stockage réel des données.
Si le site stocke une valeur dans un élément unique, le Nettoyage des données peut ne pas suffire à la séparer. Vous devrez peut-être modifier l’élément sélectionné, inspecter le HTML ou extraire une autre valeur source.

Bonnes pratiques

  • Affinez les champs après avoir confirmé que le bon élément est sélectionné.
  • Essayez des étapes simples avant RegEx.
  • Prévisualisez chaque étape avant de l’enregistrer.
  • Donnez des noms clairs aux champs pour rendre l’export compréhensible.
  • Évitez un nettoyage excessif si le système en aval peut gérer le formatage.
  • Documentez les regex complexes pour faciliter la maintenance par l’équipe.