> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Affiner les données

> Renommez, réorganisez, dérivez et nettoyez les champs collectés avec les règles intégrées et les regex dans l’éditeur Octoparse, sans code.

Les données brutes collectées sont rarement prêtes à l’emploi. Octoparse permet d’affiner les champs extraits avant l’export afin de nettoyer le texte, transformer les valeurs, supprimer les caractères indésirables et ne conserver que la partie utile d’un champ.

Si le mauvais élément est extrait, corrigez d’abord la [sélection du champ](/docs/fr/platform/no-code-builder). **Si le bon élément est sélectionné, mais que son format est désordonné, utilisez les règles d’affinement.**

## Scénarios pris en charge

<Columns cols={2}>
  <Card title="Nettoyer des valeurs désordonnées">Supprimez, remplacez, rognez ou reformatez le texte avant l’export.</Card>
  <Card title="Extraire une partie d’une valeur">Utilisez des règles de correspondance ou expressions régulières pour ne garder que le motif nécessaire.</Card>
  <Card title="Uniformiser les lignes">Ajoutez des préfixes, supprimez du texte répété ou normalisez les valeurs incohérentes.</Card>
  <Card title="Reformater dates et horodatages">Convertissez les formats de date, dates relatives, horodatages Unix ou décalages horaires en une sortie cohérente.</Card>
</Columns>

Exemples courants :

* Supprimer des libellés comme `Price:` ou `Rating:`
* Remplacer des caractères indésirables ou espaces superflus
* Ajouter un préfixe ou suffixe à chaque valeur
* Reformater les dates ou convertir les fuseaux horaires
* Décoder les entités HTML en texte brut

## Accéder à Nettoyer les données

<Steps>
  <Step title="Sélectionner le champ">Dans l’Aperçu des données ou la liste des champs, sélectionnez le champ extrait à nettoyer.</Step>
  <Step title="Ouvrir le menu du champ">Cliquez sur le menu `...` du champ.</Step>
  <Step title="Choisir Nettoyer les données">Sélectionnez **Nettoyer les données** pour ouvrir le Flux de travail.</Step>
  <Step title="Ajouter une étape de nettoyage">Cliquez sur **Ajouter une étape**, puis choisissez l’opération à appliquer.</Step>
  <Step title="Prévisualiser le résultat">Vérifiez la valeur obtenue avant d’enregistrer la règle.</Step>
</Steps>

## Opérations d’affinement courantes

| Opération                                        | Utilisation                                                                                                                                                                                                  |
| ------------------------------------------------ | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| Remplacer                                        | Remplacer une chaîne précise par une autre valeur ou la supprimer avec une chaîne vide <br /> <sub>Une chaîne vide ne contient aucun caractère ; le remplacement supprime donc le texte correspondant.</sub> |
| Remplacer avec une expression régulière          | Rechercher avec une regex et remplacer les chaînes correspondantes                                                                                                                                           |
| Faire correspondre avec une expression régulière | Ne garder que la partie correspondant au motif et supprimer le reste                                                                                                                                         |
| Rogner les espaces                               | Supprimer les espaces indésirables au début ou à la fin                                                                                                                                                      |
| Ajouter un préfixe                               | Ajouter un texte fixe avant chaque valeur extraite                                                                                                                                                           |
| Ajouter un suffixe                               | Ajouter un texte fixe après chaque valeur extraite                                                                                                                                                           |
| Reformater la date/l’heure extraite              | Convertir les formats ou dates relatives (`2 days ago` → date précise) <br /> <sub>Les préréglages comprennent `yyyy/MM/dd hh:mm:ss`, `yyyy-MM-dd`, `01/01/2026`, `Thu, 01 01 2026`, etc.</sub>              |
| Convertir l’horodatage                           | Convertir les horodatages Unix en dates lisibles                                                                                                                                                             |
| Convertir le fuseau horaire                      | Ajuster la date et l’heure au fuseau cible                                                                                                                                                                   |
| Transcoder le HTML                               | Convertir les entités HTML en texte brut, par exemple `&amp;` → `&`                                                                                                                                          |

<Tip>
  Une **chaîne** est une suite de caractères : mot, nombre, espace, symbole ou signe de ponctuation. Une **chaîne vide** ne contient aucun caractère. Remplacer une valeur par une chaîne vide la supprime donc de la sortie.
</Tip>

## Utiliser les regex pour le nettoyage par motif

Les expressions régulières sont utiles lorsque la valeur suit un motif qu’une simple règle de remplacement ou de rognage ne peut pas nettoyer de façon fiable :

* Extraire un nombre ou un prix dans une phrase
* Trouver le texte avant ou après un séparateur connu, par exemple `:`, `|` ou `-`
* Ne garder qu’une partie d’un attribut HTML
* Supprimer des motifs dont la forme varie entre les lignes
* Isoler une sous-chaîne dont la valeur change légèrement selon la page

L’outil RegEx est accessible depuis le flux Nettoyer les données ou la zone Outils de la barre latérale. Octoparse comprend aussi un **générateur RegEx par IA** : décrivez en langage naturel ce que vous souhaitez extraire, et l’outil crée le motif sans que vous ayez à écrire l’expression.

| Objectif                         | Motif                  | Entrée                      | Sortie             |
| -------------------------------- | ---------------------- | --------------------------- | ------------------ |
| Extraire un prix                 | `\$\d+(?:\.\d{1,2})?`  | `Only $19.99 today`         | `$19.99`           |
| Extraire un e-mail               | `[\w.-]+@[\w.-]+\.\w+` | `Contact: info@example.com` | `info@example.com` |
| Extraire une date (AAAA-MM-JJ)   | `\d{4}-\d{2}-\d{2}`    | `Published 2025-06-10`      | `2025-06-10`       |
| Extraire uniquement les chiffres | `\d+`                  | `Rating: 4.5 out of 5`      | `4`                |
| Supprimer les balises HTML       | `<[^>]+>`              | `<b>Bold text</b>`          | `Bold text`        |

Pour obtenir la liste complète des motifs et de la syntaxe, consultez l’[aide-mémoire RegEx pour l’extraction de données](https://helpcenter.octoparse.com/fr/articles/11659531-regular-expression-regex-cheatsheet-for-data-extraction) dans le Centre d’aide.

<Tip>
  N’utilisez RegEx que si les règles simples ne suffisent pas. Pour un nettoyage direct, remplacer, rogner, ajouter un préfixe ou un suffixe est plus facile à maintenir.
</Tip>

## Exemple : extraire une valeur d’un attribut

Certains sites stockent des données utiles dans des attributs plutôt que dans le texte visible. Une note peut, par exemple, se trouver dans `alt="5 stars"` ou dans une valeur source comme `src`.

<Steps>
  <Step title="Sélectionner l’élément">Sélectionnez l’élément contenant la valeur, par exemple une icône de note ou un bloc de texte.</Step>
  <Step title="Choisir la valeur source">Selon l’emplacement, utilisez **URL de l’image**, **OuterHTML** ou **Autres attributs**.</Step>
  <Step title="Personnaliser le champ">Ouvrez le menu du champ et choisissez **Personnaliser le champ** ou **Nettoyer les données**.</Step>
  <Step title="Extraire la valeur cible">Sélectionnez l’attribut utile ou utilisez RegEx pour ne conserver que la partie voulue du HTML.</Step>
  <Step title="Prévisualiser avant d’enregistrer">Vérifiez que l’aperçu affiche la valeur attendue avant d’exécuter la tâche.</Step>
</Steps>

## Limites de l’affinement des champs

Les règles nettoient une valeur déjà extraite ; elles ne modifient pas la structure de la page.

Par exemple, un bloc affiché sur plusieurs lignes peut constituer un seul élément dans le code source. Octoparse peut alors le traiter comme un seul champ, impossible à diviser en se fondant uniquement sur les retours à la ligne visuels. Examinez la structure source et utilisez la sélection de champ, les paramètres d’extraction ou une regex selon le stockage réel des données.

<Warning>
  Si le site stocke une valeur dans un élément unique, le Nettoyage des données peut ne pas suffire à la séparer. Vous devrez peut-être modifier l’élément sélectionné, inspecter le HTML ou extraire une autre valeur source.
</Warning>

## Bonnes pratiques

* Affinez les champs après avoir confirmé que le bon élément est sélectionné.
* Essayez des étapes simples avant RegEx.
* Prévisualisez chaque étape avant de l’enregistrer.
* Donnez des noms clairs aux champs pour rendre l’export compréhensible.
* Évitez un nettoyage excessif si le système en aval peut gérer le formatage.
* Documentez les regex complexes pour faciliter la maintenance par l’équipe.
