> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Affiner les données avec des expressions régulières

> Les valeurs collectées sont souvent désordonnées : prix, téléphones et dates variables. Découvrez les expressions régulières qui les nettoient et leur génération par IA.

Les données brutes collectées sont rarement directement exploitables. Une fois que [vos sélecteurs](/docs/fr/academy/xpath-css-selectors) ont trouvé les valeurs, les chaînes récupérées contiennent souvent du bruit. Un prix peut inclure un symbole monétaire, des espaces et du texte ; un numéro de téléphone peut adopter trois formats sur le même site ; une date peut être écrite « May 15, 2026 » à un endroit et « 2026-05-15 » ailleurs. Les **expressions régulières**, ou *regex*, constituent l’outil standard pour nettoyer, extraire et transformer ces textes en champs structurés cohérents.

Une expression régulière décrit la forme du texte recherché. Le moteur analyse une chaîne, trouve les correspondances et permet de les extraire ou de les remplacer. Quelques motifs courants couvrent la grande majorité des nettoyages liés au scraping.

## Motifs de nettoyage courants

* **Prix.** `[d,.]+` capture les nombres avec virgules et décimales en supprimant les symboles et le texte environnant. `(d{1,3}(?:,d{3})*(?:.d{2})?)` cible plus précisément des formats comme `1,299.99`.
* **Téléphones.** `\(?\d{3}\)?[-.\s]?\d{3}[-.\s]?\d{4}` gère les formats américains courants, avec ou sans parenthèses et avec tirets, points ou espaces.
* **E-mails.** `[\w.+-]+@[\w-]+\.[\w.]+` détecte la plupart des adresses standard.
* **Dates.** `\d{4}-\d{2}-\d{2}` correspond au format ISO ; `\w+ \d{1,2}, \d{4}` gère les chaînes comme `May 15, 2026`.
* **Suppression de balises HTML.** `<[^>]+>` retire les balises d’une chaîne.
* **Normalisation des espaces.** `\s+` remplace une suite d’espaces par un seul.

## Conseils pratiques

* **Testez sur de vrais exemples.** Les pages réelles ont des particularités absentes des exemples idéalisés.
* **Utilisez les quantificateurs non gourmands (`*?`, `+?`).** Par défaut, `*` et `+` retiennent la correspondance la plus longue, ce qui n’est pas toujours souhaité.
* **Utilisez des groupes de capture.** Les parenthèses `()` permettent de ne conserver que la partie utile d’une correspondance plus large.
* **Surveillez les particularités régionales.** Une regex prévue pour `1,299.99` échoue sur le format européen `1.299,99`. Il en va de même pour les dates, téléphones et décimales.

## L’approche d’Octoparse

Les expressions régulières sont réputées difficiles à écrire et à lire. Un motif complexe ressemble vite à du bruit, et une petite erreur peut produire silencieusement des données incorrectes ou ignorer des entrées valides.

Octoparse intègre les regex au flux d’extraction : vous pouvez les appliquer à tout champ collecté comme **étape de post-traitement**, puis nettoyer et transformer les données avant l’export, sans script séparé. Le motif, le champ et la sortie nettoyée restent dans la même définition de tâche.

Octoparse propose aussi une **génération de regex assistée par IA** : mettez en évidence des éléments similaires, et l’IA analyse leurs motifs pour générer automatiquement une expression. Testez-la ensuite sur les données réellement collectées et ajustez-la au besoin. L’IA gère la syntaxe ; l’utilisateur valide le résultat.

Cette approche réduit les deux principaux coûts : écrire un motif depuis zéro et vérifier son comportement sur des données réelles. Tout se fait dans l’éditeur visuel.

## À retenir

La plupart des projets n’exigent pas de regex très complexes. Une petite bibliothèque de motifs pour les prix, e-mails, dates, téléphones et espaces suffit généralement. Gardez les motifs aussi simples que possible, documentez-les pour faciliter la maintenance et utilisez la génération par IA lorsque la syntaxe devient difficile. L’objectif reste une sortie propre et cohérente ; la regex n’est qu’un moyen d’y parvenir.
