Scénarios pris en charge
Nettoyer des valeurs désordonnées
Supprimez, remplacez, rognez ou reformatez le texte avant l’export.
Extraire une partie d’une valeur
Utilisez des règles de correspondance ou expressions régulières pour ne garder que le motif nécessaire.
Uniformiser les lignes
Ajoutez des préfixes, supprimez du texte répété ou normalisez les valeurs incohérentes.
Reformater dates et horodatages
Convertissez les formats de date, dates relatives, horodatages Unix ou décalages horaires en une sortie cohérente.
- Supprimer des libellés comme
Price:ouRating: - Remplacer des caractères indésirables ou espaces superflus
- Ajouter un préfixe ou suffixe à chaque valeur
- Reformater les dates ou convertir les fuseaux horaires
- Décoder les entités HTML en texte brut
Accéder à Nettoyer les données
1
Sélectionner le champ
Dans l’Aperçu des données ou la liste des champs, sélectionnez le champ extrait à nettoyer.
2
Ouvrir le menu du champ
Cliquez sur le menu
... du champ.3
Choisir Nettoyer les données
Sélectionnez Nettoyer les données pour ouvrir le Flux de travail.
4
Ajouter une étape de nettoyage
Cliquez sur Ajouter une étape, puis choisissez l’opération à appliquer.
5
Prévisualiser le résultat
Vérifiez la valeur obtenue avant d’enregistrer la règle.
Opérations d’affinement courantes
Utiliser les regex pour le nettoyage par motif
Les expressions régulières sont utiles lorsque la valeur suit un motif qu’une simple règle de remplacement ou de rognage ne peut pas nettoyer de façon fiable :- Extraire un nombre ou un prix dans une phrase
- Trouver le texte avant ou après un séparateur connu, par exemple
:,|ou- - Ne garder qu’une partie d’un attribut HTML
- Supprimer des motifs dont la forme varie entre les lignes
- Isoler une sous-chaîne dont la valeur change légèrement selon la page
Pour obtenir la liste complète des motifs et de la syntaxe, consultez l’aide-mémoire RegEx pour l’extraction de données dans le Centre d’aide.
Exemple : extraire une valeur d’un attribut
Certains sites stockent des données utiles dans des attributs plutôt que dans le texte visible. Une note peut, par exemple, se trouver dansalt="5 stars" ou dans une valeur source comme src.
1
Sélectionner l’élément
Sélectionnez l’élément contenant la valeur, par exemple une icône de note ou un bloc de texte.
2
Choisir la valeur source
Selon l’emplacement, utilisez URL de l’image, OuterHTML ou Autres attributs.
3
Personnaliser le champ
Ouvrez le menu du champ et choisissez Personnaliser le champ ou Nettoyer les données.
4
Extraire la valeur cible
Sélectionnez l’attribut utile ou utilisez RegEx pour ne conserver que la partie voulue du HTML.
5
Prévisualiser avant d’enregistrer
Vérifiez que l’aperçu affiche la valeur attendue avant d’exécuter la tâche.
Limites de l’affinement des champs
Les règles nettoient une valeur déjà extraite ; elles ne modifient pas la structure de la page. Par exemple, un bloc affiché sur plusieurs lignes peut constituer un seul élément dans le code source. Octoparse peut alors le traiter comme un seul champ, impossible à diviser en se fondant uniquement sur les retours à la ligne visuels. Examinez la structure source et utilisez la sélection de champ, les paramètres d’extraction ou une regex selon le stockage réel des données.Bonnes pratiques
- Affinez les champs après avoir confirmé que le bon élément est sélectionné.
- Essayez des étapes simples avant RegEx.
- Prévisualisez chaque étape avant de l’enregistrer.
- Donnez des noms clairs aux champs pour rendre l’export compréhensible.
- Évitez un nettoyage excessif si le système en aval peut gérer le formatage.
- Documentez les regex complexes pour faciliter la maintenance par l’équipe.