Sources de données courantes
Pour un RAG, collectez des articles et documents du domaine cible, découpez leur corps en segments, puis stockez-les avec leurs métadonnées. Pour un modèle de sentiment, collectez le texte des avis et les notes comme données étiquetées.
Conception des champs et des données
Les données d’entraînement doivent préserver leur provenance et leur contexte, pas seulement le corps du texte. Champs à conserver pour l’entraînement et le RAG :- Corps du texte nettoyé
- Titre, intertitres et structure des sections
- Dates de publication et de mise à jour
- Catégorie, étiquettes et langue
- URL source
- Horodatage de la collecte
- Informations sur la licence et les conditions d’utilisation (droits de réutilisation)
- Indices d’autorité du contenu (domaine, auteur)
- Empreinte ou texte normalisé pour la Déduplication
- Conditions de collecte (requête, périmètre, échantillonnage)
Flux de collecte
- Choisissez des sources adaptées au modèle et à la tâche cibles.
- Découvrez les pages cibles (recherche, catégories, sitemaps, pages de liste).
- Extrayez le corps du texte et les métadonnées en excluant la navigation, les publicités et les éléments répétés.
- Normalisez et nettoyez le texte : supprimez le HTML, corrigez les espaces et uniformisez l’encodage.
- Dédupliquez par URL, texte normalisé ou empreinte.
- Filtrez selon la qualité : excluez les textes trop courts, dans une langue incorrecte ou composés de contenu standard répétitif.
- Formatez pour l’entraînement : JSONL, segments accompagnés de métadonnées, etc.
Qualité et conformité
La collecte de données pour l’IA et les LLM doit être conçue en tenant compte à la fois de la qualité et des licences.- Droits d’auteur et conditions d’utilisation : la possibilité de collecter un texte ne détermine pas son droit de réutilisation. Vérifiez les licences et les conditions propres à chaque site.
- robots.txt : vérifiez l’autorisation d’exploration pour chaque URL cible.
- Données personnelles : réduisez au minimum les noms, coordonnées et autres données personnelles ; ne les collectez ni ne les stockez si elles sont inutiles.
- Registres de provenance : conservez l’URL source et l’horodatage pour vérifier les licences et traiter ultérieurement les demandes de retrait.
- Qualité : excluez les contenus standard répétitifs, doublons, traductions automatiques de mauvaise qualité et contenus préjudiciables.
Collecte avec Octoparse et MCP
Octoparse affiche les pages dans un véritable navigateur avec interface et peut donc collecter le texte généré dynamiquement par JavaScript. Créez un Flux de travail séparant la découverte (listes, recherche) de l’extraction (corps du texte, métadonnées), puis exécutez-le selon un calendrier dans le cloud pour actualiser les données d’entraînement. Pour collecter directement depuis un agent d’IA, utilisez Octoparse MCP Server : un client compatible MCP peut rechercher des Modèles, exécuter des Tâches et récupérer des données en langage naturel. Pour l’extraction de contenu général, le modèle universel d’extraction de contenu fonctionne sur des pages web variées.Ressources connexes
- Lancer la collecte depuis un agent d’IA (MCP Server) — un client compatible MCP collecte directement les données Octoparse
- Extraire des pages affichées avec JavaScript — méthodes adaptées au contenu dynamique
- Gérer la pagination — couvrir un grand nombre de pages
- Affiner et nettoyer les données extraites — normaliser le texte d’entraînement
- Le web scraping est-il légal ? — légalité et périmètre de la collecte