Skip to main content
La Génération de leads est l’un des usages les plus concrets du web scraping. Au lieu d’acheter une liste statique, les équipes collectent des signaux publics récents dans les annuaires, cartes, places de marché, résultats de recherche, sites d’entreprise, offres d’emploi et plateformes d’avis. Le résultat est un jeu de données structurées que les équipes commerciales, marketing et opérationnelles peuvent filtrer, enrichir, noter et acheminer. La difficulté n’est pas d’extraire une page, mais de choisir des sources légitimes, les champs pertinents, les contrôles de validité et un processus conforme.

Sources courantes

Une agence locale peut par exemple collecter les « dentistes à Austin » dans Google Maps, enrichir chaque site avec l’e-mail et les réseaux sociaux, puis noter les leads selon les avis, la qualité du site et la publicité. Une entreprise SaaS B2B peut partir d’offres d’emploi révélant un besoin pour son produit.

Conception des champs

Ne collectez pas tous les champs visibles. Partez de la décision que la liste doit permettre. Champs principaux :
  • Nom de l’entreprise
  • Site web
  • Catégorie ou secteur
  • Adresse, ville, région et pays
  • Téléphone
  • URL source
  • Date de collecte
Champs de qualification utiles :
  • Note et nombre d’avis
  • Nombre d’employés ou de sites
  • Postes ouverts ou service recruteur
  • Signaux technologiques du site
  • Profils sociaux
  • Activité récente ou date du dernier avis
  • Horaires ou état d’ouverture
Champs de prise de contact :
  • Adresse e-mail publique
  • URL de la page de contact
  • URL LinkedIn de l’entreprise
  • Profil public d’un décideur
  • Fonction lorsqu’elle est publique
Conservez la provenance et la date de chaque ligne. La Déduplication, les désinscriptions et les mises à jour en deviennent beaucoup plus simples.

Processus d’enrichissement

  1. Découvrir les entreprises. Utilisez cartes, annuaires, recherches ou places de marché.
  2. Normaliser les fiches. Nettoyez noms, adresses, téléphones, catégories et URL.
  3. Enrichir depuis les sites. Collectez e-mails publics, pages de contact, réseaux sociaux et lieux.
  4. Ajouter les signaux d’intention. Emplois, avis, publications, nouveaux sites ou produits indiquent le bon moment.
  5. Noter et segmenter. Classez selon l’adéquation, l’exhaustivité, la récence, la zone ou l’intention.
  6. Exporter vers le CRM. N’envoyez que les fiches qualifiées.
Les Modèles Google Maps d’Apify et d’Octoparse partent souvent de recherches, lieux, URL ou identifiants de lieu et renvoient nom, adresse, téléphone, site, note, avis, catégorie, coordonnées et horaires. Certains enrichissent aussi les contacts sur le site de l’entreprise. Séparer découverte et enrichissement est préférable à attendre qu’une source fournisse tout.

Contrôles de qualité

  • Dédupliquez par domaine, téléphone et adresse. Les noms varient.
  • Distinguez le siège des agences. Une chaîne peut avoir de nombreux sites, mais un seul siège.
  • Validez les e-mails. Une adresse collectée n’est pas nécessairement joignable ni adaptée à la prospection.
  • Suivez les fiches obsolètes. Fermetures, anciennes offres et avis modifient la qualité.
  • Conservez le niveau de confiance. Une page de contact directe est plus fiable qu’un champ recopié dans un annuaire.

Conformité et éthique

  • Ne collectez des données publiques que pour un usage légitime.
  • Évitez les données personnelles sensibles sans base juridique claire.
  • Respectez robots.txt, les conditions des sites, les limites de débit et les demandes d’opposition.
  • Ne collectez pas les réseaux connectés en violation des règles du compte.
  • Reliez au CRM les processus de désinscription, d’exclusion et de suppression.
La conformité de la prospection B2B dépend souvent du pays, du type de message, de la base légale et de l’usage ultérieur. Le scraping doit appartenir à un processus gouverné, pas contourner le consentement ou la vie privée.

Utilité des Modèles

Les Modèles prédéfinis conviennent aux sources courantes : Google Maps, Yelp, Pages Jaunes, vendeurs Amazon, emplois LinkedIn et autres annuaires. Apify, Bright Data et Octoparse prennent en charge une grande partie du travail répétitif : Pagination, association des champs, navigateur, Proxy, nouvelles tentatives et exports. Un Flux de travail personnalisé se justifie pour une source spécialisée, des champs inhabituels ou une logique multisuche. Le principe reste le même : découvrir, enrichir, valider, noter et n’exporter que les fiches utilisables de manière responsable.