Skip to main content
Amazon est l’une des sources e-commerce les plus précieuses et les plus difficiles à scraper. Les pages produit contiennent des prix, vendeurs, avis, variantes, classements, images et caractéristiques. Toutefois, le site est dynamique, localisé et étroitement surveillé, et les différentes marketplaces Amazon peuvent présenter des mises en page distinctes. Commencez par déterminer le type de page Amazon dont vous avez besoin. Les résultats de recherche, les détails des produits et les avis nécessitent des Flux de travail distincts.

Types de pages

La page des modèles Amazon d’Octoparse suit la même répartition : pages d’annonces pour une collecte étendue de produits, pages détaillées pour des caractéristiques plus riches, collecte propre à Prime et scraping des avis pour l’analyse des retours. Apify et Bright Data distinguent de façon similaire les produits, détails et avis dans leurs outils de web scraping et jeux de données Amazon.

Étape 1 : choisir les données d’entrée

Utilisez des mots-clés pour découvrir des produits :
Utilisez des URL de produit ou des ASIN si vous connaissez déjà le catalogue :
Pour la Surveillance des prix, les ASIN ou les URL de produit sont généralement préférables à des recherches répétées par mot-clé. Pour l’Étude de marché, les recherches par mot-clé et par catégorie mettent en évidence les concurrents et l’évolution des catégories.

Étape 2 : collecter les données des annonces

Les pages de recherche et de catégorie sont utiles pour obtenir une vue d’ensemble. Collectez les éléments suivants :
  • Titre du produit
  • URL du produit
  • ASIN, s’il est disponible
  • Prix
  • Note
  • Nombre d’avis
  • URL de l’image
  • Indicateur de résultat sponsorisé ou organique, s’il est visible
  • Mot-clé de recherche ou catégorie
  • Position dans les résultats
  • Horodatage
La position dans les résultats est importante. Le classement d’un produit pour un mot-clé peut être aussi significatif que son prix.

Étape 3 : consulter les pages détaillées des produits

Les pages détaillées fournissent les champs nécessaires à une analyse approfondie :
  • Marque
  • Puces des fonctionnalités
  • Description du produit
  • Tableau des caractéristiques
  • Variantes
  • Indicateurs concernant le vendeur et le traitement de la commande
  • Classement des meilleures ventes
  • Indications sur le stock ou la livraison
  • Ensemble complet d’images
  • Indicateurs de coupons ou de promotions
Les pages Amazon varient souvent selon le lieu, l’état du compte et la marketplace. Conservez le domaine de la marketplace, la région de livraison et l’horodatage du scraping afin de pouvoir interpréter les différences par la suite.

Étape 4 : scraper les avis séparément

L’extraction des avis constitue un Flux de travail à part entière. L’ordre de tri, la Pagination, la langue, les filtres par note et la région peuvent modifier la sortie. Champs utiles pour les avis :
  • Note
  • Titre de l’avis
  • Texte de l’avis
  • Date de l’avis
  • Nom d’affichage de l’auteur
  • Indicateur d’achat vérifié
  • Nombre de votes utiles
  • Variante du produit
  • URL de l’avis
Pour l’analyse du sentiment, collectez suffisamment de contexte afin d’éviter de mélanger les variantes. Les avis sur une taille, une couleur ou un lot peuvent être trompeurs s’ils sont analysés comme s’ils décrivaient l’ensemble du produit.

Difficultés techniques

Le scraping d’Amazon rencontre fréquemment les difficultés suivantes :
  • Mises en page dynamiques et tests A/B
  • Différences régionales de prix et de disponibilité
  • CAPTCHA et systèmes de détection des bots
  • Champs propres aux variantes
  • Données vendeur absentes ou masquées
  • Limites de Pagination des avis
  • Résultats sponsorisés mélangés aux résultats organiques
Adoptez un rythme modéré, utilisez le rendu d’un véritable navigateur lorsque nécessaire, une configuration stable du Proxy et de l’empreinte, ainsi qu’une logique de nouvelle tentative claire. Pour les Flux de travail récurrents, l’Extraction dans le cloud et la division en sous-tâches permettent de séparer la découverte, l’actualisation des détails et la collecte des avis.

Quand utiliser des modèles

Utilisez un modèle pour obtenir rapidement les champs Amazon courants : annonces par mot-clé, détails des produits par ASIN ou URL, annonces filtrées par Prime ou données d’avis. Les modèles d’Octoparse, d’Apify et de Bright Data réduisent le travail de configuration relatif à la navigation, au mappage des champs, à la Pagination et à l’anti-blocage. Créez un Flux de travail personnalisé pour une logique de marketplace inhabituelle, une mise en correspondance personnalisée des SKU, une intégration aux catalogues internes ou des alertes très spécifiques.

Remarques juridiques et relatives aux règles

Les données Amazon peuvent concerner des vendeurs, des auteurs d’avis et les règles de la marketplace. Scrapez uniquement les données que vous êtes autorisé à utiliser, respectez robots.txt et les conditions applicables, évitez autant que possible les données personnelles ou sensibles et privilégiez les API officielles ou les flux partenaires lorsqu’ils répondent au cas d’usage. Le scraping d’Amazon est plus efficace lorsque l’objectif est précis : surveiller un catalogue, analyser les avis, suivre les concurrents ou étudier les tendances d’une catégorie. Un objectif précis réduit le nombre de champs, allège le scraping et rend la sortie plus fiable.