Rakuten Ichiba est la plus grande marketplace du Japon. Elle publie des données structurées sur les prix des produits, les avis, les stocks et les classements, ce qui en fait une cible courante pour la surveillance des prix, l’analyse de la concurrence et l’étude de marché. Ce guide est un manuel technique qui présente les données que vous pouvez extraire de Rakuten Ichiba et la façon de parcourir la structure de ses pages.
Scrapez uniquement des données publiques et respectez les conditions d’utilisation du site ainsi que les lois applicables sur la protection de la vie privée. Pour connaître les critères qui déterminent la légalité de cette pratique, consultez Le web scraping est-il légal ?.
Données que vous pouvez scraper
Les champs que vous pouvez collecter dépendent du type de page.
Les pages de résultats de recherche (listes) présentent :
- Titre du produit
- Prix
- Frais de livraison
- Points gagnés
- Position dans le classement
- Nombre d’avis
- Nom de la boutique
- URL de la boutique
- URL de chaque fiche produit
Les fiches produit présentent :
- Description du produit
- Images du produit
- Variantes (couleur, taille, etc.)
- État du stock
- Conditions de vente
- Note des avis
Les pages d’avis présentent :
- Texte de l’avis
- Auteur de l’avis
- Note
- Date de publication
Le texte des avis est fortement protégé par le droit d’auteur. Sa republication ou sa redistribution après collecte est donc restreinte.
Structure des pages et méthode de navigation
La collecte de données sur Rakuten Ichiba suit cet ordre :
- Effectuez une recherche par catégorie ou par mot-clé et enregistrez l’URL de la page de résultats. Les critères de recherche figurent dans les paramètres de l’URL ; préparer une URL par catégorie permet donc de conserver un périmètre de collecte gérable.
- Sur la page de résultats de recherche, collectez les champs de base des produits et l’URL de chaque fiche produit.
- Parcourez en boucle les URL de produits collectées et extrayez les champs détaillés de chaque fiche produit.
- Si vous avez besoin des avis, accédez à leur page et collectez-les en gérant le chargement progressif.
Déterminer si les champs des listes suffisent ou si vous avez également besoin des détails des produits et des avis permet de réduire le nombre de changements de page et la charge imposée au site cible.
Considérations techniques
Contenu chargé dynamiquement avec JavaScript
Certains éléments de Rakuten Ichiba ne figurent pas dans le code HTML lors de l’ouverture initiale de la page : ils se chargent après l’exécution de JavaScript. Un outil de scraping qui récupère uniquement le code HTML brut ne peut pas collecter ces éléments. Pour les traiter, affichez la page dans un navigateur réel qui exécute JavaScript avant de procéder à l’extraction. Pour plus de détails, consultez Scraper les pages rendues par JavaScript.
Attendez que l’élément précis s’affiche, et non que l’événement de chargement de la page se déclenche. Le chargement de la page et la fin de l’affichage de l’élément ne se produisent pas au même moment.
Les résultats de recherche de Rakuten Ichiba sont répartis sur des pages numérotées. Les avis peuvent s’afficher progressivement à mesure de leur chargement. Le traitement varie selon la méthode utilisée — pages numérotées, liens vers la page suivante ou bouton de chargement supplémentaire — alors commencez par identifier celle de la page cible. Consultez Comment gérer la pagination.
Contrôle des accès et charge du serveur
Rakuten Ichiba dispose de mécanismes de contrôle contre les accès automatisés. L’envoi d’un grand nombre de requêtes dans un court laps de temps facilite la détection d’un outil de scraping.
N’essayez pas de contourner techniquement les contrôles d’accès. Maintenez une fréquence, un volume et un rythme de requêtes modérés. Rakuten Ichiba peut définir la directive Disallow pour certains chemins dans le fichier robots.txt ; vérifiez donc les conditions d’utilisation et le fichier robots.txt pour chaque URL cible. Pour connaître les critères qui déterminent la légalité de cette pratique, consultez Le web scraping est-il légal ?.
Scraping avec Octoparse
Octoparse affiche les pages dans un navigateur réel avec interface graphique. Le contenu chargé dynamiquement avec JavaScript peut ainsi être collecté sans écrire de code. Le parcours en boucle des listes de résultats vers les fiches produit, l’attente du chargement progressif et la planification des exécutions dans le Cloud se configurent dans l’éditeur visuel.
Vous pouvez commencer à collecter les listes Rakuten avec le modèle de scraping des listes de produits Rakuten, qui vous permet de démarrer à partir d’une URL et de prévisualiser les champs obtenus.
Cas d’usage
- Surveillance des prix : suivez dans le temps les prix des produits concurrents, les frais de livraison et les points
- Analyse de la concurrence et du marché : étudiez les classements par catégorie, le nombre d’avis et la répartition des boutiques
- Indicateurs de stock et de demande : collectez en continu l’état des stocks et le classement des meilleures ventes
- Analyse des avis : agrégez les notes des avis et les tendances de leur contenu
Le scraping de Rakuten Ichiba est plus efficace lorsqu’il répond à un objectif précis : moins de champs, une charge réduite pour le site et des données de sortie fiables.