Skip to main content
Tabelog est la plus grande plateforme japonaise d’avis sur les restaurants et la gastronomie. Elle réunit informations structurées sur les établissements, notes, avis et disponibilités de réservation, ce qui en fait une cible courante pour créer des listes de prospects, surveiller la concurrence, réaliser des études de marché locales et analyser les avis. Ce guide explique techniquement quelles données extraire et comment parcourir la structure des pages. Pour les aspects juridiques, consultez Le web scraping est-il légal ?.

Données extractibles de Tabelog

Les champs dépendent du type de page ciblé ; définissez vos besoins avant de choisir les pages à visiter. Pages de résultats de recherche (listes) — Filtrées par zone et genre, elles regroupent les informations essentielles de nombreux restaurants : nom, genre, zone et gare la plus proche, note, nombre d’avis, tranche de prix (déjeuner/dîner) et URL de chaque établissement. Pages détaillées des établissements — Profil complet d’un restaurant : adresse, téléphone, accès, horaires, jours de fermeture, nombre de places, salles privées et moyens de paiement. Pages d’avis — Texte, auteur, note et période de visite. Les avis bénéficient d’une forte protection par le droit d’auteur : traitez-les avec précaution après leur collecte. Calendrier des disponibilités/réservations — Disponibilité jour par jour. Cette zone est généralement affichée par JavaScript et n’apparaît pas dans une simple récupération HTML.

Étape 1 : collecter la liste depuis les résultats

Commencez par délimiter la cible par zone et genre. Les critères de recherche de Tabelog se reflètent dans les paramètres de l’URL ; préparer une URL par combinaison rend le périmètre explicite et gérable. Collectez sur la liste les champs de base — nom, note, budget — avec le lien vers la page détaillée.

Étape 2 : ouvrir les pages détaillées

Parcourez les URL collectées et récupérez les champs détaillés : adresse, téléphone, horaires, nombre de places, etc. Déterminer à l’avance si la liste suffit ou si les pages détaillées sont nécessaires évite des transitions inutiles et réduit la charge imposée au site.

Étape 3 : collecter les avis si nécessaire

N’extrayez les avis que si votre analyse de sentiment ou de tendances l’exige. Les listes chargent souvent des entrées supplémentaires via un bouton « Afficher plus » ou une Pagination ; leur collecte demande donc une interaction. Consultez Comment gérer la pagination.

Gérer le contenu affiché par JavaScript

Des éléments comme le calendrier n’existent pas dans le HTML à l’ouverture : ils apparaissent après l’exécution de JavaScript. Un outil limité au HTML brut les renvoie vides. Affichez la page dans un véritable navigateur exécutant JavaScript, puis extrayez le DOM complet. Les raisons et autres approches — appel direct de l’API sous-jacente ou détection du SSR — sont détaillées dans Extraire les pages affichées par JavaScript. Dans du code, Playwright et les outils similaires procèdent de la même manière.
Attendez l’affichage de l’élément précis voulu, par exemple une date du calendrier, plutôt que la « fin » du chargement. L’événement de chargement et la fin de l’affichage du contenu ne coïncident pas.

Contrôles anti-bot et scraping responsable

Tabelog protège son accès automatisé ; de nombreuses requêtes rapprochées facilitent la détection. Une fréquence, un volume et un rythme modérés — jamais très éloignés d’une navigation humaine — sont indispensables à une collecte fiable dans le temps.
Au lieu de chercher à contourner techniquement les contrôles d’accès, concevez une collecte qui limite la charge. Tabelog peut définir Disallow pour certains chemins dans robots.txt : vérifiez les conditions d’utilisation et robots.txt pour chaque URL cible. Les avis sont fortement protégés par le droit d’auteur ; pouvoir les collecter n’autorise pas nécessairement leur republication ou redistribution. Consultez Le web scraping est-il légal ?.

Scraping avec Octoparse

Octoparse affiche les pages dans un véritable navigateur avec interface ; le contenu JavaScript, comme le calendrier, peut donc être traité sans code. Le passage des listes aux pages détaillées et l’attente du contenu différé (délais AJAX ou défilement) se configurent dans l’éditeur visuel. Pour une collecte continue, l’Extraction dans le cloud s’exécute selon un planning même lorsque votre ordinateur est éteint. Commencez avec le Modèle d’extraction des établissements Tabelog, qui accepte une URL et permet de prévisualiser les champs obtenus.

Cas d’usage

  • Listes de prospects restaurants — organiser les établissements filtrés par zone et genre pour la prospection
  • Surveillance des notes concurrentes — suivre l’évolution des notes et du nombre d’avis dans une zone
  • Étude de marché locale — analyser genres, prix et densité des établissements
  • Analyse des avis et du tourisme entrant — agréger les tendances pour révéler la demande et les axes d’amélioration
Le scraping de Tabelog est optimal avec un objectif précis. Définissez d’abord les données voulues : la liste de champs se raccourcit, la charge diminue et le résultat devient plus fiable.