Skip to main content
Tabelog è la più grande piattaforma giapponese di recensioni gastronomiche e di ristoranti. Raccoglie in un unico luogo informazioni strutturate sui locali, valutazioni, recensioni e disponibilità delle prenotazioni, diventando una destinazione comune per creare elenchi di lead di ristoranti, monitorare la concorrenza, svolgere Ricerche di mercato per area e analizzare le recensioni. Questa guida è un manuale tecnico sui dati che puoi estrarre da Tabelog e su come navigare nella struttura delle sue pagine. Per sapere se lo scraping di Tabelog è legale, consulta Il web scraping è legale?.

Dati che puoi estrarre da Tabelog

I campi disponibili dipendono dal tipo di pagina scelto, quindi stabilisci ciò che ti serve prima di decidere quali pagine visitare. Pagine dei risultati di ricerca (elenchi) — Filtrato per area e genere, un elenco raccoglie in una sola volta le informazioni di base di molti ristoranti: nome del locale, genere, area e stazione più vicina, valutazione, numero di recensioni, fascia di prezzo (pranzo/cena) e URL della pagina di ogni locale. Pagine di dettaglio dei locali — Il profilo completo di un singolo ristorante: indirizzo, numero di telefono, indicazioni per raggiungerlo, orari di apertura, giorni di chiusura, numero di posti, disponibilità di sale private e metodi di pagamento. Pagine delle recensioni — Testo, recensore, punteggio e periodo della visita. Il testo delle recensioni gode di un elevato livello di protezione del diritto d’autore e deve quindi essere trattato con attenzione dopo la raccolta (vedi sotto). Calendario di disponibilità/prenotazioni — Disponibilità giorno per giorno. Quest’area è generalmente renderizzata tramite JavaScript e non appare recuperando il solo HTML (vedi sotto).

Passaggio 1: raccogliere l’elenco dai risultati di ricerca

Inizia restringendo la destinazione per area e genere. Le condizioni di ricerca di Tabelog sono riflesse nei parametri dell’URL, quindi preparare un URL per ogni combinazione di area e genere mantiene l’ambito della raccolta esplicito e gestibile. Nella pagina dell’elenco, raccogli i campi di base, come nome, valutazione e budget, insieme al link alla pagina di dettaglio di ogni locale.

Passaggio 2: passare alle pagine di dettaglio dei locali

Esegui un loop sugli URL dei locali raccolti dall’elenco ed estrai i campi dettagliati: indirizzo, numero di telefono, orari di apertura, numero di posti e così via. Decidere in anticipo se basta l’elenco o servono anche le pagine di dettaglio evita transizioni non necessarie e riduce il carico sul sito.

Passaggio 3: raccogliere le recensioni quando servono

Esegui lo scraping delle recensioni soltanto quando richiesto dall’analisi del sentiment o delle loro tendenze. Gli elenchi di recensioni in genere caricano altre voci tramite un pulsante “mostra altro” o con l’impaginazione, quindi la raccolta richiede interazione, non la semplice lettura della pagina. Per gestire il passaggio tra pagine e lo scorrimento infinito, consulta Come gestire l’impaginazione.

Gestire i contenuti renderizzati con JavaScript

Elementi come il calendario di disponibilità non esistono nell’HTML al momento dell’apertura della pagina: appaiono soltanto dopo l’esecuzione del JavaScript. Un web scraper che recupera unicamente l’HTML grezzo troverà vuote queste parti. La soluzione è renderizzare la pagina in un browser reale che esegua JavaScript e quindi estrarre i dati dal DOM completo. Il motivo per cui è necessario un browser reale e gli altri approcci disponibili, come chiamare direttamente l’API sottostante o rilevare SSR, sono trattati in Scraping di pagine renderizzate con JavaScript. Se sviluppi il flusso tramite codice, Playwright e strumenti simili gestiscono il problema nello stesso modo.
Attendi il rendering dell’elemento specifico che ti serve, ad esempio una data del calendario, anziché aspettare che la pagina “finisca” di caricarsi. L’evento di caricamento e il completamento del rendering dei contenuti non avvengono nello stesso momento.

Controlli anti-bot e scraping responsabile

Tabelog adotta controlli contro l’accesso automatizzato e l’invio di molte richieste in un breve intervallo rende più facile rilevare un web scraper. Mantenere prudenti frequenza, volume e tempistica delle richieste, senza superare di molto la normale navigazione umana, è il requisito essenziale per raccogliere dati in modo affidabile nel tempo.
Anziché tentare di aggirare tecnicamente i controlli di accesso, dai priorità a una progettazione che eviti di generare carico. Tabelog può impostare Disallow per alcuni percorsi in robots.txt, quindi verifica termini di servizio e robots.txt per ogni URL di destinazione. Il testo delle recensioni gode di un’elevata protezione del diritto d’autore: poterlo raccogliere non significa poterlo ripubblicare o ridistribuire liberamente. Per i criteri che determinano la legalità, consulta Il web scraping è legale?.

Scraping con Octoparse

Octoparse renderizza le pagine in un browser reale headed, quindi contenuti renderizzati tramite JavaScript, come il calendario di disponibilità, possono essere gestiti senza scrivere codice. Il loop dagli elenchi alle pagine di dettaglio e l’attesa dei contenuti caricati in modo differito, mediante timeout AJAX o scorrimento, vengono configurati nell’editor visuale. Quando i dati servono continuativamente, l’Estrazione cloud viene eseguita secondo una pianificazione anche a computer spento. Puoi iniziare a raccogliere elenchi per area e genere con il modello di scraper dei dati dei locali Tabelog, che ti consente di partire da un URL e visualizzare in anteprima i campi ottenuti.

Casi d’uso

  • Elenchi di lead di ristoranti — organizza le informazioni sui locali filtrate per area e genere in un elenco per le attività di contatto
  • Monitoraggio delle valutazioni della concorrenza — segui nel tempo l’andamento delle valutazioni e del numero di recensioni in un’area specifica
  • Ricerca di mercato per area — esamina la distribuzione dei generi, le fasce di prezzo e la densità dei locali per caratterizzare un’area
  • Analisi inbound/delle recensioni — aggrega le tendenze delle recensioni per far emergere domanda e aspetti da migliorare
Lo scraping di Tabelog funziona al meglio quando l’obiettivo è ristretto. Stabilisci prima che cosa vuoi raccogliere: l’elenco dei campi si ridurrà, il carico sul sito diminuirà e l’output sarà più affidabile.