Skip to main content
Le recensioni e le valutazioni sono dati che riflettono la soddisfazione dei clienti, i motivi di insoddisfazione e la qualità della domanda. Il web scraping è un modo per raccogliere in modo continuo recensioni sparse su più siti e darle una forma utilizzabile per l’analisi del sentiment e della reputazione. Questa pagina è un manuale tecnico per la progettazione dei dati, dalla raccolta delle recensioni fino alla loro analisi. Per raccogliere recensioni da un sito specifico, consulta le guide per sito; per progettare l’analisi, usa questa pagina.

Dati ottenuti dalle recensioni

Le pagine delle recensioni forniscono dati strutturati utilizzabili per l’analisi. Combinare testo e punteggio rivela schemi che il punteggio da solo non mostra, ad esempio «punteggio alto ma il testo descrive un reclamo».

Scegliere le fonti di dati

Scegli le fonti delle recensioni in base a ciò che analizzi. Leggere recensioni da più fonti rivela le differenze di valutazione per canale e la forma complessiva della reputazione.

Progettare la raccolta

Per ottenere dati di recensioni utilizzabili per l’analisi, progetta già nella fase di raccolta.
  1. Definisci l’obiettivo dell’analisi (prodotto, punto vendita, marchio, periodo).
  2. Decidi i campi da raccogliere (testo, punteggio e data come minimo).
  3. Scegli il metodo di raccolta (recupero massivo delle recensioni passate o monitoraggio puntuale delle nuove).
  4. Rimuovi i duplicati (individua recensioni duplicate e ripubblicate).
  5. Normalizza (allinea lingua, codifica e scala di punteggio).
Raccogli sempre il punteggio e la data di pubblicazione insieme al testo della recensione. Il punteggio serve come dati di addestramento o validazione per il sentiment, e la data alimenta l’analisi delle serie temporali. Il solo testo restringe molto ciò che puoi analizzare.

Estendere all’analisi

Una volta raccolti e normalizzati, i dati delle recensioni alimentano diverse analisi.
  • Classificazione del sentiment: classifica il testo come positivo/negativo/neutro e segui la variazione delle proporzioni.
  • Estrazione di temi: estrai temi ricorrenti (prezzo, qualità, consegna, assistenza) e individua i reclami.
  • Andamento delle valutazioni nel tempo: misura l’impatto di iniziative o problemi dalle variazioni del punteggio o del tasso negativo.
  • Confronto di prodotti e punti vendita: confronta concorrenti o i tuoi prodotti e punti vendita per valutazione e contenuto delle recensioni.
  • Correlazione punteggio-testo: leggi lo scarto tra punteggio e testo per vedere ciò che il punteggio da solo nasconde.
Monitorare le nuove recensioni e definire eventi (come un picco del tasso negativo) permette di alimentare avvisi e report automatizzati.

A cosa prestare attenzione

  • Copyright sul testo della recensione: il testo della recensione è fortemente protetto da copyright. Poterlo raccogliere è diverso dal poterlo ripubblicare, ridistribuire o riutilizzare liberamente. Distingui l’uso interno per l’analisi dal riutilizzo pubblico.
  • Dati personali: riduci al minimo i dati personali come il nome dell’autore; non raccoglierli né conservarli se l’analisi non ne ha bisogno.
  • robots.txt e termini di servizio: verifica il permesso di crawl e i termini per ogni URL di destinazione.
  • Carico del server: mantieni frequenza e volume moderati nella raccolta pianificata.
Per i criteri che determinano la legalità, vedi Il web scraping è legale?.

Implementazione con Octoparse

Octoparse renderizza le pagine in un browser reale con interfaccia, quindi possono essere raccolte anche le recensioni mostrate tramite caricamento incrementale. Puoi configurare visivamente sia un recupero massivo delle recensioni passate sia la raccolta ricorrente di quelle nuove, e accumularle in continuo con esecuzioni nel cloud. Configura la raccolta ricorrente con le esecuzioni pianificate e usa Affinare e pulire i dati estratti per dare forma alle recensioni raccolte.

Risorse correlate