Skip to main content
Las reseñas y valoraciones son datos que reflejan la satisfacción del cliente, las quejas y la calidad de la demanda. El web scraping es una forma de recopilar reseñas dispersas en múltiples sitios, de manera continua, y darles una forma útil para el análisis de sentimiento y reputación. Esta página es un manual técnico para el diseño de datos que va desde recopilar reseñas hasta analizarlas. Para saber cómo recopilar reseñas de un sitio concreto, consulta las guías por sitio; para diseñar el análisis, usa esta página.

Datos que obtienes de las reseñas

Las páginas de reseñas ofrecen datos estructurados que puedes usar para el análisis. Combinar texto con puntuación revela patrones que la puntuación sola no muestra, por ejemplo «puntuación alta pero el texto describe una queja».

Elegir las fuentes de datos

Elige las fuentes de reseñas según lo que vayas a analizar.
  • Comercio electrónico y reseñas de productos: recopila reseñas de productos y opiniones de compradores de Amazon y Rakuten. Consulta Cómo hacer scraping de Amazon y Cómo hacer scraping de Rakuten Ichiba.
  • Reseñas de establecimientos y servicios: extrae valoraciones de establecimientos y reputación de zona de sitios de reseñas. Consulta Cómo hacer scraping de Yelp.
  • Reseñas de servicios de mapas: recopila la reputación de negocios locales de las reseñas de Google Maps. Consulta Cómo hacer scraping de Google Maps.
  • Redes sociales y foros: recopila reputación y volumen de conversación sobre productos y marcas a partir de las publicaciones.
Leer reseñas de múltiples fuentes revela diferencias de valoración por canal y la forma general de la reputación.

Diseñar la recopilación

Para obtener datos de reseñas útiles para el análisis, diseña ya en la fase de recopilación.
  1. Define el objetivo del análisis (producto, establecimiento, marca, periodo).
  2. Decide los campos a recopilar (texto, puntuación y fecha como mínimo).
  3. Elige el método de recopilación (carga masiva de reseñas pasadas o monitoreo puntual de las nuevas).
  4. Elimina duplicados (detecta reseñas duplicadas y republicadas).
  5. Normaliza (alinea idioma, codificación y escala de puntuación).
Recopila siempre la puntuación y la fecha de publicación junto con el texto de la reseña. La puntuación sirve como datos de entrenamiento o validación para el sentimiento, y la fecha impulsa el análisis de series temporales. Solo el texto reduce mucho lo que puedes analizar.

Extender al análisis

Una vez recopilados y normalizados, los datos de reseñas alimentan diversos análisis.
  • Clasificación de sentimiento: clasifica el texto como positivo/negativo/neutral y sigue la variación de la proporción.
  • Extracción de temas: extrae temas recurrentes (precio, calidad, entrega, atención) e identifica quejas.
  • Tendencias de valoración en el tiempo: mide el impacto de iniciativas o incidencias a partir de los cambios en la puntuación o la tasa negativa.
  • Comparación de productos y establecimientos: compara competidores o tus propios productos y establecimientos por valoración y contenido de reseñas.
  • Correlación puntuación-texto: lee la brecha entre puntuación y texto para ver lo que la puntuación sola oculta.
Monitorear las reseñas nuevas y definir eventos (como un pico en la tasa negativa) permite alimentar alertas e informes automatizados.

Qué tener en cuenta

  • Derechos de autor del texto de la reseña: el texto de la reseña está muy protegido por derechos de autor. Poder recopilarlo es distinto de poder republicarlo, redistribuirlo o reutilizarlo libremente. Distingue el uso interno para análisis del uso público.
  • Datos personales: minimiza los datos personales como el nombre del autor; no los recopiles ni almacenes si el análisis no los necesita.
  • robots.txt y términos de servicio: comprueba el permiso de rastreo y los términos por cada URL objetivo.
  • Carga del servidor: mantén moderadas la frecuencia y el volumen en la recopilación programada.
Para los criterios que determinan la legalidad, consulta ¿Es legal el web scraping?.

Implementar con Octoparse

Octoparse renderiza las páginas en un navegador real con interfaz, por lo que también pueden recopilarse las reseñas que se muestran mediante carga incremental. Puedes configurar visualmente tanto una carga masiva de reseñas pasadas como la recopilación recurrente de las nuevas, y acumularlas de forma continua con ejecuciones en la nube. Configura la recopilación recurrente con ejecuciones programadas y usa Refinar y limpiar los datos extraídos para dar forma a las reseñas que recopilas.

Recursos relacionados