Skip to main content
El entrenamiento, el ajuste fino y la RAG (generación aumentada por recuperación) necesitan grandes volúmenes de datos adecuados para cada tarea. El web scraping permite recopilar de forma continua texto público, datos estructurados, reseñas e información especializada de la web en un formato que un modelo pueda utilizar. El objetivo no es capturar tantas páginas como sea posible. Hay que determinar qué fuentes se ajustan al modelo de destino, qué campos conservar, cómo normalizar y deduplicar los datos, y si la recopilación es adecuada en cuanto a licencias, condiciones del servicio y datos personales.

Fuentes de datos habituales

Para RAG, recopila artículos y documentos del dominio de destino, divide después el cuerpo del texto en fragmentos y guárdalos con sus metadatos. Para un modelo de sentimiento, recopila el texto y la puntuación de las reseñas como datos etiquetados.

Diseño de campos y datos

Los datos de entrenamiento deben conservar la procedencia y el contexto, no solo el cuerpo del texto. Campos que conviene conservar para entrenamiento y RAG:
  • Cuerpo del texto (limpio)
  • Título, encabezados y estructura de secciones
  • Fechas de publicación y actualización
  • Categoría, etiquetas e idioma
  • URL de origen
  • Marca de tiempo de la recopilación
Campos que conviene conservar para garantizar la calidad y la trazabilidad:
  • Información sobre licencias y condiciones del servicio (derechos de reutilización)
  • Indicadores de autoridad del contenido (dominio, autor)
  • Hash o texto normalizado para la deduplicación
  • Condiciones de recopilación (consulta, alcance, muestreo)
Conserva la URL de origen y la marca de tiempo de recopilación en cada fila. Así podrás rastrear la procedencia de los datos de entrenamiento y, más adelante, verificar licencias, deduplicar, gestionar solicitudes de exclusión y actualizar el conjunto de datos.

Flujo de recopilación

  1. Elige fuentes de datos que se ajusten al modelo y la tarea de destino.
  2. Descubre las páginas de destino (búsquedas, categorías, mapas del sitio y páginas de listado).
  3. Extrae el cuerpo del texto y los metadatos (descarta la navegación, los anuncios y los elementos repetidos).
  4. Normaliza y limpia el texto (elimina HTML, corrige los espacios y unifica la codificación).
  5. Deduplica (por URL, texto normalizado o hash).
  6. Filtra por calidad (descarta contenido demasiado breve, en un idioma incorrecto o compuesto por texto repetitivo de plantilla).
  7. Aplica el formato de entrenamiento (JSONL, fragmentos con metadatos, etc.).
Separar el descubrimiento de la extracción facilita procesar grandes cantidades de páginas en paralelo.

Calidad y cumplimiento

La recopilación de datos para IA y LLM debe diseñarse teniendo en cuenta tanto la calidad como las licencias.
  • Derechos de autor y condiciones del servicio: que se pueda recopilar el cuerpo de un texto no implica que se pueda reutilizar. Comprueba las licencias y las condiciones de cada sitio.
  • robots.txt: comprueba los permisos de rastreo de cada URL de destino.
  • Datos personales: reduce al mínimo nombres, datos de contacto y otros datos personales; no los recopiles ni almacenes si no los necesitas.
  • Registros de procedencia: conserva la URL de origen y la marca de tiempo de recopilación para poder verificar licencias y atender solicitudes de exclusión más adelante.
  • Calidad: excluye de los datos de entrenamiento el texto repetitivo de plantilla, los duplicados, el ruido de traducciones automáticas y el contenido perjudicial.
Que unos datos sean públicos y se puedan recopilar no significa que puedan reutilizarse como datos de entrenamiento. Trata el texto protegido por derechos de autor y los datos que contengan información personal únicamente después de comprobar las licencias y la legislación aplicable. Esta página ofrece una visión general y no constituye asesoramiento jurídico.

Recopilar datos con Octoparse y MCP

Octoparse renderiza las páginas en un navegador real con interfaz gráfica, por lo que también permite recopilar texto generado dinámicamente con JavaScript. Crea un flujo de trabajo que separe el descubrimiento (listados y búsquedas) de la extracción (cuerpo del texto y metadatos) y ejecútalo según una programación en la nube para mantener actualizados los datos de entrenamiento. Para recopilar datos directamente desde un agente de IA, utiliza Octoparse MCP Server: un cliente de IA compatible con MCP puede buscar plantillas, ejecutar tareas y recuperar datos mediante lenguaje natural. Para extraer contenido general, la plantilla universal de extracción de contenido funciona con todo tipo de páginas web.

Recursos relacionados