Fuentes de datos habituales
Para RAG, recopila artículos y documentos del dominio de destino, divide después el cuerpo del texto en fragmentos y guárdalos con sus metadatos. Para un modelo de sentimiento, recopila el texto y la puntuación de las reseñas como datos etiquetados.
Diseño de campos y datos
Los datos de entrenamiento deben conservar la procedencia y el contexto, no solo el cuerpo del texto. Campos que conviene conservar para entrenamiento y RAG:- Cuerpo del texto (limpio)
- Título, encabezados y estructura de secciones
- Fechas de publicación y actualización
- Categoría, etiquetas e idioma
- URL de origen
- Marca de tiempo de la recopilación
- Información sobre licencias y condiciones del servicio (derechos de reutilización)
- Indicadores de autoridad del contenido (dominio, autor)
- Hash o texto normalizado para la deduplicación
- Condiciones de recopilación (consulta, alcance, muestreo)
Flujo de recopilación
- Elige fuentes de datos que se ajusten al modelo y la tarea de destino.
- Descubre las páginas de destino (búsquedas, categorías, mapas del sitio y páginas de listado).
- Extrae el cuerpo del texto y los metadatos (descarta la navegación, los anuncios y los elementos repetidos).
- Normaliza y limpia el texto (elimina HTML, corrige los espacios y unifica la codificación).
- Deduplica (por URL, texto normalizado o hash).
- Filtra por calidad (descarta contenido demasiado breve, en un idioma incorrecto o compuesto por texto repetitivo de plantilla).
- Aplica el formato de entrenamiento (JSONL, fragmentos con metadatos, etc.).
Calidad y cumplimiento
La recopilación de datos para IA y LLM debe diseñarse teniendo en cuenta tanto la calidad como las licencias.- Derechos de autor y condiciones del servicio: que se pueda recopilar el cuerpo de un texto no implica que se pueda reutilizar. Comprueba las licencias y las condiciones de cada sitio.
- robots.txt: comprueba los permisos de rastreo de cada URL de destino.
- Datos personales: reduce al mínimo nombres, datos de contacto y otros datos personales; no los recopiles ni almacenes si no los necesitas.
- Registros de procedencia: conserva la URL de origen y la marca de tiempo de recopilación para poder verificar licencias y atender solicitudes de exclusión más adelante.
- Calidad: excluye de los datos de entrenamiento el texto repetitivo de plantilla, los duplicados, el ruido de traducciones automáticas y el contenido perjudicial.
Recopilar datos con Octoparse y MCP
Octoparse renderiza las páginas en un navegador real con interfaz gráfica, por lo que también permite recopilar texto generado dinámicamente con JavaScript. Crea un flujo de trabajo que separe el descubrimiento (listados y búsquedas) de la extracción (cuerpo del texto y metadatos) y ejecútalo según una programación en la nube para mantener actualizados los datos de entrenamiento. Para recopilar datos directamente desde un agente de IA, utiliza Octoparse MCP Server: un cliente de IA compatible con MCP puede buscar plantillas, ejecutar tareas y recuperar datos mediante lenguaje natural. Para extraer contenido general, la plantilla universal de extracción de contenido funciona con todo tipo de páginas web.Recursos relacionados
- Ejecutar la recopilación de datos desde un agente de IA (MCP Server) — un cliente compatible con MCP recopila datos de Octoparse directamente
- Extraer datos de páginas renderizadas con JavaScript — métodos para contenido dinámico
- Cómo gestionar la paginación — abarca un gran número de páginas
- Refinar y limpiar los datos extraídos — normaliza texto para el entrenamiento
- ¿Es legal el web scraping? — legalidad y alcance de la recopilación