> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Refinar datos

> Cambia el nombre y el orden, deriva y limpia campos extraídos con reglas integradas y regex, todo desde el editor de campos de Octoparse, sin código.

Los datos extraídos sin procesar rara vez están listos para usarse tal cual. Octoparse permite refinar los campos extraídos antes de exportarlos para que puedas limpiar texto, modificar la estructura de los valores, eliminar caracteres no deseados y extraer únicamente la parte de un campo que necesitas.

Si se está extrayendo el elemento equivocado, corrige primero la [selección del campo](/docs/es/platform/no-code-builder). **Si está seleccionado el elemento correcto, pero el formato del valor es desordenado, usa reglas de refinamiento.**

## Escenarios que gestiona

<Columns cols={2}>
  <Card title="Limpiar valores desordenados">
    Elimina, reemplaza, recorta o cambia el formato del texto antes de exportarlo.
  </Card>

  <Card title="Extraer parte de un valor">
    Usa reglas de coincidencia o expresiones regulares para conservar únicamente el patrón de texto que necesitas.
  </Card>

  <Card title="Estandarizar entre filas">
    Agrega prefijos, elimina texto repetido o normaliza valores incoherentes entre las filas.
  </Card>

  <Card title="Cambiar el formato de fechas y marcas de tiempo">
    Convierte formatos de fecha, fechas relativas, marcas de tiempo Unix o desfases de zona horaria en un resultado uniforme.
  </Card>
</Columns>

Ejemplos habituales:

* Eliminar etiquetas como `Price:` o `Rating:`
* Reemplazar caracteres no deseados o espacios adicionales
* Agregar un prefijo o sufijo a cada valor
* Cambiar el formato de las fechas o convertir zonas horarias
* Decodificar entidades HTML en texto sin formato

## Acceder a Limpiar datos

<Steps>
  <Step title="Seleccionar el campo">
    En la Vista previa de datos o en la lista de campos, selecciona el campo extraído que quieres limpiar.
  </Step>

  <Step title="Abrir el menú del campo">
    Haz clic en el menú `...` de ese campo.
  </Step>

  <Step title="Elegir Limpiar datos">
    Selecciona **Limpiar datos** para abrir el Flujo de trabajo de Limpieza de datos.
  </Step>

  <Step title="Agregar un paso de limpieza">
    Haz clic en **Agregar paso** y, a continuación, elige la operación que quieres aplicar.
  </Step>

  <Step title="Obtener una vista previa del resultado">
    Comprueba el valor de la vista previa antes de guardar la regla.
  </Step>
</Steps>

## Operaciones de refinamiento habituales

| Operación                                      | Para qué sirve                                                                                                                                                                                                                                           |
| ---------------------------------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| Reemplazar                                     | Reemplazar una cadena concreta por otro valor o eliminarla sustituyéndola por una cadena vacía <br /> <sub>Una cadena vacía significa que no hay caracteres; al sustituir por una cadena vacía se elimina de manera efectiva el texto coincidente.</sub> |
| Reemplazar con una expresión regular           | Usar un patrón regex para buscar y reemplazar cadenas coincidentes                                                                                                                                                                                       |
| Buscar coincidencias con una expresión regular | Conservar únicamente la parte de un valor que coincide con el patrón y descartar todo lo demás                                                                                                                                                           |
| Recortar espacios                              | Eliminar espacios no deseados al principio o al final de un valor                                                                                                                                                                                        |
| Agregar un prefijo                             | Agregar texto fijo antes de cada valor extraído                                                                                                                                                                                                          |
| Agregar un sufijo                              | Agregar texto fijo después de cada valor extraído                                                                                                                                                                                                        |
| Cambiar el formato de la fecha/hora extraída   | Convertir formatos de fecha o fechas relativas (`2 days ago` → fecha específica) <br /> <sub>Los formatos preestablecidos integrados incluyen `yyyy/MM/dd hh:mm:ss`, `yyyy-MM-dd`, `01/01/2026`, `Thu, 01 01 2026` y más.</sub>                          |
| Conversión de marcas de tiempo                 | Convertir marcas de tiempo Unix en formatos de fecha legibles                                                                                                                                                                                            |
| Conversión de zona horaria                     | Ajustar la fecha y la hora a una zona horaria de destino                                                                                                                                                                                                 |
| Transcodificación HTML                         | Convertir entidades HTML en texto sin formato (por ejemplo, `&amp;` → `&`)                                                                                                                                                                               |

<Tip>
  Una **cadena** es una secuencia de caracteres; puede ser una palabra, un número, un espacio, un símbolo o un signo de puntuación. Una **cadena vacía** significa que no hay ningún carácter. Por ejemplo, al reemplazar un valor por una cadena vacía, se elimina de manera efectiva del resultado.
</Tip>

## Usar RegEx para la limpieza basada en patrones

Las expresiones regulares resultan útiles cuando el valor sigue un patrón, pero no se puede limpiar de forma fiable con reglas sencillas de reemplazo o recorte:

* Extraer un número o precio incluido en una oración
* Buscar texto situado antes o después de un delimitador conocido (por ejemplo, `:`, `|`, `-`)
* Conservar únicamente parte del valor de un atributo HTML
* Eliminar patrones que se repiten de forma diferente entre las filas
* Aislar una subcadena de un valor que varía ligeramente de una página a otra

Puedes acceder a la herramienta RegEx desde el Flujo de trabajo de Limpiar datos o desde el área Herramientas de la barra lateral izquierda. Octoparse también incluye un **generador de RegEx con IA**: describe lo que quieres extraer en lenguaje natural y la herramienta generará el patrón, por lo que no tendrás que escribir la expresión manualmente.

| Objetivo                       | Patrón                 | Entrada                     | Resultado          |
| ------------------------------ | ---------------------- | --------------------------- | ------------------ |
| Extraer un precio              | `\$\d+(?:\.\d{1,2})?`  | `Only $19.99 today`         | `$19.99`           |
| Extraer un correo electrónico  | `[\w.-]+@[\w.-]+\.\w+` | `Contact: info@example.com` | `info@example.com` |
| Extraer una fecha (AAAA-MM-DD) | `\d{4}-\d{2}-\d{2}`    | `Published 2025-06-10`      | `2025-06-10`       |
| Extraer solo dígitos           | `\d+`                  | `Rating: 4.5 out of 5`      | `4`                |
| Eliminar etiquetas HTML        | `<[^>]+>`              | `<b>Bold text</b>`          | `Bold text`        |

Para consultar una lista completa de patrones y sintaxis, consulta la [Guía rápida de RegEx para la extracción de datos](https://helpcenter.octoparse.com/es/articles/11659531-regular-expression-regex-cheatsheet-for-data-extraction) en el Centro de ayuda.

<Tip>
  Usa RegEx únicamente cuando las reglas de limpieza más sencillas no sean suficientes. Para una limpieza simple, las operaciones como reemplazar, recortar, agregar prefijos y agregar sufijos son más fáciles de mantener.
</Tip>

## Ejemplo: extraer un valor de un atributo

Algunos sitios web almacenan datos útiles en atributos en lugar de mostrarlos como texto visible. Por ejemplo, una valoración puede estar almacenada en un atributo de imagen como `alt="5 stars"` o en un valor de origen como `src`.

<Steps>
  <Step title="Seleccionar el elemento">
    Selecciona el elemento que contiene el valor que necesitas, como un icono de valoración o un bloque de texto.
  </Step>

  <Step title="Elegir el valor de origen">
    Usa opciones como **URL de la imagen**, **OuterHTML** u **Otros atributos**, según dónde esté almacenado el valor.
  </Step>

  <Step title="Personalizar el campo">
    Abre el menú del campo y elige **Personalizar campo** o **Limpiar datos**.
  </Step>

  <Step title="Extraer el valor de destino">
    Selecciona el atributo correspondiente o usa RegEx para buscar la parte del HTML que quieres conservar.
  </Step>

  <Step title="Obtener una vista previa antes de guardar">
    Confirma que la vista previa muestre el valor esperado antes de ejecutar la tarea.
  </Step>
</Steps>

## Limitaciones del refinamiento de campos

Las reglas de refinamiento limpian el valor que Octoparse ya ha extraído. No cambian la estructura de la página web.

Por ejemplo, si un bloque de texto de varias líneas se muestra visualmente en varias líneas, pero en realidad es un único elemento en el código fuente de la página, Octoparse puede tratarlo como un solo campo. En ese caso, es posible que no puedas dividirlo en campos independientes basándote únicamente en los saltos de línea visuales. Comprueba la estructura del código fuente y usa la selección de campos, los ajustes de extracción o la limpieza mediante RegEx en función de cómo estén almacenados realmente los datos.

<Warning>
  Si un valor no se puede separar porque el sitio web lo almacena como un único elemento, puede que la Limpieza de datos no sea suficiente. Es posible que tengas que ajustar el elemento seleccionado, inspeccionar el HTML o extraer un valor de origen diferente.
</Warning>

## Prácticas recomendadas

* Refina los campos después de confirmar que está seleccionado el elemento correcto.
* Usa pasos de limpieza sencillos antes de probar RegEx.
* Obtén una vista previa de cada paso antes de guardarlo.
* Usa nombres de campo claros para que los datos exportados sean fáciles de entender.
* Evita una limpieza excesiva si el sistema posterior puede encargarse del formato más adelante.
* Documenta los patrones RegEx complejos para que los compañeros de equipo puedan mantener la tarea.
