> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Depurar datos con expresiones regulares

> Los datos extraídos suelen contener símbolos, teléfonos y fechas dispares. Aprende los patrones regex para limpiarlos y cómo Octoparse los genera con IA.

Los datos extraídos casi nunca están lo bastante limpios para usarlos directamente. Una vez que [los selectores](/docs/es/academy/xpath-css-selectors) localizan los valores, las cadenas suelen incluir elementos no deseados. Un precio puede contener símbolos de moneda, espacios y texto; un teléfono puede aparecer en varios formatos; y una fecha puede escribirse como «May 15, 2026» o «2026-05-15». Las **expresiones regulares**, o *regex*, son la herramienta habitual para limpiar, extraer y convertir ese texto en Campos de datos estructurados y coherentes.

Una expresión regular define un patrón con la forma del texto deseado. El motor recorre la cadena, encuentra coincidencias y permite extraerlas o sustituirlas. No necesitas dominar todos los casos extremos: unos cuantos patrones habituales resuelven la mayoría de las tareas de Limpieza de datos.

## Patrones de limpieza habituales

* **Precios.** `[\d,.]+` captura valores numéricos con comas y decimales y elimina símbolos y texto. `(\d{1,3}(?:,\d{3})*(?:\.\d{2})?)` reconoce con más precisión formatos como `1,299.99`.
* **Teléfonos.** `\(?\d{3}\)?[-.\s]?\d{3}[-.\s]?\d{4}` admite formatos estadounidenses habituales con o sin paréntesis, guiones, puntos o espacios.
* **Correos electrónicos.** `[\w.+-]+@[\w-]+\.[\w.]+` reconoce la mayoría de las direcciones estándar.
* **Fechas.** `\d{4}-\d{2}-\d{2}` reconoce ISO; `\w+ \d{1,2}, \d{4}` reconoce cadenas como `May 15, 2026`.
* **Eliminar etiquetas HTML.** `<[^>]+>` elimina las etiquetas de una cadena.
* **Normalizar espacios.** `\s+` sustituye secuencias de espacios por uno solo.

## Consejos prácticos

* **Prueba con muestras reales.** Las páginas reales tienen particularidades que no aparecen en los ejemplos ideales. Prueba el patrón con datos del sitio objetivo.
* **Usa cuantificadores no codiciosos (`*?`, `+?`).** Los operadores `*` y `+` normales eligen la coincidencia más larga, que a menudo no es la deseada.
* **Usa grupos de captura.** Los paréntesis `()` permiten extraer solo la parte relevante de una coincidencia mayor.
* **Ten en cuenta la configuración regional.** Una expresión diseñada para `1,299.99` puede fallar con `1.299,99`; ocurre lo mismo con fechas, teléfonos y decimales.

## Cómo lo aborda Octoparse

Las expresiones regulares tienen fama de ser difíciles de escribir y leer. Un pequeño error puede producir datos incorrectos de forma silenciosa y descubrirse mucho después.

Octoparse integra las expresiones regulares en el Flujo de trabajo de extracción: puedes aplicarlas a cualquier campo como paso de **posprocesamiento**, limpiando y reformando los datos antes de exportarlos sin scripts independientes. El patrón, el campo y la salida limpia permanecen en la misma definición de Tarea.

Octoparse también ofrece **generación de expresiones regulares asistida por IA**. Selecciona elementos similares y la IA analizará los ejemplos para generar un patrón. Después puedes probarlo con los datos reales, ver las coincidencias y ajustarlo. La IA se ocupa de la sintaxis y el usuario valida el resultado.

Esto reduce los dos costes principales: escribir patrones desde cero y verificar que hacen lo previsto con datos reales. Ambas tareas se integran en el editor visual.

## En resumen

La mayoría de los proyectos no necesita expresiones muy complejas. Una pequeña biblioteca de patrones para precios, correos, fechas, teléfonos y espacios cubre gran parte de la Limpieza de datos. Mantén cada patrón tan sencillo como sea posible, documéntalo si vas a mantener el scraper y recurre a la generación con IA cuando la sintaxis sea difícil. El objetivo es una salida limpia y coherente; las expresiones regulares son solo el medio.
