Skip to main content
Los datos extraídos casi nunca están lo bastante limpios para usarlos directamente. Una vez que los selectores localizan los valores, las cadenas suelen incluir elementos no deseados. Un precio puede contener símbolos de moneda, espacios y texto; un teléfono puede aparecer en varios formatos; y una fecha puede escribirse como «May 15, 2026» o «2026-05-15». Las expresiones regulares, o regex, son la herramienta habitual para limpiar, extraer y convertir ese texto en Campos de datos estructurados y coherentes. Una expresión regular define un patrón con la forma del texto deseado. El motor recorre la cadena, encuentra coincidencias y permite extraerlas o sustituirlas. No necesitas dominar todos los casos extremos: unos cuantos patrones habituales resuelven la mayoría de las tareas de Limpieza de datos.

Patrones de limpieza habituales

  • Precios. [\d,.]+ captura valores numéricos con comas y decimales y elimina símbolos y texto. (\d{1,3}(?:,\d{3})*(?:\.\d{2})?) reconoce con más precisión formatos como 1,299.99.
  • Teléfonos. \(?\d{3}\)?[-.\s]?\d{3}[-.\s]?\d{4} admite formatos estadounidenses habituales con o sin paréntesis, guiones, puntos o espacios.
  • Correos electrónicos. [\w.+-]+@[\w-]+\.[\w.]+ reconoce la mayoría de las direcciones estándar.
  • Fechas. \d{4}-\d{2}-\d{2} reconoce ISO; \w+ \d{1,2}, \d{4} reconoce cadenas como May 15, 2026.
  • Eliminar etiquetas HTML. <[^>]+> elimina las etiquetas de una cadena.
  • Normalizar espacios. \s+ sustituye secuencias de espacios por uno solo.

Consejos prácticos

  • Prueba con muestras reales. Las páginas reales tienen particularidades que no aparecen en los ejemplos ideales. Prueba el patrón con datos del sitio objetivo.
  • Usa cuantificadores no codiciosos (*?, +?). Los operadores * y + normales eligen la coincidencia más larga, que a menudo no es la deseada.
  • Usa grupos de captura. Los paréntesis () permiten extraer solo la parte relevante de una coincidencia mayor.
  • Ten en cuenta la configuración regional. Una expresión diseñada para 1,299.99 puede fallar con 1.299,99; ocurre lo mismo con fechas, teléfonos y decimales.

Cómo lo aborda Octoparse

Las expresiones regulares tienen fama de ser difíciles de escribir y leer. Un pequeño error puede producir datos incorrectos de forma silenciosa y descubrirse mucho después. Octoparse integra las expresiones regulares en el Flujo de trabajo de extracción: puedes aplicarlas a cualquier campo como paso de posprocesamiento, limpiando y reformando los datos antes de exportarlos sin scripts independientes. El patrón, el campo y la salida limpia permanecen en la misma definición de Tarea. Octoparse también ofrece generación de expresiones regulares asistida por IA. Selecciona elementos similares y la IA analizará los ejemplos para generar un patrón. Después puedes probarlo con los datos reales, ver las coincidencias y ajustarlo. La IA se ocupa de la sintaxis y el usuario valida el resultado. Esto reduce los dos costes principales: escribir patrones desde cero y verificar que hacen lo previsto con datos reales. Ambas tareas se integran en el editor visual.

En resumen

La mayoría de los proyectos no necesita expresiones muy complejas. Una pequeña biblioteca de patrones para precios, correos, fechas, teléfonos y espacios cubre gran parte de la Limpieza de datos. Mantén cada patrón tan sencillo como sea posible, documéntalo si vas a mantener el scraper y recurre a la generación con IA cuando la sintaxis sea difícil. El objetivo es una salida limpia y coherente; las expresiones regulares son solo el medio.