> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# ¿Qué es el web scraping?

> El web scraping es la extracción automatizada de datos estructurados de sitios web. Descubre cómo funciona, para qué se usa y cómo se diferencia de las API.

El programa que realiza esta tarea suele denominarse «scraper» o «crawler»: visita páginas, lee su contenido HTML y obtiene los datos concretos que necesitas, una labor que de otro modo exigiría copiar manualmente la información.

## Casos de uso habituales

Algunos casos de uso habituales son recopilar precios de productos de sitios de comercio electrónico, reunir artículos de noticias, obtener ofertas de empleo, monitorear a la competencia o crear conjuntos de datos para investigación.

## Cómo funciona

Un Flujo de trabajo de scraping típico consiste en enviar una solicitud HTTP a una URL, recibir la respuesta HTML, analizarla para encontrar los elementos pertinentes mediante selectores CSS o XPath y guardar los datos extraídos en un formato estructurado como CSV, JSON o una base de datos.

## Diferencias con las API y la recopilación manual

En comparación con la recopilación manual, el scraping automatiza el mismo trabajo de copiar y pegar. Por eso es más rápido, repetible y escalable a miles de páginas, aunque requiere cierta configuración inicial y mantenimiento cuando cambia el diseño del sitio.

A diferencia de una API, el scraping lee el mismo HTML que muestra un navegador en vez de utilizar un canal de datos específico. Cuando un sitio ofrece una API oficial, esta suele ser la opción más fiable y autorizada: los datos ya están estructurados, son estables y están documentados. El scraping resulta útil cuando no existe una API, cuando esta no proporciona los datos necesarios o cuando sus límites son demasiado restrictivos. La contrapartida es que depende del marcado de la página y puede dejar de funcionar si este cambia.

## Herramientas y bibliotecas

Entre las herramientas y bibliotecas populares se encuentran Beautiful Soup y Scrapy para Python, Puppeteer y Cheerio para JavaScript, y [plataformas sin código](/docs/es/academy/what-is-no-code-web-scraping) como Octoparse. Estas plataformas adoptan un enfoque diferente al de las bibliotecas basadas en scripts: Octoparse, por ejemplo, ejecuta páginas en un navegador real y permite crear un scraper señalando y haciendo clic, simulando cómo una persona navega y selecciona datos en lugar de escribir código de extracción. En las páginas que dependen en gran medida de JavaScript, los navegadores sin interfaz, como Puppeteer o Playwright, pueden simular un navegador real para acceder a datos cargados dinámicamente.

## Aspectos que debes tener en cuenta

Al realizar scraping, consulta siempre el archivo robots.txt y los términos de servicio del sitio para saber qué está permitido, utiliza una frecuencia de solicitudes responsable para no sobrecargar los servidores y ten en cuenta que algunas jurisdicciones imponen restricciones legales al scraping de determinados tipos de datos.
