> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Huella digital del navegador

> Los sistemas anti-bot identifican scrapers mediante canvas, WebGL, fuentes, UA y otras señales. Qué se rastrea y cómo gestionar la huella digital.

Cada sesión del navegador revela una firma identificativa: una combinación del User-Agent, el resultado del dibujo en canvas, la cadena del renderizador WebGL, la lista de fuentes, la resolución de pantalla, los plugins instalados, la zona horaria, las cabeceras de idioma, los resultados del contexto de audio y mucho más. Los sistemas anti-bot modernos combinan estas señales para crear una **huella digital del navegador** que identifica una sesión con mucha más fiabilidad que una dirección IP. Un scraper que no gestiona su huella digital entrega a la capa de detección una credencial perfectamente visible en cada solicitud.

La capa de huella digital se sitúa por debajo del [comportamiento](/docs/es/academy/human-like-scraping): define lo que la sesión *es*, no lo que hace. Para pasar inadvertido ante un sistema anti-bot serio, un scraper debe superar ambas capas: una huella limpia *y* un comportamiento similar al humano.

## Qué señales se rastrean

Una huella moderna suele combinar:

* **User-Agent y cabeceras Accept.** El punto de partida más evidente. `HeadlessChrome` en el UA delata la automatización.
* **Huella de canvas.** Un sitio pide al navegador que renderice un elemento canvas oculto y genera un hash del resultado; las pequeñas diferencias de renderizado entre combinaciones de GPU, controladores y sistemas operativos producen una firma estable para cada máquina.
* **Huella de WebGL.** La cadena del renderizador, la del proveedor y las extensiones compatibles forman, en conjunto, una huella sólida de la GPU y sus controladores.
* **Lista de fuentes.** Qué fuentes puede renderizar el navegador y en qué orden; a menudo basta para distinguir una sesión por sí sola.
* **Pantalla y viewport.** Resolución, profundidad de color y relación de píxeles del dispositivo. Un equipo de `1366×768` con una escala del 200 % tiene una huella distinta de una pantalla retina de `2560×1440`.
* **Zona horaria e idioma.** Obtenidos de `Intl.DateTimeFormat` y `navigator.languages`.
* **Contexto de audio.** El renderizado de audio produce resultados identificables y específicos del dispositivo, igual que canvas.
* **Plugins, propiedades de navigator y concurrencia del hardware.** Señales menores, pero combinables.
* **`navigator.webdriver`.** La prueba definitiva de una automatización sin gestionar.

Las decenas de pequeñas señales se combinan de forma multiplicativa. No es necesario que cada una sea única: basta con que la *combinación* lo sea lo suficiente para permitir el seguimiento.

## Por qué los scrapers revelan sus huellas

Predominan tres tipos de fallo:

* **Repetir la misma identidad predeterminada.** Una instancia básica de Puppeteer que ejecuta 10 000 sesiones presenta el mismo hash de canvas, la misma cadena WebGL y la misma lista de fuentes: 10 000 «usuarios distintos» con la huella de una sola máquina. Es trivial detectarlo.
* **Valores genéricos que ningún usuario real genera.** Un `navigator.plugins` vacío, un resultado de canvas idéntico bit a bit al renderizado estándar de Linux/Chrome o una lista sin fuentes habituales del sistema son anomalías que no producen los usuarios reales de Chrome.
* **Incoherencia entre señales.** Una huella que declara `en-US` y `America/New_York` asociada a una IP rusa; un User-Agent de iPhone con un viewport de escritorio; o una huella de Windows con fuentes exclusivas de macOS. Las capas de detección buscan contradicciones internas.

## Gestión de la huella digital

Las soluciones corresponden directamente a estos fallos:

* **Identidad única por sesión.** Cada instancia de tarea debe presentar una huella distinta —otro hash de canvas, renderizador WebGL y lista de fuentes— para que una misma huella no se repita entre «usuarios distintos».
* **Coherencia dentro de la sesión.** La huella debe mantenerse estable durante una sesión; cambiarla a mitad del proceso también resulta sospechoso.
* **Coherencia geográfica con la IP.** La zona horaria, el idioma y las cabeceras Accept-Language deben coincidir con la ubicación geográfica de la [IP del Proxy](/docs/es/academy/rotating-proxies). Una IP de Europa del Este debe acompañarse de una huella de esa región, no del valor predeterminado `en-US`.
* **Realista, no aleatoria.** Las huellas compuestas de valores puramente aleatorios también son anómalas. Lo adecuado es extraerlas de distribuciones de huellas reales —cadenas de GPU habituales, listas de fuentes plausibles y tamaños de pantalla normales—, no usar valores exóticos que ningún usuario produciría.

Estos principios describen en conjunto la **gestión activa de huellas digitales**, frente a depender de los valores predeterminados del entorno de ejecución.

## Cómo aborda Octoparse las huellas digitales

Además de la ventaja natural de su [entorno de ejecución con interfaz por diseño](/docs/es/academy/headed-vs-headless-browsers), que revela menos señales que las herramientas headless, Octoparse gestiona activamente la huella del navegador. Las sesiones presentan perfiles distintos y realistas, en vez de repetir la misma identidad predeterminada en todas las tareas. Así se cumple el requisito de identidad única por sesión que una configuración de huella fija no puede satisfacer. El entorno combina el sigilo «pasivo» de un navegador con interfaz y el sigilo «activo» de la diversidad de huellas, sin que el usuario tenga que conectar un servicio externo.

Esta gestión se combina con la [simulación de comportamiento](/docs/es/academy/human-like-scraping) de Octoparse: en cada sesión, el entorno parece un usuario real distinto y, una vez en la página, actúa como tal.

## Cuándo es importante

La gestión activa resulta excesiva para sitios estáticos y sistemas básicos de detección de bots. Su valor aparece ante defensas más avanzadas:

* **Defensas ligeras.** El navegador con interfaz predeterminado suele bastar.
* **Defensas intermedias (limitación de frecuencia y detección básica).** Los valores predeterminados suelen funcionar si las demás capas son limpias.
* **Defensas avanzadas (Cloudflare, DataDome, HUMAN, Akamai Bot Manager).** Es imprescindible. Sin huellas distintas y realistas para cada sesión, la misma identidad repetida entre miles de «usuarios» hará que bloqueen el scraper aunque todo lo demás parezca correcto.

Para conocer el complemento conductual del sigilo mediante huellas, consulta [Web scraping con comportamiento humano](/docs/es/academy/human-like-scraping). Para ver los sistemas de defensa concretos que esta gestión pretende superar, consulta [Eludir CAPTCHA y Cloudflare](/docs/es/academy/captcha-and-cloudflare).
