Qué señales se rastrean
Una huella moderna suele combinar:- User-Agent y cabeceras Accept. El punto de partida más evidente.
HeadlessChromeen el UA delata la automatización. - Huella de canvas. Un sitio pide al navegador que renderice un elemento canvas oculto y genera un hash del resultado; las pequeñas diferencias de renderizado entre combinaciones de GPU, controladores y sistemas operativos producen una firma estable para cada máquina.
- Huella de WebGL. La cadena del renderizador, la del proveedor y las extensiones compatibles forman, en conjunto, una huella sólida de la GPU y sus controladores.
- Lista de fuentes. Qué fuentes puede renderizar el navegador y en qué orden; a menudo basta para distinguir una sesión por sí sola.
- Pantalla y viewport. Resolución, profundidad de color y relación de píxeles del dispositivo. Un equipo de
1366×768con una escala del 200 % tiene una huella distinta de una pantalla retina de2560×1440. - Zona horaria e idioma. Obtenidos de
Intl.DateTimeFormatynavigator.languages. - Contexto de audio. El renderizado de audio produce resultados identificables y específicos del dispositivo, igual que canvas.
- Plugins, propiedades de navigator y concurrencia del hardware. Señales menores, pero combinables.
navigator.webdriver. La prueba definitiva de una automatización sin gestionar.
Por qué los scrapers revelan sus huellas
Predominan tres tipos de fallo:- Repetir la misma identidad predeterminada. Una instancia básica de Puppeteer que ejecuta 10 000 sesiones presenta el mismo hash de canvas, la misma cadena WebGL y la misma lista de fuentes: 10 000 «usuarios distintos» con la huella de una sola máquina. Es trivial detectarlo.
- Valores genéricos que ningún usuario real genera. Un
navigator.pluginsvacío, un resultado de canvas idéntico bit a bit al renderizado estándar de Linux/Chrome o una lista sin fuentes habituales del sistema son anomalías que no producen los usuarios reales de Chrome. - Incoherencia entre señales. Una huella que declara
en-USyAmerica/New_Yorkasociada a una IP rusa; un User-Agent de iPhone con un viewport de escritorio; o una huella de Windows con fuentes exclusivas de macOS. Las capas de detección buscan contradicciones internas.
Gestión de la huella digital
Las soluciones corresponden directamente a estos fallos:- Identidad única por sesión. Cada instancia de tarea debe presentar una huella distinta —otro hash de canvas, renderizador WebGL y lista de fuentes— para que una misma huella no se repita entre «usuarios distintos».
- Coherencia dentro de la sesión. La huella debe mantenerse estable durante una sesión; cambiarla a mitad del proceso también resulta sospechoso.
- Coherencia geográfica con la IP. La zona horaria, el idioma y las cabeceras Accept-Language deben coincidir con la ubicación geográfica de la IP del Proxy. Una IP de Europa del Este debe acompañarse de una huella de esa región, no del valor predeterminado
en-US. - Realista, no aleatoria. Las huellas compuestas de valores puramente aleatorios también son anómalas. Lo adecuado es extraerlas de distribuciones de huellas reales —cadenas de GPU habituales, listas de fuentes plausibles y tamaños de pantalla normales—, no usar valores exóticos que ningún usuario produciría.
Cómo aborda Octoparse las huellas digitales
Además de la ventaja natural de su entorno de ejecución con interfaz por diseño, que revela menos señales que las herramientas headless, Octoparse gestiona activamente la huella del navegador. Las sesiones presentan perfiles distintos y realistas, en vez de repetir la misma identidad predeterminada en todas las tareas. Así se cumple el requisito de identidad única por sesión que una configuración de huella fija no puede satisfacer. El entorno combina el sigilo «pasivo» de un navegador con interfaz y el sigilo «activo» de la diversidad de huellas, sin que el usuario tenga que conectar un servicio externo. Esta gestión se combina con la simulación de comportamiento de Octoparse: en cada sesión, el entorno parece un usuario real distinto y, una vez en la página, actúa como tal.Cuándo es importante
La gestión activa resulta excesiva para sitios estáticos y sistemas básicos de detección de bots. Su valor aparece ante defensas más avanzadas:- Defensas ligeras. El navegador con interfaz predeterminado suele bastar.
- Defensas intermedias (limitación de frecuencia y detección básica). Los valores predeterminados suelen funcionar si las demás capas son limpias.
- Defensas avanzadas (Cloudflare, DataDome, HUMAN, Akamai Bot Manager). Es imprescindible. Sin huellas distintas y realistas para cada sesión, la misma identidad repetida entre miles de «usuarios» hará que bloqueen el scraper aunque todo lo demás parezca correcto.