octoparse detect abre el navegador con la extensión de Octoparse, examina la página y genera un archivo de tarea local. Úsalo para crear una tarea desde una URL sin la aplicación de escritorio de Octoparse.
Desde la versión 0.1.32, la detección rechaza las páginas con CAPTCHA, acceso restringido, desafíos de seguridad o errores del servicio antes de generar la tarea. La clasificación de candidatos también descarta con mayor rigor las regiones deficientes y los contenedores de navegación que abarcan toda la página. Las páginas complejas y los flujos de inicio de sesión aún pueden requerir una revisión manual.
Para los agentes de IA, usa
--agent o el flujo de preparación, vista previa y aplicación en lugar de --auto. El modo automático está pensado para la selección directa desde la CLI.
detect requiere una cuenta de Octoparse y credenciales válidas. También requiere Chrome local y no es compatible con Linux arm64. Consulta Instalación para conocer los requisitos de la plataforma.Modo automático
La CLI elige la mejor región de datos candidata y genera un archivo de tarea:--json para obtener una respuesta estructurada:
--output, se crea automáticamente un archivo detected_<host>.json.
Elegir un modo de navegador
Usa una instancia independiente de Chrome for Testing o reutiliza un perfil con sesión iniciada del navegador del sistema:octoparse browser --help: opción del comando, OCTOPARSE_BROWSER, ajuste guardado mediante octoparse browser use y, por último, independent. El modo de usuario está disponible en Windows y macOS.
Modo manual
El modo manual abre una capa en el navegador donde puedes iniciar sesión, cerrar ventanas emergentes y seleccionar personalmente la región de datos:--save-session para almacenar las cookies de sitios que requieren iniciar sesión; de esta forma, las futuras ejecuciones locales podrán reproducir la sesión:
Las sesiones de Cookie no cubren todos los sitios, especialmente las páginas que requieren localStorage, vinculación del dispositivo o una verificación nueva.
Validar la tarea generada
Después de generar el archivo de tarea, valídalo antes de ejecutarlo:Flujo de trabajo con un agente de IA
En los flujos controlados por un LLM o automatizados, usa el contrato del agente en lugar de--auto. Empieza por consultar las capacidades:
machineContract.recipes.createTaskFromUrlWithAgent, el flujo recomendado para agentes.
En un solo paso (la opción más rápida)
Usa--agent con un ejecutor local de confianza que pueda leer un archivo de contexto y escribir un plan:
Paso a paso y auditable
Para auditorías o reparaciones, usa la secuencia de preparación, vista previa y aplicación en lugar de generar la tarea en un solo paso.1
Preparar el contexto del agente
Exporta el contexto de la página web para que el agente pueda planificar.Se genera
context.json con las regiones de datos candidatas, muestras de campos, capturas visuales y un decisionSummary.2
Escribir un plan
Crea un archivo
plan.json a partir de context.json.Usa el esquema octopus.detect.agent-plan.v1. Abre la ruta de la captura anotada indicada en context.visualArtifacts.annotatedScreenshotPath antes de elegir los campos e incluye pruebas de visualReview en el plan.3
Obtener una vista previa del plan
Valida el plan antes de generar el archivo de tarea definitivo.Si
data.pass es false, revisa el plan antes de aplicarlo.4
Aplicar el plan
Genera el archivo de tarea local definitivo.Después puedes examinar y validar el archivo
task.json generado o usarlo en una ejecución local de la CLI.Solución de problemas de detect
Siguientes pasos
Ejecutar tu primera tarea
Ejecuta localmente una tarea generada, comprueba su estado y exporta los resultados.
Referencia de comandos
Referencia completa de los comandos de detección, ejecución, nube, datos y autenticación.