실제 데이터 수집 작업은 대부분 두 과정을 모두 포함합니다. 먼저 사이트를 크롤링해 관련 페이지 URL을 모두 찾고, 각 페이지를 스크래핑해 실제 데이터를 추출합니다. 한 번에 두 작업을 수행할 수도 있지만 복잡한 사이트에서는 두 단계로 나누는 편이 효율적입니다. 크롤링 단계가 정리된 URL 목록을 만들고 스크래핑 단계가 그 목록에서 콘텐츠를 추출합니다. 각 단계를 독립 실행하고 전체 작업을 다시 하지 않고 실패만 재시도하며 여러 페이지의 스크래핑을 병렬화할 수 있어 대규모 수집 속도가 크게 향상됩니다.
Octoparse는 전용 AI 기반 모드로 두 작업을 모두 처리합니다. AI Crawl은 사이트의 링크 구조를 분석하고 페이지 넘기기, 카테고리 또는 중첩 페이지에서 대상 URL을 수집하는 워크플로를 자동 생성합니다. AI Scrape 템플릿은 이 URL을 받아 각 페이지에서 구조화된 데이터를 추출합니다. 두 단계를 연결되지만 독립적인 작업으로 처리하므로 URL 목록이 준비되면 수백 또는 수천 페이지를 순차 처리하지 않고 클라우드에서 동시에 스크래핑할 수 있습니다. 하루 걸릴 작업을 몇 분 만에 끝낼 수도 있습니다.
크롤링과 스크래핑을 하나의 파이프라인을 구성하는 두 단계로 생각하세요. 먼저 크롤링해 대상 목록을 만들고 다음으로 스크래핑해 데이터를 얻습니다. 두 단계를 분리하면 제어력과 오류 처리 능력이 향상되고 추출 단계를 수평 확장할 수 있습니다. 이는 수천 또는 수백만 페이지가 있는 사이트를 처리할 때 특히 중요합니다.