> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# AI 웹 스크래핑이란?

> AI 웹 스크래핑은 AI로 페이지 구조를 감지하고 일치 규칙을 생성하며 원시 HTML에서 데이터를 추출해 규칙 기반 스크래퍼보다 변화에 유연합니다.

기존 스크래핑은 수동으로 정의한 규칙에 의존합니다. 페이지에서 데이터를 찾으려면 정확한 [CSS 선택자나 XPath 표현식](/docs/ko/academy/xpath-css-selectors), 또는 [정규식](/docs/ko/academy/refining-data-with-regex)을 지정해야 합니다. 반면 AI 기반 스크래핑은 페이지 구조와 콘텐츠를 더 유연하게 이해하므로 수동 설정 부담을 줄이고 페이지 간 차이를 더 안정적으로 처리합니다.

## 스크래핑에서 AI를 활용하는 세 가지 방법

현재 웹 스크래핑에서 AI를 활용하는 대표적인 방법은 세 가지입니다. 첫째, 사용자가 각 필드를 직접 클릭하는 대신 도구가 페이지 레이아웃을 분석해 제품 목록, 글 피드, 연락처 디렉터리처럼 반복되는 데이터 패턴을 식별하고 추출 로직을 자동 생성합니다. 둘째, 사람이 정확히 작성하기 어려운 정규식 같은 복잡한 일치 규칙을 AI가 만듭니다. 필요한 내용을 자연어로 설명하면 AI가 패턴을 생성합니다. 셋째, 원시 HTML을 AI 모델에 직접 입력해 프롬프트나 템플릿에 따라 구조화된 데이터를 추출합니다. 즉 HTML을 비정형 텍스트로 보고 언어 이해를 통해 관련 필드를 찾아냅니다.

## Octoparse의 AI 활용 방식

Octoparse는 이 세 가지 방식을 모두 지원합니다. [자동 감지](/docs/ko/platform/auto-detect)는 대상 웹페이지를 스캔해 수동 설정 없이 데이터 필드와 [페이지 넘기기](/docs/ko/academy/handle-pagination)를 식별하고 스크래핑 워크플로를 자동 생성합니다. 패턴 일치 작업을 위한 AI 지원 정규식 생성과 언어 모델로 페이지 콘텐츠를 직접 분석하는 AI 기반 HTML 추출 템플릿도 제공합니다. 기존 [시각적 구성 도구](/docs/ko/platform/no-code-builder)와 함께 제공되므로 작업에 맞는 자동화 수준을 선택할 수 있습니다.

## 장점과 한계

스크래핑에 AI를 적용하는 가장 큰 장점은 변화 대응력입니다. [기존 규칙 기반 스크래퍼](/docs/ko/academy/ai-vs-traditional-scraping)는 웹사이트 레이아웃이 바뀌면 하드코딩한 선택자가 더 이상 일치하지 않아 쉽게 중단됩니다. AI 방식은 작은 구조 변경에 수동 개입 없이 적응하는 경우가 많아 장기 작업을 유지하기 쉽습니다. 하지만 AI도 만능은 아닙니다. 예외 상황에서 예측하기 어려운 결과가 나올 수 있고 매우 정밀한 추출에는 명시적 규칙이 더 안정적일 수 있습니다. 실제로는 AI 자동화와 필요한 부분의 수동 미세 조정을 결합할 때 가장 좋은 결과를 얻습니다.
