> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# AI 및 LLM을 위한 데이터 수집

> 웹 스크래핑으로 AI와 LLM 학습, 파인튜닝, RAG용 데이터를 수집하는 방법과 소스 선택, 필드, 수집 흐름, 품질, 라이선스 및 규정 준수 설계를 알아보세요.

학습, 파인튜닝, RAG(검색 증강 생성)에는 모두 작업에 적합한 대량의 데이터가 필요합니다. 웹 스크래핑은 공개 텍스트, 구조화된 데이터, 리뷰, 도메인 정보를 웹에서 지속적으로 모델이 사용할 수 있는 형태로 수집하는 방법입니다.

목표는 가능한 한 많은 페이지를 가져오는 것이 아닙니다. 대상 모델에 적합한 소스, 보존할 필드, 정규화 및 중복 제거 방법을 설계하고, 수집이 라이선스, 서비스 약관, 개인정보 측면에서 타당한지 확인하는 것입니다.

## 일반적인 데이터 소스

| 소스                    | 적합한 용도         | 핵심 필드                        |
| --------------------- | -------------- | ---------------------------- |
| 일반 웹 텍스트(기사, 블로그, 문서) | 범용 사전 학습, RAG  | 본문, 제목, 소제목, 게시일, 소스 URL     |
| 도메인별 콘텐츠(기술, 법률, 의료)  | 도메인 모델, 전문 RAG | 본문, 카테고리, 소스, 업데이트 날짜, 권위 신호 |
| 리뷰 및 평점               | 감성 모델, 의견 요약   | 리뷰 텍스트, 점수, 날짜, 대상, 언어       |
| Q\&A 및 포럼             | 대화 및 지시 튜닝     | 질문, 답변, 투표, 태그, 스레드 구조       |
| 구조화된 데이터(표, 카탈로그, 목록) | 추출 및 분류 작업     | 필드-값 쌍, 단위, 카테고리             |

RAG의 경우 대상 도메인의 기사와 문서를 수집한 다음 본문을 청크로 나누어 메타데이터와 함께 저장합니다. 감성 모델의 경우 리뷰 텍스트와 점수를 레이블이 지정된 데이터로 수집합니다.

## 필드 및 데이터 설계

학습 데이터에는 본문뿐 아니라 출처와 맥락도 보존해야 합니다.

학습 및 RAG를 위해 보존할 필드:

* 본문(정제됨)
* 제목, 소제목, 섹션 구조
* 게시 및 업데이트 날짜
* 카테고리, 태그, 언어
* 소스 URL
* 수집 타임스탬프

품질과 추적성을 위해 보존할 필드:

* 라이선스 및 서비스 약관 정보(재사용 권한)
* 콘텐츠 권위 신호(도메인, 작성자)
* 중복 제거용 해시 또는 정규화된 텍스트
* 수집 조건(쿼리, 범위, 샘플링)

<Tip>
  모든 행에 소스 URL과 수집 타임스탬프를 보존하세요. 이를 통해 학습 데이터의 출처를 추적하고 나중에 라이선스 확인, 중복 제거, 제외 요청 처리, 데이터세트 갱신을 수행할 수 있습니다.
</Tip>

## 수집 흐름

1. 대상 모델과 작업에 적합한 데이터 소스를 선택합니다.
2. 대상 페이지를 탐색합니다(검색, 카테고리, 사이트맵, 목록 페이지).
3. 본문과 메타데이터를 추출합니다(탐색 메뉴, 광고, 반복 요소 제외).
4. 텍스트를 정규화하고 정제합니다(HTML 제거, 공백 수정, 인코딩 통일).
5. 중복을 제거합니다(URL, 정규화된 텍스트 또는 해시 기준).
6. 품질을 필터링합니다(너무 짧거나 언어가 잘못되었거나 상용구인 콘텐츠 제외).
7. 학습용 형식으로 변환합니다(JSONL, 메타데이터가 포함된 청크 등).

탐색과 추출을 분리하면 많은 페이지를 병렬로 처리하기가 쉬워집니다.

## 품질 및 규정 준수

AI와 LLM을 위한 데이터 수집은 품질과 라이선스를 모두 고려해 설계해야 합니다.

* **저작권 및 서비스 약관**: 본문을 수집할 수 있는지와 재사용할 수 있는지는 별개의 문제입니다. 라이선스와 각 사이트의 약관을 확인하세요.
* **robots.txt**: 대상 URL별 크롤링 허용 여부를 확인하세요.
* **개인정보**: 이름, 연락처 등 개인정보 수집을 최소화하고, 필요하지 않다면 수집하거나 저장하지 마세요.
* **출처 기록**: 나중에 라이선스를 확인하고 제외 요청을 처리할 수 있도록 소스 URL과 수집 타임스탬프를 보존하세요.
* **품질**: 상용구, 중복 콘텐츠, 기계 번역 노이즈, 유해 콘텐츠를 학습 데이터에서 제외하세요.

<Warning>
  공개되어 있고 수집할 수 있는 데이터라고 해서 학습 데이터로 재사용할 수 있는 것은 아닙니다. 저작권으로 보호되는 본문과 개인정보가 포함된 데이터는 라이선스와 관련 법률을 확인한 후에만 취급하세요. 이 페이지는 일반적인 개요이며 법률 자문이 아닙니다.
</Warning>

## Octoparse와 MCP로 수집하기

Octoparse는 헤디드 실제 브라우저에서 페이지를 렌더링하므로 JavaScript로 동적으로 생성된 텍스트도 수집할 수 있습니다. 탐색(목록, 검색)과 추출(본문, 메타데이터)을 분리한 워크플로를 구축하고 클라우드에서 예약 실행하여 학습 데이터를 최신 상태로 유지하세요.

AI 에이전트에서 직접 데이터를 수집하려면 [Octoparse MCP Server](/docs/ko/mcp)를 사용하세요. MCP를 지원하는 AI 클라이언트가 자연어로 템플릿을 검색하고 작업을 실행하며 데이터를 가져올 수 있습니다. 일반 콘텐츠 추출에는 모든 웹페이지에서 작동하는 [범용 콘텐츠 스크래퍼 템플릿](https://www.octoparse.kr/template/universal-content)을 사용할 수 있습니다.

## 관련 자료

* [AI 에이전트에서 데이터 수집 실행하기(MCP Server)](/docs/ko/mcp) — MCP 지원 클라이언트가 Octoparse 데이터를 직접 수집
* [JavaScript 렌더링 페이지 스크래핑](/docs/ko/academy/scrape-javascript-pages) — 동적 콘텐츠 처리 방식
* [페이지 넘기기 처리 방법](/docs/ko/academy/handle-pagination) — 많은 페이지를 빠짐없이 처리
* [추출 데이터 정제 및 클리닝](/docs/ko/platform/refine-data) — 학습용 텍스트 정규화
* [웹 스크래핑은 합법인가요?](/docs/ko/academy/is-web-scraping-legal) — 수집의 합법성과 범위
