> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 리뷰 및 감성 분석을 위한 데이터 수집

> 웹 스크래핑으로 감성 분석용 리뷰 데이터를 수집하는 방법: 수집할 데이터, 소스 선택, 수집 설계, 분석으로의 확장, 저작권 및 개인정보 유의사항까지 정리한 실전 가이드.

리뷰와 평점은 고객 만족도, 불만 지점, 수요의 질을 나타내는 데이터입니다. 웹 스크래핑은 여러 사이트에 흩어진 리뷰를 지속적으로 수집하여 감성 분석과 평판 분석에 사용할 수 있는 형태로 정리하는 수단입니다.

이 페이지는 리뷰를 수집하는 단계부터 분석으로 이어지는 데이터 설계를 다루는 기술 플레이북입니다. 특정 사이트의 리뷰를 수집하는 방법은 사이트별 가이드를, 분석 설계는 이 페이지를 참고하세요.

## 리뷰에서 얻을 수 있는 데이터

리뷰 페이지에서는 분석에 사용할 수 있는 구조화된 데이터를 얻을 수 있습니다.

| 필드            | 분석에서의 활용                  |
| ------------- | ------------------------- |
| 리뷰 본문         | 감성 분류, 토픽 추출, 요약          |
| 평점(별점)        | 만족도 정량화, 평점과 본문의 상관 분석    |
| 작성일           | 평가의 시계열 추이, 캠페인·이슈의 영향 분석 |
| 대상(상품·매장)     | 상품별·매장별 비교                |
| 작성자 속성(있는 경우) | 세그먼트별 경향 분석               |
| 도움됨 수·답변      | 리뷰의 영향력, 사업자의 대응 파악       |

본문과 평점을 결합하면 점수만으로는 보이지 않는 경향(예: "평점은 높지만 본문은 불만을 서술")을 분석할 수 있습니다.

## 데이터 소스 선택

분석 대상에 따라 리뷰 소스를 선택합니다.

* **이커머스·상품 리뷰**: Amazon, Rakuten의 상품 리뷰에서 상품 평가와 구매자의 목소리를 수집합니다. [Amazon 스크래핑 방법](/docs/ko/academy/scrape-amazon), [Rakuten Ichiba 스크래핑 방법](/docs/ko/academy/scrape-rakuten)을 참고하세요.
* **매장·서비스 리뷰**: 리뷰 사이트에서 매장 평가와 지역 평판을 수집합니다. [Yelp 스크래핑 방법](/docs/ko/academy/scrape-yelp)을 참고하세요.
* **지도 서비스 리뷰**: Google 지도 리뷰에서 로컬 비즈니스의 평판을 수집합니다. [Google 지도 스크래핑 방법](/docs/ko/academy/scrape-google-maps)을 참고하세요.
* **소셜·포럼**: 게시물에서 상품과 브랜드에 대한 평판·언급량을 수집합니다.

여러 소스의 리뷰를 함께 보면 채널별 평가 차이와 평판의 전체적인 형태를 파악할 수 있습니다.

## 수집 설계

분석에 사용할 수 있는 리뷰 데이터를 얻으려면 수집 단계에서 설계해 두어야 합니다.

1. 분석 대상을 정의합니다(상품, 매장, 브랜드, 기간).
2. 수집할 필드를 정합니다(본문, 평점, 작성일은 최소한).
3. 수집 방식을 선택합니다(과거 리뷰 일괄 수집 또는 신규 리뷰 정기 관측).
4. 중복을 제거합니다(동일 리뷰의 중복, 재게시를 판별).
5. 정규화합니다(언어, 문자 인코딩, 평점 척도를 맞춤).

<Tip>
  리뷰 본문과 함께 반드시 평점과 작성일을 수집하세요. 평점은 감성 분석의 학습·검증 데이터로, 작성일은 시계열 분석에 사용됩니다. 본문만으로는 분석의 폭이 크게 좁아집니다.
</Tip>

## 분석으로의 확장

수집·정규화한 리뷰 데이터는 다양한 분석으로 이어집니다.

* **감성 분류**: 본문을 긍정/부정/중립으로 분류하고 비율의 추이를 추적합니다.
* **토픽 추출**: 자주 등장하는 화제(가격, 품질, 배송, 응대 등)를 추출하고 불만 지점을 특정합니다.
* **평가의 시계열 추이**: 평점이나 부정 비율의 변화로 시책·이슈의 영향을 측정합니다.
* **상품·매장 비교**: 경쟁사 또는 자사의 상품·매장을 평가와 리뷰 내용으로 비교합니다.
* **평점-본문 상관**: 점수와 본문의 괴리를 읽어 점수만으로는 보이지 않는 실태를 파악합니다.

신규 리뷰를 정기 관측하고 부정 비율의 급증 등을 이벤트로 정의해 두면 알림과 자동 리포트로 연결할 수 있습니다.

## 유의사항

* **리뷰 본문의 저작권**: 리뷰 본문은 저작물성이 높습니다. 수집할 수 있다는 것과 전재·재배포·2차 이용해도 된다는 것은 별개입니다. 분석을 위한 내부 이용과 공개·재배포를 구분해서 다루세요.
* **개인정보**: 작성자 이름 등 개인정보는 최소화하고, 분석에 불필요하면 수집·보관하지 않습니다.
* **robots.txt·이용약관**: 대상 URL 단위로 크롤링 가부와 약관을 확인합니다.
* **서버 부하**: 정기 수집에서는 수집 빈도와 건수를 억제합니다.

합법성 판단 기준은 [웹 스크래핑은 합법인가?](/docs/ko/academy/is-web-scraping-legal)를 참고하세요.

## Octoparse에서의 구현

Octoparse는 헤드가 있는 실제 브라우저로 페이지를 렌더링하므로, 추가 로딩으로 표시되는 리뷰도 수집할 수 있습니다. 과거 리뷰의 일괄 수집과 신규 리뷰의 정기 수집을 모두 시각적으로 설정할 수 있으며, 클라우드 실행으로 지속적으로 축적할 수 있습니다.

정기 수집 설정은 [예약 실행](/docs/ko/platform/schedules)을, 수집한 리뷰의 정리는 [추출 데이터 정형 및 정제](/docs/ko/platform/refine-data)를 사용하세요.

## 관련 리소스

* [시장 조사·경쟁 분석을 위한 데이터 수집](/docs/ko/academy/market-research) — 평판을 포함한 경쟁 전체 그림 추적
* [이커머스 데이터 수집](/docs/ko/academy/ecommerce-data) — 상품·가격과 함께 리뷰 수집
* [Amazon 스크래핑 방법](/docs/ko/academy/scrape-amazon) — 상품 리뷰 데이터 소스
* [Yelp 스크래핑 방법](/docs/ko/academy/scrape-yelp) — 매장 리뷰 데이터 소스
* [웹 스크래핑은 합법인가?](/docs/ko/academy/is-web-scraping-legal) — 수집의 합법성과 이용 범위
