리뷰에서 얻을 수 있는 데이터
리뷰 페이지에서는 분석에 사용할 수 있는 구조화된 데이터를 얻을 수 있습니다.
본문과 평점을 결합하면 점수만으로는 보이지 않는 경향(예: “평점은 높지만 본문은 불만을 서술”)을 분석할 수 있습니다.
데이터 소스 선택
분석 대상에 따라 리뷰 소스를 선택합니다.- 이커머스·상품 리뷰: Amazon, Rakuten의 상품 리뷰에서 상품 평가와 구매자의 목소리를 수집합니다. Amazon 스크래핑 방법, Rakuten Ichiba 스크래핑 방법을 참고하세요.
- 매장·서비스 리뷰: 리뷰 사이트에서 매장 평가와 지역 평판을 수집합니다. Yelp 스크래핑 방법을 참고하세요.
- 지도 서비스 리뷰: Google 지도 리뷰에서 로컬 비즈니스의 평판을 수집합니다. Google 지도 스크래핑 방법을 참고하세요.
- 소셜·포럼: 게시물에서 상품과 브랜드에 대한 평판·언급량을 수집합니다.
수집 설계
분석에 사용할 수 있는 리뷰 데이터를 얻으려면 수집 단계에서 설계해 두어야 합니다.- 분석 대상을 정의합니다(상품, 매장, 브랜드, 기간).
- 수집할 필드를 정합니다(본문, 평점, 작성일은 최소한).
- 수집 방식을 선택합니다(과거 리뷰 일괄 수집 또는 신규 리뷰 정기 관측).
- 중복을 제거합니다(동일 리뷰의 중복, 재게시를 판별).
- 정규화합니다(언어, 문자 인코딩, 평점 척도를 맞춤).
분석으로의 확장
수집·정규화한 리뷰 데이터는 다양한 분석으로 이어집니다.- 감성 분류: 본문을 긍정/부정/중립으로 분류하고 비율의 추이를 추적합니다.
- 토픽 추출: 자주 등장하는 화제(가격, 품질, 배송, 응대 등)를 추출하고 불만 지점을 특정합니다.
- 평가의 시계열 추이: 평점이나 부정 비율의 변화로 시책·이슈의 영향을 측정합니다.
- 상품·매장 비교: 경쟁사 또는 자사의 상품·매장을 평가와 리뷰 내용으로 비교합니다.
- 평점-본문 상관: 점수와 본문의 괴리를 읽어 점수만으로는 보이지 않는 실태를 파악합니다.
유의사항
- 리뷰 본문의 저작권: 리뷰 본문은 저작물성이 높습니다. 수집할 수 있다는 것과 전재·재배포·2차 이용해도 된다는 것은 별개입니다. 분석을 위한 내부 이용과 공개·재배포를 구분해서 다루세요.
- 개인정보: 작성자 이름 등 개인정보는 최소화하고, 분석에 불필요하면 수집·보관하지 않습니다.
- robots.txt·이용약관: 대상 URL 단위로 크롤링 가부와 약관을 확인합니다.
- 서버 부하: 정기 수집에서는 수집 빈도와 건수를 억제합니다.
Octoparse에서의 구현
Octoparse는 헤드가 있는 실제 브라우저로 페이지를 렌더링하므로, 추가 로딩으로 표시되는 리뷰도 수집할 수 있습니다. 과거 리뷰의 일괄 수집과 신규 리뷰의 정기 수집을 모두 시각적으로 설정할 수 있으며, 클라우드 실행으로 지속적으로 축적할 수 있습니다. 정기 수집 설정은 예약 실행을, 수집한 리뷰의 정리는 추출 데이터 정형 및 정제를 사용하세요.관련 리소스
- 시장 조사·경쟁 분석을 위한 데이터 수집 — 평판을 포함한 경쟁 전체 그림 추적
- 이커머스 데이터 수집 — 상품·가격과 함께 리뷰 수집
- Amazon 스크래핑 방법 — 상품 리뷰 데이터 소스
- Yelp 스크래핑 방법 — 매장 리뷰 데이터 소스
- 웹 스크래핑은 합법인가? — 수집의 합법성과 이용 범위