수집할 데이터
전자상거래 스크래핑은 일반적으로 제품 카탈로그에서 시작합니다.
Octoparse, Apify, Bright Data의 템플릿은 일반적으로 목록, 상세 정보, 리뷰 추출을 분리합니다. 이는 전자상거래 사이트의 구조를 그대로 반영합니다. 목록 페이지는 폭넓은 정보를, 상세 페이지는 전체 제품 정보를, 리뷰 페이지는 감성과 품질 신호를 제공합니다.
일반적인 워크플로
카탈로그 모니터링
카테고리 페이지 또는 검색 결과를 스크래핑하여 제품, 판매자, 순위를 찾습니다. 제품 URL과 ID를 갱신 대상으로 저장합니다.제품 상세 정보 보강
발견한 제품의 상세 페이지를 방문합니다. 설명, 사양, 이미지, 옵션, 판매자 정보, 재고 상태를 수집합니다.리뷰 분석
제품 정보와 별도로 리뷰를 수집합니다. 리뷰 페이지는 독립적으로 페이지가 나뉘는 경우가 많으며 모니터링을 위해 최신순으로 정렬해야 할 수 있습니다.가격 및 재고 추적
선택한 제품을 일정에 따라 갱신합니다. 타임스탬프가 포함된 스냅샷을 저장하여 가격 변경, 프로모션, 품절, 판매자 변경을 감지할 수 있게 합니다.플랫폼별 차이
Amazon이 대표적인 예입니다. 검색 및 카테고리 페이지는 제목, 가격, 평점, 리뷰 수, 이미지, ASIN과 유사한 식별자를 포함한 제품 카드를 제공합니다. 제품 페이지에는 설명, 기능 목록, 사양, 판매자 정보, 옵션, 베스트셀러 순위, 재고 또는 배송 정보가 추가됩니다. 리뷰 페이지에는 텍스트, 평점, 리뷰어 신호, 도움 됨 수, 인증 상태가 추가됩니다. 각 페이지 유형을 서로 다른 데이터세트로 취급하세요.
데이터 정규화
전자상거래 데이터는 분석 전에 정제가 필요합니다.- 통화와 지역을 정규화합니다.
- 묶음 수량을 단위 가격으로 변환합니다.
- 제품 가격과 배송비를 분리합니다.
- 재고 상태를 표준화합니다.
- 옵션을 상위 제품에 매핑합니다.
- 여러 URL에서 동일한 제품의 중복을 제거합니다.
- 소스 타임스탬프를 보존합니다.