1
페이지 가져오기
HTTP 요청을 보내고 HTML을 받습니다.
2
페이지 렌더링
실제 브라우저에서 페이지의 JavaScript를 실행합니다.
3
데이터 위치 찾기
XPath 또는 CSS 선택자로 요소를 지정합니다.
4
추출 및 정제
값을 가져와 정규식으로 정제합니다.
5
사이트 탐색
페이지 넘기기와 로그인 장벽을 처리합니다.
6
결과 저장
CSV, JSON, 데이터베이스 또는 다운스트림 API에 저장합니다.
페이지 가져오기
모든 작업은 요청에서 시작됩니다. 스크래퍼가 URL에 HTTP 요청을 보내 응답을 받으며, 응답은 일반적으로 HTML이고 때로는 JSON입니다. 단순한 서버 렌더링 페이지라면 이 한 단계로 필요한 모든 데이터를 얻을 수 있습니다. 다만 응답은 서버가 보내는 초기 페이로드일 뿐이며, 최신 사이트 중에는 내용이 거의 없는 셸만 보내는 곳도 많습니다.페이지 렌더링
사이트가 JavaScript로 콘텐츠를 구성하면 원하는 데이터는 초기 HTML에 없고 페이지 스크립트가 실행된 후에만 나타납니다. 렌더링 단계에서는 실제 브라우저에서 해당 스크립트를 실행하여 전체 콘텐츠를 표시합니다. 여기서 사용하는 브라우저 런타임은 페이지가 얼마나 충실하게 로드되는지와 메모리 및 속도 비용을 결정하며, JavaScript 렌더링 페이지 스크래핑의 핵심입니다.데이터 위치 찾기
페이지가 완전히 로드되면 스크래퍼는 가격, 제목, 표의 행처럼 원하는 특정 항목을 가리켜야 합니다. XPath 또는 CSS 선택자는 페이지 구조에서 요소의 위치를 설명합니다. 좋은 선택자는 사소한 레이아웃 변경에도 견디는 스크래퍼와 사이트가 업데이트될 때마다 중단되는 스크래퍼를 가릅니다.추출 및 정제
요소를 찾으면 원시 콘텐츠를 얻을 수 있고, 추출은 그 값을 가져오며, 정제는 값을 깔끔하게 다듬습니다. 스크래핑한 가격이"$1,299.00 USD"로 들어왔지만 숫자만 필요할 수 있습니다. 정규식과 후처리 규칙을 사용하면 원시 텍스트를 제거, 분할, 재구성하여 실제로 저장하려는 구조화된 필드로 만들 수 있습니다.