Skip to main content
自動検出は、Webページをスキャンし、繰り返し表示されるデータパターンを識別して、データフィールドやページネーションロジックを含む初期抽出ワークフローを生成します。作業量と柔軟性の面では、テンプレート(最も早いが対応サイトに限定される)とノーコードビルダー(完全に手動で制御できる)の中間に位置します。

自動検出を使う場面

次のような場合に自動検出を使用します。
  • 商品、リスト、レビュー、検索結果などの繰り返し項目がある
  • 素早く初期ワークフローを作りたい
  • どの要素を手動で選択すべきか分からない
  • Octoparseにフィールドやページネーションロジックを提案してほしい
  • 本格的に設定する前に、対象Webサイトからどのようなデータを抽出できるか素早く確認したい
  • 生成されたワークフローを後で確認・調整する前提で開始したい
自動検出は出発点であり、すべてのフィールドやアクションが必ず正しいことを保証するものではありません。

自動検出の仕組み

自動検出はページのDOM構造と視覚的なレイアウトを解析し、類似度計算と特徴の組み合わせによって繰り返しデータ領域を見つけ、抽出ルールを自動生成します。
1

対象ページを開く

抽出したいデータが含まれるページから開始します。
2

自動検出を実行する

Octoparseがページをスキャンし、繰り返しデータ領域を検出して抽出フィールドを生成します。ページネーションや次ページボタンも識別し、複数の結果ページを自動で移動できるようにします。
3

検出されたフィールドを確認する

提案されたフィールドが必要なデータと一致しているか確認します。
4

ページ移動を確認する

ページネーション、スクロール、次ページアクションを確認します。自動検出が次ページボタンや無限スクロールのパターンを検出する場合がありますが、大規模実行前に正しく動作するか確認してください。
5

タスクをテストする

サンプル実行を行い、本格的に抽出する前に出力を確認します。

検出後に確認すること

自動検出でワークフローが生成されたら、次の点を確認します。

既知の制限

自動検出は、明確で繰り返しのあるデータ構造を持つページで最も効果を発揮します。次のような状況では、結果が不完全または不正確になる場合があります。 自動検出後によく見られる実行時エラーに “[Loop Item] failed to find current loop item, exiting loop now” があります。これは通常、生成されたXPathが実際のページ要素と一致しなくなったことを意味します。自動検出を再実行するか、ノーコードビルダーでセレクターを手動調整すると解消できることが多いです。

手動編集が必要な場合

次のような場合は手動調整が必要になることがあります。
  • ページレイアウトが不規則である
  • 重要なフィールドが検出リストの外にある
  • Webサイトがコンテンツを動的に読み込む
  • ページネーションが正しく検出されない
  • ログイン、フィルター、ポップアップ、ユーザー操作が必要である
  • 詳細ページからデータを抽出する必要がある
生成されたワークフローの調整にはノーコードビルダーを使用します。
自動検出の出力をそのまま本番利用できると考えないでください。必ずフィールドを確認し、サンプル実行を行い、エクスポートデータを確認してください。

関連ページ

テンプレート

よく使われるWebサイト向けの事前構築済みワークフローから開始します。

ノーコードビルダー

自動検出後にワークフローを調整したり、手動で構築したりします。

データ整形

エクスポート前に抽出フィールドをクリーニングし、形式を整えます。