> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 自動検出

> 自動検出を使うと、Octoparseがページ上のデータを識別し、初期抽出ワークフローを自動生成できます。

自動検出は、Webページをスキャンし、繰り返し表示されるデータパターンを識別して、データフィールドやページネーションロジックを含む初期抽出ワークフローを生成します。作業量と柔軟性の面では、[テンプレート](/docs/jp/platform/templates)（最も早いが対応サイトに限定される）と[ノーコードビルダー](/docs/jp/platform/no-code-builder)（完全に手動で制御できる）の中間に位置します。

## 自動検出を使う場面

次のような場合に自動検出を使用します。

* 商品、リスト、レビュー、検索結果などの繰り返し項目がある
* 素早く初期ワークフローを作りたい
* どの要素を手動で選択すべきか分からない
* Octoparseにフィールドやページネーションロジックを提案してほしい
* 本格的に設定する前に、対象Webサイトからどのようなデータを抽出できるか素早く確認したい
* 生成されたワークフローを後で確認・調整する前提で開始したい

自動検出は出発点であり、すべてのフィールドやアクションが必ず正しいことを保証するものではありません。

## 自動検出の仕組み

自動検出はページのDOM構造と視覚的なレイアウトを解析し、類似度計算と特徴の組み合わせによって繰り返しデータ領域を見つけ、抽出ルールを自動生成します。

<Steps>
  <Step title="対象ページを開く">
    抽出したいデータが含まれるページから開始します。
  </Step>

  <Step title="自動検出を実行する">
    Octoparseがページをスキャンし、繰り返しデータ領域を検出して抽出フィールドを生成します。ページネーションや次ページボタンも識別し、複数の結果ページを自動で移動できるようにします。
  </Step>

  <Step title="検出されたフィールドを確認する">
    提案されたフィールドが必要なデータと一致しているか確認します。
  </Step>

  <Step title="ページ移動を確認する">
    ページネーション、スクロール、次ページアクションを確認します。自動検出が次ページボタンや無限スクロールのパターンを検出する場合がありますが、大規模実行前に正しく動作するか確認してください。
  </Step>

  <Step title="タスクをテストする">
    サンプル実行を行い、本格的に抽出する前に出力を確認します。
  </Step>
</Steps>

## 検出後に確認すること

自動検出でワークフローが生成されたら、次の点を確認します。

| 項目       | 確認内容                    | 修正方法                              |
| -------- | ----------------------- | --------------------------------- |
| フィールド    | 正しい値が取得されているか           | 要素を選択し直すか、データプレビューパネルでXPathを調整します |
| フィールド名   | 列名が分かりやすく意味のあるものになっているか | エクスポート前にフィールド名を変更します              |
| ページネーション | タスクが次ページへ正しく移動するか       | 次ページボタンまたはスクロールアクションを手動で設定します     |
| 詳細ページ    | 必要な場合に詳細ページを開けるか        | 詳細ページに入るクリックアクションを追加します           |
| 重複       | 不要な要素や重複要素が含まれていないか     | データプレビューパネルで不要なフィールドや行を削除します      |
| 欠損値      | 重要なフィールドが空になっている行がないか   | データプレビューパネルでフィールドを手動追加します         |

## 既知の制限

自動検出は、明確で繰り返しのあるデータ構造を持つページで最も効果を発揮します。次のような状況では、結果が不完全または不正確になる場合があります。

| 状況                                    | 起こり得ること                                |
| ------------------------------------- | -------------------------------------- |
| 標準的でない、または不規則なページレイアウト                | フィールドが誤って識別されたり、欠落したりすることがあります         |
| JavaScriptで描画される動的コンテンツ               | 初期表示後に読み込まれるデータが検出されないことがあります          |
| スクレイピング対策が強いWebサイト（Indeed、LinkedInなど） | ページの読み込みや解析に失敗することがあります                |
| 複雑な入れ子構造                              | 検出されたリストに誤った要素や重複要素が含まれることがあります        |
| 誤ったフィールドの取得                           | 実際の値ではなく、割引ラベルなどのプロモーション文言を取得することがあります |

自動検出後によく見られる実行時エラーに **"\[Loop Item] failed to find current loop item, exiting loop now"** があります。これは通常、生成されたXPathが実際のページ要素と一致しなくなったことを意味します。自動検出を再実行するか、ノーコードビルダーでセレクターを手動調整すると解消できることが多いです。

## 手動編集が必要な場合

次のような場合は手動調整が必要になることがあります。

* ページレイアウトが不規則である
* 重要なフィールドが検出リストの外にある
* Webサイトがコンテンツを動的に読み込む
* ページネーションが正しく検出されない
* ログイン、フィルター、ポップアップ、ユーザー操作が必要である
* 詳細ページからデータを抽出する必要がある

生成されたワークフローの調整にはノーコードビルダーを使用します。

<Warning>
  自動検出の出力をそのまま本番利用できると考えないでください。必ずフィールドを確認し、サンプル実行を行い、エクスポートデータを確認してください。
</Warning>

## 関連ページ

<Columns cols={3}>
  <Card title="テンプレート" href="/docs/jp/platform/templates">
    よく使われるWebサイト向けの事前構築済みワークフローから開始します。
  </Card>

  <Card title="ノーコードビルダー" href="/docs/jp/platform/no-code-builder">
    自動検出後にワークフローを調整したり、手動で構築したりします。
  </Card>

  <Card title="データ整形" href="/docs/jp/platform/refine-data">
    エクスポート前に抽出フィールドをクリーニングし、形式を整えます。
  </Card>
</Columns>
