Skip to main content
Die Auto-Erkennung scannt eine Webseite, erkennt wiederkehrende Datenmuster und erzeugt einen ersten Extraktionsworkflow – einschließlich Datenfeldern und Paginierungslogik. Hinsichtlich Aufwand und Flexibilität liegt sie zwischen Vorlagen (am schnellsten, aber auf unterstützte Websites beschränkt) und dem No-Code-Builder (vollständige manuelle Kontrolle).

Wann Sie die Auto-Erkennung verwenden sollten

Verwenden Sie die Auto-Erkennung, wenn:
  • die Seite wiederkehrende Elemente wie Produkte, Einträge, Bewertungen oder Suchergebnisse enthält
  • Sie schnell einen ersten Workflow benötigen
  • Sie nicht sicher sind, welche Elemente Sie manuell auswählen sollen
  • Octoparse Felder und Paginierungslogik vorschlagen soll
  • Sie schnell eine Vorschau der von einer Zielwebsite extrahierbaren Daten erhalten möchten, bevor Sie eine vollständige Konfiguration vornehmen
  • Sie den erzeugten Workflow anschließend prüfen und anpassen möchten
Die Auto-Erkennung ist ein Ausgangspunkt, keine Garantie dafür, dass jedes Feld oder jede Aktion korrekt ist.

So funktioniert die Auto-Erkennung

Die Auto-Erkennung analysiert die DOM-Struktur und das visuelle Layout der Seite, lokalisiert mithilfe von Ähnlichkeitsberechnungen und Merkmalskombinationen wiederkehrende Datenbereiche und erzeugt automatisch Extraktionsregeln.
1

Zielseite öffnen

Beginnen Sie mit der Seite, die die zu extrahierenden Daten enthält.
2

Auto-Erkennung ausführen

Octoparse scannt die Seite, erkennt wiederkehrende Datenbereiche und erzeugt Extraktionsfelder. Zudem versucht es, Paginierungs- oder „Nächste Seite“-Schaltflächen zu erkennen, damit die Aufgabe automatisch mehrere Ergebnisseiten durchlaufen kann.
3

Erkannte Felder prüfen

Prüfen Sie, ob die vorgeschlagenen Felder den benötigten Daten entsprechen.
4

Seitennavigation bestätigen

Prüfen Sie Paginierung, Scrollen oder Aktionen für die nächste Seite. Die Auto-Erkennung kann eine „Nächste Seite“-Schaltfläche oder ein Endlos-Scrollmuster erkennen – vergewissern Sie sich vor einer Ausführung im großen Umfang, dass es richtig funktioniert.
5

Aufgabe testen

Führen Sie einen Test aus und prüfen Sie die Ausgabe, bevor Sie die Extraktion skalieren.

Was Sie nach der Erkennung prüfen sollten

Nachdem die Auto-Erkennung einen Workflow erzeugt hat, prüfen Sie Folgendes:

Bekannte Einschränkungen

Die Auto-Erkennung funktioniert am besten auf Seiten mit klaren, wiederkehrenden Datenstrukturen. In bestimmten Situationen kann sie unvollständige oder ungenaue Ergebnisse erzeugen: Ein häufiger Laufzeitfehler nach der Auto-Erkennung lautet „[Loop Item] failed to find current loop item, exiting loop now“. Dies bedeutet meist, dass der erzeugte XPath nicht mehr mit den tatsächlichen Seitenelementen übereinstimmt. Eine erneute Auto-Erkennung oder die manuelle Anpassung des Selektors im No-Code-Builder behebt das Problem normalerweise.

Wann eine manuelle Bearbeitung erforderlich ist

Manuelle Anpassungen können nötig sein, wenn:
  • das Seitenlayout unregelmäßig ist
  • wichtige Felder außerhalb der erkannten Liste liegen
  • die Website Inhalte dynamisch lädt
  • die Paginierung nicht richtig erkannt wird
  • die Seite eine Anmeldung, Filter, Pop-ups oder Benutzerinteraktionen erfordert
  • Sie Daten aus Detailseiten extrahieren müssen
Verfeinern Sie den erzeugten Workflow mit dem No-Code-Builder.
Gehen Sie nicht davon aus, dass die Ausgabe der Auto-Erkennung produktionsbereit ist. Prüfen Sie stets die Felder, führen Sie einen Test aus und kontrollieren Sie die exportierten Daten.

Verwandte Seiten

Vorlagen

Beginnen Sie mit einem vorgefertigten Workflow für gängige Websites.

No-Code-Builder

Passen Sie Workflows nach der Auto-Erkennung manuell an oder erstellen Sie sie selbst.

Daten verfeinern

Bereinigen und formatieren Sie extrahierte Felder vor dem Export neu.