Skip to main content
Gescrapte Rohdaten sind selten direkt nutzbar. Nachdem Ihre Selektoren die gewünschten Werte gefunden haben, enthalten die ausgelesenen Zeichenfolgen häufig störenden Text. Ein Produktpreis kann Währungssymbole, Leerraum und nachgestellten Text enthalten; Telefonnummern erscheinen auf derselben Website in mehreren Formaten; Datumsangaben etwa als „May 15, 2026“ oder „2026-05-15“. Reguläre AusdrückeRegex – sind das Standardwerkzeug, um solchen unübersichtlichen Text zu bereinigen, zu extrahieren und in einheitliche, strukturierte Felder umzuwandeln. Regex definiert ein Muster für die Form des gesuchten Texts. Die Engine durchsucht eine Zeichenfolge, findet Treffer und ermöglicht deren Extraktion oder Ersetzung. Einige häufige Muster decken den Großteil der Bereinigungsaufgaben beim Scraping ab.

Häufige Bereinigungsmuster

  • Preise. [\d,.]+ erfasst Zahlen mit Kommas und Dezimalstellen und entfernt umgebenden Text. (\d{1,3}(?:,\d{3})*(?:\.\d{2})?) entspricht Formaten wie 1,299.99 genauer.
  • Telefonnummern. \(?\d{3}\)?[-.\s]?\d{3}[-.\s]?\d{4} verarbeitet übliche US-Formate mit oder ohne Klammern sowie Bindestriche, Punkte oder Leerzeichen.
  • E-Mails. [\w.+-]+@[\w-]+\.[\w.]+ erfasst die meisten üblichen E-Mail-Adressen.
  • Datumsangaben. \d{4}-\d{2}-\d{2} entspricht dem ISO-Format; \w+ \d{1,2}, \d{4} verarbeitet Zeichenfolgen wie May 15, 2026.
  • HTML-Tags entfernen. <[^>]+> entfernt Tags aus einer Zeichenfolge.
  • Leerraum normalisieren. \s+ fasst aufeinanderfolgenden Leerraum zu einem Leerzeichen zusammen.

Praktische Tipps

  • Mit echten Beispielen testen. Reale Seiten besitzen Eigenheiten. Testen Sie das Muster mit Ausgaben der tatsächlichen Zielwebsite.
  • Nicht-gierige Quantifizierer (*?, +?) verwenden. * und + wählen standardmäßig den längsten Treffer, was häufig unerwünscht ist.
  • Erfassungsgruppen verwenden. Mit Klammern () extrahieren Sie nur den relevanten Teil eines größeren Treffers.
  • Gebietsschema-Sonderfälle beachten. Ein US-Preismuster (1,299.99) verarbeitet europäische Zahlen (1.299,99) falsch. Dasselbe gilt für Datumsangaben, Telefonnummern und Dezimalnotationen.

Der Ansatz von Octoparse

Regex gilt zu Recht als schwer zu schreiben und noch schwerer zu lesen. Ein kleiner Fehler kann unbemerkt falsche Daten liefern. Octoparse integriert Regex deshalb als Nachbearbeitungsschritt direkt in den Extraktions-Workflow. Nutzer können jedes gescrapte Feld vor dem Export bereinigen und umformen, ohne eigenständige Skripte zu schreiben. Muster, zugehöriges Feld und bereinigte Ausgabe bleiben in derselben Aufgabendefinition. Für Nutzer ohne Regex-Erfahrung bietet Octoparse außerdem eine KI-gestützte Regex-Generierung: Markieren Sie ähnliche Seitenelemente; die KI analysiert deren Muster und erzeugt automatisch einen passenden regulären Ausdruck. Dieser lässt sich in der Plattform mit den tatsächlichen gescrapten Daten testen und bei Bedarf anpassen. Die KI übernimmt die Syntax, der Nutzer validiert das Ergebnis. Damit werden die beiden tatsächlichen Kosten von Regex im Scraping-Workflow reduziert: Muster von Grund auf schreiben und ihre beabsichtigte Wirkung mit echten Daten überprüfen. Beides findet im visuellen Editor statt statt in getrennten Engineering-Aufgaben.

Fazit

Die meisten Scraping-Projekte benötigen keine hochkomplexen regulären Ausdrücke. Eine kleine Bibliothek wiederverwendbarer Muster für Preise, E-Mails, Datumsangaben, Telefonnummern und Leerraum deckt den Großteil der Bereinigung ab. Halten Sie Muster so einfach wie möglich, dokumentieren Sie sie für die langfristige Wartung und nutzen Sie KI-Generierung, wenn die Syntax unübersichtlich wird. Das Ziel sind saubere, einheitliche Ausgaben – Regex ist nur das Mittel dazu.