> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Daten optimieren

> Benennen Sie extrahierte Felder um, ordnen und bereinigen Sie sie oder leiten Sie neue Werte ab – mit integrierten Regeln und RegEx direkt im Octoparse-Feldeditor.

Unbearbeitete extrahierte Daten sind selten sofort einsatzbereit. Mit Octoparse können Sie extrahierte Felder vor dem Export optimieren, um Text zu bereinigen, Werte neu zu strukturieren, unerwünschte Zeichen zu entfernen und nur den benötigten Teil eines Feldes zu extrahieren.

Wenn das falsche Element extrahiert wird, korrigieren Sie zuerst die [Feldauswahl](/docs/de/platform/no-code-builder). **Wenn das richtige Element ausgewählt ist, das Wertformat aber unübersichtlich ist, verwenden Sie Optimierungsregeln.**

## Unterstützte Szenarien

<Columns cols={2}>
  <Card title="Unübersichtliche Werte bereinigen">
    Entfernen, ersetzen, kürzen oder formatieren Sie Text vor dem Export neu.
  </Card>

  <Card title="Teil eines Wertes extrahieren">
    Verwenden Sie Abgleichsregeln oder reguläre Ausdrücke, um nur das benötigte Textmuster beizubehalten.
  </Card>

  <Card title="Werte zeilenübergreifend vereinheitlichen">
    Fügen Sie Präfixe hinzu, entfernen Sie wiederholten Text oder normalisieren Sie uneinheitliche Werte in mehreren Zeilen.
  </Card>

  <Card title="Datumswerte und Zeitstempel neu formatieren">
    Wandeln Sie Datumsformate, relative Datumsangaben, Unix-Zeitstempel oder Zeitzonenabweichungen in eine einheitliche Ausgabe um.
  </Card>
</Columns>

Häufige Beispiele:

* Entfernen von Beschriftungen wie `Price:` oder `Rating:`
* Ersetzen unerwünschter Zeichen oder zusätzlicher Leerzeichen
* Hinzufügen eines Präfixes oder Suffixes zu jedem Wert
* Neuformatieren von Datumsangaben oder Umrechnen von Zeitzonen
* Dekodieren von HTML-Entitäten in Klartext

## „Daten bereinigen“ öffnen

<Steps>
  <Step title="Feld auswählen">
    Wählen Sie in der Datenvorschau oder Feldliste das extrahierte Feld aus, das Sie bereinigen möchten.
  </Step>

  <Step title="Feldmenü öffnen">
    Klicken Sie für dieses Feld auf das Menü `...`.
  </Step>

  <Step title="„Daten bereinigen“ auswählen">
    Wählen Sie **Daten bereinigen**, um den Workflow zur Datenbereinigung zu öffnen.
  </Step>

  <Step title="Bereinigungsschritt hinzufügen">
    Klicken Sie auf **Schritt hinzufügen** und wählen Sie den gewünschten Vorgang aus.
  </Step>

  <Step title="Ergebnis in der Vorschau prüfen">
    Prüfen Sie den Vorschauwert, bevor Sie die Regel speichern.
  </Step>
</Steps>

## Häufige Optimierungsvorgänge

| Vorgang                                    | Verwendung                                                                                                                                                                                                                                                                                      |
| ------------------------------------------ | ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| Ersetzen                                   | Ersetzt eine bestimmte Zeichenfolge durch einen anderen Wert oder entfernt sie, indem sie durch eine leere Zeichenfolge ersetzt wird <br /> <sub>Eine leere Zeichenfolge enthält keine Zeichen. Durch das Ersetzen mit einer leeren Zeichenfolge wird der übereinstimmende Text entfernt.</sub> |
| Mit regulärem Ausdruck ersetzen            | Verwendet ein RegEx-Muster, um übereinstimmende Zeichenfolgen zu suchen und zu ersetzen                                                                                                                                                                                                         |
| Mit regulärem Ausdruck abgleichen          | Behält nur den Teil eines Wertes bei, der dem Muster entspricht, und verwirft alles andere                                                                                                                                                                                                      |
| Leerzeichen kürzen                         | Entfernt unerwünschte Leerzeichen am Anfang oder Ende eines Wertes                                                                                                                                                                                                                              |
| Präfix hinzufügen                          | Fügt vor jedem extrahierten Wert festen Text hinzu                                                                                                                                                                                                                                              |
| Suffix hinzufügen                          | Fügt nach jedem extrahierten Wert festen Text hinzu                                                                                                                                                                                                                                             |
| Extrahiertes Datum/Uhrzeit neu formatieren | Wandelt Datumsformate oder relative Datumsangaben um (`2 days ago` → bestimmtes Datum) <br /> <sub>Zu den integrierten Formatvorlagen gehören `yyyy/MM/dd hh:mm:ss`, `yyyy-MM-dd`, `01/01/2026`, `Thu, 01 01 2026` und weitere.</sub>                                                           |
| Zeitstempelkonvertierung                   | Wandelt Unix-Zeitstempel in menschenlesbare Datumsformate um                                                                                                                                                                                                                                    |
| Zeitzonenkonvertierung                     | Passt Datum und Uhrzeit an eine Zielzeitzone an                                                                                                                                                                                                                                                 |
| HTML-Transkodierung                        | Wandelt HTML-Entitäten in Klartext um (z. B. `&amp;` → `&`)                                                                                                                                                                                                                                     |

<Tip>
  Eine **Zeichenfolge** ist eine Folge von Zeichen. Sie kann ein Wort, eine Zahl, ein Leerzeichen, ein Symbol oder ein Satzzeichen enthalten. Eine **leere Zeichenfolge** enthält überhaupt keine Zeichen. Wenn Sie beispielsweise einen Wert durch eine leere Zeichenfolge ersetzen, wird er dadurch aus der Ausgabe entfernt.
</Tip>

## RegEx für die musterbasierte Bereinigung verwenden

Reguläre Ausdrücke sind nützlich, wenn der Wert einem Muster folgt, sich aber mit einfachen Regeln zum Ersetzen oder Kürzen nicht zuverlässig bereinigen lässt:

* Eine in einem Satz enthaltene Zahl oder Preisangabe extrahieren
* Text vor oder nach einem bekannten Trennzeichen abgleichen (z. B. `:`, `|`, `-`)
* Nur einen Teil des Wertes eines HTML-Attributs beibehalten
* Muster entfernen, die sich in den einzelnen Zeilen unterschiedlich wiederholen
* Eine Teilzeichenfolge aus einem Wert isolieren, der von Seite zu Seite leicht variiert

Sie können das RegEx-Tool über den Workflow „Daten bereinigen“ oder über den Bereich „Tools“ in der linken Seitenleiste öffnen. Octoparse enthält außerdem einen **KI-RegEx-Generator**. Beschreiben Sie in natürlicher Sprache, was Sie extrahieren möchten, und das Tool erzeugt das Muster für Sie, sodass Sie den Ausdruck nicht manuell schreiben müssen.

| Ziel                           | Muster                 | Eingabe                     | Ausgabe            |
| ------------------------------ | ---------------------- | --------------------------- | ------------------ |
| Preis extrahieren              | `\$\d+(?:\.\d{1,2})?`  | `Only $19.99 today`         | `$19.99`           |
| E-Mail-Adresse extrahieren     | `[\w.-]+@[\w.-]+\.\w+` | `Contact: info@example.com` | `info@example.com` |
| Datum extrahieren (JJJJ-MM-TT) | `\d{4}-\d{2}-\d{2}`    | `Published 2025-06-10`      | `2025-06-10`       |
| Nur Ziffern extrahieren        | `\d+`                  | `Rating: 4.5 out of 5`      | `4`                |
| HTML-Tags entfernen            | `<[^>]+>`              | `<b>Bold text</b>`          | `Bold text`        |

Eine vollständige Liste der Muster und Syntax finden Sie im Hilfezentrum im [RegEx-Spickzettel für die Datenextraktion](https://helpcenter.octoparse.com/de/articles/11659531-regular-expression-regex-cheatsheet-for-data-extraction).

<Tip>
  Verwenden Sie RegEx nur, wenn einfachere Bereinigungsregeln nicht ausreichen. Für unkomplizierte Bereinigungen sind Vorgänge wie Ersetzen, Kürzen, Präfix und Suffix leichter zu pflegen.
</Tip>

## Beispiel: Einen Wert aus einem Attribut extrahieren

Manche Websites speichern nützliche Daten in Attributen statt in sichtbarem Text. Eine Bewertung kann beispielsweise in einem Bildattribut wie `alt="5 stars"` oder in einem Quellwert wie `src` gespeichert sein.

<Steps>
  <Step title="Element auswählen">
    Wählen Sie das Element aus, das den benötigten Wert enthält, z. B. ein Bewertungssymbol oder einen Textblock.
  </Step>

  <Step title="Quellwert auswählen">
    Verwenden Sie je nach Speicherort des Wertes Optionen wie **Bild-URL**, **OuterHTML** oder **Andere Attribute**.
  </Step>

  <Step title="Feld anpassen">
    Öffnen Sie das Feldmenü und wählen Sie **Feld anpassen** oder **Daten bereinigen**.
  </Step>

  <Step title="Zielwert extrahieren">
    Wählen Sie das relevante Attribut aus oder verwenden Sie RegEx, um den beizubehaltenden Teil des HTML abzugleichen.
  </Step>

  <Step title="Vorschau vor dem Speichern prüfen">
    Vergewissern Sie sich vor dem Ausführen der Aufgabe, dass die Vorschau den erwarteten Wert anzeigt.
  </Step>
</Steps>

## Grenzen der Feldoptimierung

Optimierungsregeln bereinigen den Wert, den Octoparse bereits extrahiert hat. Sie ändern nicht die Struktur der Webseite.

Wenn ein mehrzeiliger Textblock beispielsweise optisch in mehreren Zeilen erscheint, im Seitenquelltext aber tatsächlich ein einzelnes Element ist, behandelt Octoparse ihn möglicherweise als ein Feld. In diesem Fall lässt er sich eventuell nicht allein anhand der sichtbaren Zeilenumbrüche in separate Felder aufteilen. Prüfen Sie die Quellstruktur und verwenden Sie je nach tatsächlicher Datenspeicherung die Feldauswahl, Extraktionseinstellungen oder eine RegEx-Bereinigung.

<Warning>
  Wenn sich ein Wert nicht trennen lässt, weil die Website ihn als einzelnes Element speichert, reicht die Datenbereinigung möglicherweise nicht aus. Eventuell müssen Sie das ausgewählte Element anpassen, das HTML untersuchen oder einen anderen Quellwert extrahieren.
</Warning>

## Best Practices

* Optimieren Sie Felder, nachdem Sie geprüft haben, ob das richtige Element ausgewählt ist.
* Verwenden Sie einfache Bereinigungsschritte, bevor Sie RegEx ausprobieren.
* Prüfen Sie jeden Schritt vor dem Speichern in der Vorschau.
* Verwenden Sie eindeutige Feldnamen, damit exportierte Daten leicht verständlich sind.
* Vermeiden Sie eine übermäßige Bereinigung, wenn das nachgelagerte System die Formatierung später verarbeiten kann.
* Dokumentieren Sie komplexe RegEx-Muster, damit Teammitglieder die Aufgabe pflegen können.
