> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Datenerfassung für KI und LLMs

> So erfassen Sie mit Web Scraping Daten für Training, Fine-Tuning und RAG: Quellenwahl, Felder, Erfassungsablauf, Qualität, Lizenzen und Compliance.

Training, Fine-Tuning und RAG (Retrieval-Augmented Generation) benötigen große Mengen aufgabengerechter Daten. Mit Web Scraping lassen sich öffentliche Texte, strukturierte Daten, Rezensionen und Fachinformationen kontinuierlich und in einer für Modelle nutzbaren Form aus dem Web erfassen.

Es geht nicht darum, möglichst viele Seiten abzurufen. Entscheidend ist die Gestaltung: Welche Quellen passen zum Zielmodell? Welche Felder bleiben erhalten? Wie werden Daten normalisiert und dedupliziert? Ist die Erfassung im Hinblick auf Lizenzen, Nutzungsbedingungen und personenbezogene Daten vertretbar?

## Häufige Datenquellen

| Quelle                                              | Geeignet für                                    | Wichtige Felder                                                       |
| --------------------------------------------------- | ----------------------------------------------- | --------------------------------------------------------------------- |
| Allgemeine Webtexte (Artikel, Blogs, Dokumentation) | Allgemeines Vortraining, RAG                    | Fließtext, Titel, Überschriften, Veröffentlichungsdatum, Quell-URL    |
| Fachspezifische Inhalte (Technik, Recht, Medizin)   | Fachmodelle, spezialisiertes RAG                | Fließtext, Kategorie, Quelle, Aktualisierungsdatum, Autoritätssignale |
| Rezensionen und Bewertungen                         | Sentimentmodelle, Zusammenfassung von Meinungen | Rezensionstext, Punktzahl, Datum, Gegenstand, Sprache                 |
| Fragen und Antworten sowie Foren                    | Dialog- und Anweisungs-Tuning                   | Frage, Antwort, Stimmen, Tags, Thread-Struktur                        |
| Strukturierte Daten (Tabellen, Kataloge, Einträge)  | Extraktions- und Klassifizierungsaufgaben       | Feld-Wert-Paare, Einheiten, Kategorien                                |

Erfassen Sie für RAG Artikel und Dokumente aus der Zieldomäne, teilen Sie den Fließtext anschließend in Abschnitte und speichern Sie ihn mit Metadaten. Für ein Sentimentmodell erfassen Sie Rezensionstexte und Bewertungen als gelabelte Daten.

## Feld- und Datengestaltung

Trainingsdaten sollten nicht nur Fließtext, sondern auch Herkunft und Kontext enthalten.

Felder für Training und RAG:

* Fließtext (bereinigt)
* Titel, Überschriften und Abschnittsstruktur
* Veröffentlichungs- und Aktualisierungsdatum
* Kategorie, Tags und Sprache
* Quell-URL
* Zeitpunkt der Erfassung

Felder für Qualität und Nachvollziehbarkeit:

* Lizenz- und Nutzungsbedingungen (Wiederverwendungsrechte)
* Signale für die Verlässlichkeit von Inhalten (Domain, Autor)
* Hash oder normalisierter Text zur Deduplizierung
* Erfassungsbedingungen (Abfrage, Umfang, Stichprobe)

<Tip>
  Speichern Sie für jede Zeile eine Quell-URL und den Erfassungszeitpunkt. So können Sie die Herkunft der Trainingsdaten nachvollziehen, später Lizenzen prüfen, Duplikate entfernen, Widersprüche gegen die Nutzung berücksichtigen und den Datensatz aktualisieren.
</Tip>

## Erfassungsablauf

1. Wählen Sie Datenquellen passend zu Zielmodell und Aufgabe.
2. Ermitteln Sie Zielseiten über Suche, Kategorien, Sitemaps oder Listenseiten.
3. Extrahieren Sie Fließtext und Metadaten; entfernen Sie Navigation, Werbung und wiederkehrende Elemente.
4. Normalisieren und bereinigen Sie den Text: HTML entfernen, Leerraum korrigieren und Codierung vereinheitlichen.
5. Entfernen Sie Duplikate nach URL, normalisiertem Text oder Hash.
6. Filtern Sie nach Qualität und entfernen Sie zu kurze, fremdsprachige oder aus Standardbausteinen bestehende Inhalte.
7. Formatieren Sie die Daten für das Training, etwa als JSONL oder als Abschnitte mit Metadaten.

Die Trennung von Ermittlung und Extraktion erleichtert die parallele Verarbeitung vieler Seiten.

## Qualität und Compliance

Die Datenerfassung für KI und LLMs muss sowohl Qualität als auch Lizenzierung berücksichtigen.

* **Urheberrecht und Nutzungsbedingungen:** Ob Fließtext wiederverwendet werden darf, ist eine andere Frage als seine Erfassbarkeit. Prüfen Sie Lizenzen und die Bedingungen jeder Website.
* **robots.txt:** Prüfen Sie die Crawl-Berechtigung für jede Ziel-URL.
* **Personenbezogene Daten:** Minimieren Sie Namen, Kontaktdaten und andere personenbezogene Informationen. Erfassen oder speichern Sie sie nicht, wenn sie nicht benötigt werden.
* **Herkunftsnachweise:** Bewahren Sie Quell-URL und Erfassungszeitpunkt auf, um später Lizenzen zu prüfen und Widersprüche gegen die Nutzung zu berücksichtigen.
* **Qualität:** Schließen Sie Standardbausteine, Duplikate, maschinelles Übersetzungsrauschen und schädliche Inhalte von Trainingsdaten aus.

<Warning>
  Öffentliche und erfassbare Daten dürfen nicht automatisch als Trainingsdaten wiederverwendet werden. Verarbeiten Sie urheberrechtlich geschützten Fließtext und personenbezogene Daten erst nach Prüfung der Lizenzen und des anwendbaren Rechts. Diese Seite bietet einen allgemeinen Überblick und keine Rechtsberatung.
</Warning>

## Erfassung mit Octoparse und MCP

Octoparse rendert Seiten in einem sichtbaren, echten Browser und kann daher auch dynamisch per JavaScript erzeugte Texte erfassen. Erstellen Sie einen Workflow, der die Ermittlung über Listen oder Suche von der Extraktion von Fließtext und Metadaten trennt. Führen Sie ihn nach einem Cloud-Zeitplan aus, um Trainingsdaten aktuell zu halten.

Verwenden Sie den [Octoparse MCP Server](/docs/de/mcp), um Daten direkt über einen KI-Agenten zu erfassen: Ein MCP-fähiger KI-Client kann in natürlicher Sprache Vorlagen suchen, Aufgaben ausführen und Daten abrufen. Für die allgemeine Inhaltsextraktion eignet sich die [universelle Vorlage zur Inhaltsextraktion](https://www.octoparse.de/template/universal-content) für beliebige Webseiten.

## Verwandte Ressourcen

* [Datenerfassung durch einen KI-Agenten ausführen (MCP Server)](/docs/de/mcp) – ein MCP-fähiger Client erfasst Octoparse-Daten direkt
* [JavaScript-gerenderte Seiten scrapen](/docs/de/academy/scrape-javascript-pages) – Ansätze für dynamische Inhalte
* [Paginierung handhaben](/docs/de/academy/handle-pagination) – große Seitenmengen abdecken
* [Extrahierte Daten verfeinern und bereinigen](/docs/de/platform/refine-data) – Text für das Training normalisieren
* [Ist Web Scraping legal?](/docs/de/academy/is-web-scraping-legal) – Rechtmäßigkeit und Erfassungsumfang
