Häufige Datenquellen
Erfassen Sie für RAG Artikel und Dokumente aus der Zieldomäne, teilen Sie den Fließtext anschließend in Abschnitte und speichern Sie ihn mit Metadaten. Für ein Sentimentmodell erfassen Sie Rezensionstexte und Bewertungen als gelabelte Daten.
Feld- und Datengestaltung
Trainingsdaten sollten nicht nur Fließtext, sondern auch Herkunft und Kontext enthalten. Felder für Training und RAG:- Fließtext (bereinigt)
- Titel, Überschriften und Abschnittsstruktur
- Veröffentlichungs- und Aktualisierungsdatum
- Kategorie, Tags und Sprache
- Quell-URL
- Zeitpunkt der Erfassung
- Lizenz- und Nutzungsbedingungen (Wiederverwendungsrechte)
- Signale für die Verlässlichkeit von Inhalten (Domain, Autor)
- Hash oder normalisierter Text zur Deduplizierung
- Erfassungsbedingungen (Abfrage, Umfang, Stichprobe)
Erfassungsablauf
- Wählen Sie Datenquellen passend zu Zielmodell und Aufgabe.
- Ermitteln Sie Zielseiten über Suche, Kategorien, Sitemaps oder Listenseiten.
- Extrahieren Sie Fließtext und Metadaten; entfernen Sie Navigation, Werbung und wiederkehrende Elemente.
- Normalisieren und bereinigen Sie den Text: HTML entfernen, Leerraum korrigieren und Codierung vereinheitlichen.
- Entfernen Sie Duplikate nach URL, normalisiertem Text oder Hash.
- Filtern Sie nach Qualität und entfernen Sie zu kurze, fremdsprachige oder aus Standardbausteinen bestehende Inhalte.
- Formatieren Sie die Daten für das Training, etwa als JSONL oder als Abschnitte mit Metadaten.
Qualität und Compliance
Die Datenerfassung für KI und LLMs muss sowohl Qualität als auch Lizenzierung berücksichtigen.- Urheberrecht und Nutzungsbedingungen: Ob Fließtext wiederverwendet werden darf, ist eine andere Frage als seine Erfassbarkeit. Prüfen Sie Lizenzen und die Bedingungen jeder Website.
- robots.txt: Prüfen Sie die Crawl-Berechtigung für jede Ziel-URL.
- Personenbezogene Daten: Minimieren Sie Namen, Kontaktdaten und andere personenbezogene Informationen. Erfassen oder speichern Sie sie nicht, wenn sie nicht benötigt werden.
- Herkunftsnachweise: Bewahren Sie Quell-URL und Erfassungszeitpunkt auf, um später Lizenzen zu prüfen und Widersprüche gegen die Nutzung zu berücksichtigen.
- Qualität: Schließen Sie Standardbausteine, Duplikate, maschinelles Übersetzungsrauschen und schädliche Inhalte von Trainingsdaten aus.
Erfassung mit Octoparse und MCP
Octoparse rendert Seiten in einem sichtbaren, echten Browser und kann daher auch dynamisch per JavaScript erzeugte Texte erfassen. Erstellen Sie einen Workflow, der die Ermittlung über Listen oder Suche von der Extraktion von Fließtext und Metadaten trennt. Führen Sie ihn nach einem Cloud-Zeitplan aus, um Trainingsdaten aktuell zu halten. Verwenden Sie den Octoparse MCP Server, um Daten direkt über einen KI-Agenten zu erfassen: Ein MCP-fähiger KI-Client kann in natürlicher Sprache Vorlagen suchen, Aufgaben ausführen und Daten abrufen. Für die allgemeine Inhaltsextraktion eignet sich die universelle Vorlage zur Inhaltsextraktion für beliebige Webseiten.Verwandte Ressourcen
- Datenerfassung durch einen KI-Agenten ausführen (MCP Server) – ein MCP-fähiger Client erfasst Octoparse-Daten direkt
- JavaScript-gerenderte Seiten scrapen – Ansätze für dynamische Inhalte
- Paginierung handhaben – große Seitenmengen abdecken
- Extrahierte Daten verfeinern und bereinigen – Text für das Training normalisieren
- Ist Web Scraping legal? – Rechtmäßigkeit und Erfassungsumfang