Fonti di dati comuni
Per la RAG, raccogli articoli e documenti del settore di destinazione, quindi suddividi il corpo del testo in blocchi e archivialo insieme ai metadati. Per un modello di analisi del sentiment, raccogli il testo e il punteggio delle recensioni come dati etichettati.
Progettazione dei campi e dei dati
I dati di addestramento devono conservare provenienza e contesto, non soltanto il corpo del testo. Campi da conservare per addestramento e RAG:- Corpo del testo (ripulito)
- Titolo, intestazioni e struttura delle sezioni
- Date di pubblicazione e aggiornamento
- Categoria, tag e lingua
- URL di origine
- Data e ora della raccolta
- Informazioni su licenza e termini di servizio (diritti di riutilizzo)
- Indicatori di autorevolezza del contenuto (dominio, autore)
- Hash o testo normalizzato per la deduplicazione
- Condizioni di raccolta (query, ambito, campionamento)
Flusso di raccolta
- Scegli fonti di dati adatte al modello e all’attività di destinazione.
- Individua le pagine di destinazione (ricerca, categorie, sitemap, pagine di elenco).
- Estrai corpo del testo e metadati (escludendo navigazione, annunci ed elementi ripetuti).
- Normalizza e ripulisci il testo (rimuovi l’HTML, correggi gli spazi, uniforma la codifica).
- Elimina i duplicati (in base a URL, testo normalizzato o hash).
- Filtra in base alla qualità (escludi contenuti troppo brevi, nella lingua errata o costituiti da testo standard ripetuto).
- Prepara il formato per l’addestramento (JSONL, blocchi con metadati e così via).
Qualità e conformità
La raccolta dati per AI e LLM deve essere progettata tenendo conto sia della qualità sia delle licenze.- Copyright e termini di servizio: la possibilità di riutilizzare il corpo del testo è distinta dalla possibilità di raccoglierlo. Controlla le licenze e i termini di ogni sito.
- robots.txt: verifica l’autorizzazione al crawling per ogni URL di destinazione.
- Dati personali: riduci al minimo nomi, recapiti e altri dati personali; non raccoglierli né archiviarli se non sono necessari.
- Registri di provenienza: conserva l’URL di origine e la data e l’ora di raccolta per poter verificare le licenze e gestire in seguito le richieste di esclusione.
- Qualità: escludi dai dati di addestramento testo standard ripetuto, duplicati, traduzioni automatiche di scarsa qualità e contenuti dannosi.
Raccolta con Octoparse e MCP
Octoparse esegue il rendering delle pagine in un browser reale con interfaccia grafica, quindi può raccogliere anche il testo generato dinamicamente con JavaScript. Crea un flusso di lavoro che separi l’individuazione (elenchi, ricerca) dall’estrazione (corpo del testo, metadati) ed eseguilo nel cloud secondo una pianificazione per mantenere aggiornati i dati di addestramento. Per raccogliere dati direttamente da un agente AI, usa Octoparse MCP Server: un client AI compatibile con MCP può cercare modelli, eseguire attività e recuperare dati tramite il linguaggio naturale. Per l’estrazione di contenuti generici, il modello universale per l’estrazione di contenuti funziona con qualsiasi pagina web.Risorse correlate
- Eseguire la raccolta dati da un agente AI (MCP Server) — un client compatibile con MCP raccoglie direttamente i dati di Octoparse
- Estrarre dati da pagine con rendering JavaScript — metodi per i contenuti dinamici
- Come gestire l’impaginazione — elaborare un gran numero di pagine
- Perfezionare e ripulire i dati estratti — normalizzare il testo per l’addestramento
- Il web scraping è legale? — legalità e ambito della raccolta