Skip to main content
L’addestramento, il fine-tuning e la RAG (retrieval-augmented generation) richiedono tutti grandi quantità di dati adatti allo scopo. Il web scraping permette di raccogliere dal web testi pubblici, dati strutturati, recensioni e informazioni di settore, in modo continuativo e in un formato utilizzabile da un modello. L’obiettivo non è acquisire il maggior numero possibile di pagine, ma stabilire quali fonti sono adatte al modello di destinazione, quali campi conservare, come normalizzare ed eliminare i duplicati e se la raccolta è corretta in termini di licenze, termini di servizio e dati personali.

Fonti di dati comuni

Per la RAG, raccogli articoli e documenti del settore di destinazione, quindi suddividi il corpo del testo in blocchi e archivialo insieme ai metadati. Per un modello di analisi del sentiment, raccogli il testo e il punteggio delle recensioni come dati etichettati.

Progettazione dei campi e dei dati

I dati di addestramento devono conservare provenienza e contesto, non soltanto il corpo del testo. Campi da conservare per addestramento e RAG:
  • Corpo del testo (ripulito)
  • Titolo, intestazioni e struttura delle sezioni
  • Date di pubblicazione e aggiornamento
  • Categoria, tag e lingua
  • URL di origine
  • Data e ora della raccolta
Campi da conservare per qualità e tracciabilità:
  • Informazioni su licenza e termini di servizio (diritti di riutilizzo)
  • Indicatori di autorevolezza del contenuto (dominio, autore)
  • Hash o testo normalizzato per la deduplicazione
  • Condizioni di raccolta (query, ambito, campionamento)
Conserva un URL di origine e la data e l’ora di raccolta in ogni riga. Potrai così risalire alla provenienza dei dati di addestramento e, in seguito, verificare le licenze, eliminare i duplicati, gestire le richieste di esclusione e aggiornare il dataset.

Flusso di raccolta

  1. Scegli fonti di dati adatte al modello e all’attività di destinazione.
  2. Individua le pagine di destinazione (ricerca, categorie, sitemap, pagine di elenco).
  3. Estrai corpo del testo e metadati (escludendo navigazione, annunci ed elementi ripetuti).
  4. Normalizza e ripulisci il testo (rimuovi l’HTML, correggi gli spazi, uniforma la codifica).
  5. Elimina i duplicati (in base a URL, testo normalizzato o hash).
  6. Filtra in base alla qualità (escludi contenuti troppo brevi, nella lingua errata o costituiti da testo standard ripetuto).
  7. Prepara il formato per l’addestramento (JSONL, blocchi con metadati e così via).
Separare l’individuazione dall’estrazione rende più semplice elaborare in parallelo un gran numero di pagine.

Qualità e conformità

La raccolta dati per AI e LLM deve essere progettata tenendo conto sia della qualità sia delle licenze.
  • Copyright e termini di servizio: la possibilità di riutilizzare il corpo del testo è distinta dalla possibilità di raccoglierlo. Controlla le licenze e i termini di ogni sito.
  • robots.txt: verifica l’autorizzazione al crawling per ogni URL di destinazione.
  • Dati personali: riduci al minimo nomi, recapiti e altri dati personali; non raccoglierli né archiviarli se non sono necessari.
  • Registri di provenienza: conserva l’URL di origine e la data e l’ora di raccolta per poter verificare le licenze e gestire in seguito le richieste di esclusione.
  • Qualità: escludi dai dati di addestramento testo standard ripetuto, duplicati, traduzioni automatiche di scarsa qualità e contenuti dannosi.
Il fatto che i dati siano pubblici e possano essere raccolti non significa che possano essere riutilizzati come dati di addestramento. Tratta il corpo di testi protetti da copyright e i dati contenenti informazioni personali solo dopo aver verificato le licenze e la normativa applicabile. Questa pagina offre una panoramica generale e non costituisce una consulenza legale.

Raccolta con Octoparse e MCP

Octoparse esegue il rendering delle pagine in un browser reale con interfaccia grafica, quindi può raccogliere anche il testo generato dinamicamente con JavaScript. Crea un flusso di lavoro che separi l’individuazione (elenchi, ricerca) dall’estrazione (corpo del testo, metadati) ed eseguilo nel cloud secondo una pianificazione per mantenere aggiornati i dati di addestramento. Per raccogliere dati direttamente da un agente AI, usa Octoparse MCP Server: un client AI compatibile con MCP può cercare modelli, eseguire attività e recuperare dati tramite il linguaggio naturale. Per l’estrazione di contenuti generici, il modello universale per l’estrazione di contenuti funziona con qualsiasi pagina web.

Risorse correlate