Skip to main content
Il blocco basato sull’IP è la più antica difesa anti-scraping e rimane una delle più comuni. Un sito può contare le richieste provenienti da un indirizzo IP, confrontarlo con database di reputazione, bloccare interi intervalli di hosting o mostrare un CAPTCHA quando il traffico da una sola origine appare troppo automatizzato. La rotazione dei Proxy distribuisce le richieste su più indirizzi IP. Se usata correttamente, riduce la pressione su ogni singolo IP e consente a un web scraper di operare con schemi più simili alla normale navigazione. Se usata male, crea un segnale bot ancora più evidente: migliaia di richieste provenienti da identità incoerenti, di bassa qualità o in continuo cambiamento.

Che cosa cambia un Proxy

Un Proxy si interpone tra il web scraper e il sito di destinazione. Il sito vede l’indirizzo IP del Proxy anziché la connessione diretta dell’operatore. Questo aiuta a risolvere diversi problemi di scraping:
  • Limiti di frequenza. Le richieste possono essere distribuite invece di concentrarsi su un unico IP.
  • Blocchi IP. Un IP bloccato può essere rimosso dal pool.
  • Restrizioni geografiche. Un’attività può usare un IP della regione in cui il contenuto è disponibile.
  • Privacy operativa. L’IP locale dell’operatore non viene esposto a ogni sito di destinazione.
  • Parallelismo nel cloud. Le attività secondarie possono essere eseguite attraverso percorsi di rete separati anziché competere su un solo indirizzo.
I Proxy non correggono selettori errati, impaginazioni non funzionanti o automazioni del browser troppo evidenti. Sono uno strato dello stack di scalabilità, non una strategia anti-bot completa.

Tipi di Proxy

Proxy datacenter

I Proxy datacenter provengono da provider di hosting e infrastrutture cloud. Sono veloci, economici e facili da acquistare in grandi quantità. Funzionano bene per siti poco protetti, directory pubbliche e destinazioni interessate soprattutto al volume delle richieste. Rendono meno sui siti che bloccano intervalli di hosting noti o si aspettano traffico residenziale.

Proxy residenziali

I Proxy residenziali instradano il traffico attraverso IP associati ai provider Internet dei consumatori. Assomigliano maggiormente al normale traffico degli utenti e spesso hanno più successo con e-commerce, motori di ricerca, viaggi e altri siti protetti. Il compromesso riguarda il costo e l’etica. Usa provider in grado di spiegare come viene creato il loro pool di IP e se gli utenti hanno fornito il consenso. Un pool residenziale di bassa qualità può causare problemi legali, di privacy e di affidabilità.

Proxy ISP

I Proxy ISP si collocano tra datacenter e residenziali. Sono ospitati come i Proxy datacenter, ma registrati presso provider di servizi Internet. In genere sono più stabili degli IP residenziali a rotazione e meno sospetti dei normali intervalli dei datacenter. Sono utili quando un web scraper ha bisogno di sessioni persistenti, una posizione geografica stabile e una reputazione migliore rispetto a un IP di hosting cloud.

Proxy mobili

I Proxy mobili instradano il traffico attraverso le reti degli operatori telefonici. Possono godere di grande fiducia, perché molti utenti mobili reali condividono IP NAT di livello carrier. Sono però costosi e spesso sovradimensionati. Usa i Proxy mobili soltanto quando il sito di destinazione è progettato principalmente per dispositivi mobili o quando gli altri tipi di Proxy falliscono regolarmente.

Strategie di rotazione

La rotazione dei Proxy non significa sempre “un nuovo IP a ogni richiesta”. La strategia giusta dipende dal sito e dal flusso di lavoro.

Rotazione per richiesta

Ogni richiesta usa un IP diverso. Può funzionare per pagine senza stato, come pagine pubbliche di risultati di ricerca o semplici elenchi di prodotti. È rischiosa per le sessioni che dipendono da Cookie, carrelli, stato di accesso o coerenza geografica. Cambiare IP troppo spesso può apparire sospetto.

Sessioni persistenti

Un worker mantiene lo stesso IP per un determinato periodo o per l’intera durata della sessione. In genere è la scelta migliore per siti che usano molto JavaScript, aree con accesso, flussi di impaginazione e qualsiasi attività in cui il sito si aspetti continuità. Ad esempio, un web scraper può mantenere lo stesso IP mentre esegue una ricerca, apre diverse pagine di risultati ed estrae i dettagli, quindi cambiarlo prima di passare alla parola chiave o categoria successiva.

Rotazione a livello di attività

Ogni attività secondaria riceve una propria identità Proxy. Una categoria, città, parola chiave o batch di URL viene elaborato tramite un IP o un piccolo pool. Questo approccio si integra bene con l’Estrazione cloud, perché le attività secondarie costituiscono già confini naturali per il parallelismo.

Rotazione geolocalizzata

La regione del Proxy viene selezionata intenzionalmente. Un’attività che raccoglie prezzi negli Stati Uniti dovrebbe usare IP statunitensi; un’attività che confronta la disponibilità tra paesi dovrebbe suddividere il lavoro per regione. Il fuso orario e la lingua del browser devono corrispondere all’area geografica scelta.

Abbinare i Proxy ai casi d’uso

Il punto fondamentale è far corrispondere l’identità di rete al comportamento di navigazione. Un pool di Proxy a rotazione funziona al meglio quando fingerprint del browser, lingua, fuso orario, ritmo delle richieste e comportamento della sessione sono tutti coerenti con l’IP usato.

Errori comuni

  • Rotazione troppo frequente. Un nuovo IP a ogni clic può sembrare meno umano, non più umano.
  • Trascurare la qualità degli IP. IP economici già bloccati possono aumentare la frequenza dei CAPTCHA.
  • Mescolare le aree geografiche. Un IP tedesco con fuso orario statunitense e intestazioni in giapponese è incoerente.
  • Cambiare IP durante l’accesso. Le sessioni autenticate dovrebbero generalmente rimanere persistenti.
  • Scalare troppo rapidamente. Un maggior numero di Proxy non rende più sicuro lo scraping di un sito già sovraccarico.
  • Considerare i Proxy come una garanzia di legalità. Un Proxy modifica l’instradamento di rete; non cambia autorizzazioni, termini di servizio, obblighi di privacy o considerazioni relative a robots.txt.

Come lo gestiscono le piattaforme visuali

Le piattaforme di scraping integrate spesso rendono la rotazione dei Proxy parte delle Impostazioni dell’attività anziché un’infrastruttura personalizzata. Octoparse, ad esempio, documenta la rotazione IP per le Esecuzioni nel cloud, i Proxy residenziali integrati per i flussi di lavoro locali e cloud e i Proxy HTTP forniti dall’utente per le Esecuzioni locali. Il suo modello di Estrazione cloud può suddividere un’attività in attività secondarie eseguite su più Server cloud, in modo che il traffico non si concentri dietro un unico IP locale. Ciò che conta è il principio generale: la configurazione dei Proxy dovrebbe trovarsi accanto alla strategia di esecuzione dell’attività. Un web scraper che suddivide il lavoro in attività secondarie, pianifica le esecuzioni, gestisce le sessioni del browser e ruota i percorsi di rete in un unico ambiente è più facile da utilizzare rispetto a uno in cui ogni livello deve essere collegato separatamente.

Regola pratica

Usa la strategia Proxy meno complessa che funziona. Per destinazioni a basso rischio, inizia con un ritmo normale e senza Proxy. Aggiungi Proxy datacenter quando il volume è l’unico problema. Passa a Proxy residenziali o ISP quando conta la reputazione. Usa sessioni persistenti ogni volta che il sito si aspetta continuità. Riserva i Proxy mobili e la rotazione aggressiva ai casi che ne giustificano davvero il costo e la complessità.