Crawler
Un crawler, noto anche come spider o bot, è un programma software che i motori di ricerca utilizzano per scansionare il web.
I crawler navigano da un sito all’altro, da una pagina all’altra, raccogliendo e indicizzando le informazioni. Questo processo, noto come crawling, è la prima parte di ciò che fa un motore di ricerca per presentare i risultati di ricerca pertinenti. Uno dei più noti crawler è Googlebot, che è il bot di ricerca di Google.
Ai crawler dei motori di ricerca si sono aggiunti i crawler AI, che raccolgono contenuti per addestrare i modelli o per recuperare fonti nel momento in cui la risposta viene costruita: GPTBot e OAI-SearchBot di OpenAI, ClaudeBot, PerplexityBot, e per Google il token Google-Extended, che regola l’uso dei contenuti nell’addestramento senza toccare l’indicizzazione.
La distinzione conta perché la scelta non è più unica: si può escludere l’addestramento e restare disponibili per le risposte generate dal vivo, o il contrario. Le regole si scrivono nel robots.txt, e prima di scriverle conviene leggere i log del server per sapere chi passa davvero, con che frequenza e su quali sezioni.