Vai al contenuto

Crawler

Un crawler, noto anche come spider o bot, è un programma software che i motori di ricerca utilizzano per scansionare il web.

I crawler navigano da un sito all’altro, da una pagina all’altra, raccogliendo e indicizzando le informazioni. Questo processo, noto come crawling, è la prima parte di ciò che fa un motore di ricerca per presentare i risultati di ricerca pertinenti. Uno dei più noti crawler è Googlebot, che è il bot di ricerca di Google.

Ai crawler dei motori di ricerca si sono aggiunti i crawler AI, che raccolgono contenuti per addestrare i modelli o per recuperare fonti nel momento in cui la risposta viene costruita: GPTBot e OAI-SearchBot di OpenAI, ClaudeBot, PerplexityBot, e per Google il token Google-Extended, che regola l’uso dei contenuti nell’addestramento senza toccare l’indicizzazione.

La distinzione conta perché la scelta non è più unica: si può escludere l’addestramento e restare disponibili per le risposte generate dal vivo, o il contrario. Le regole si scrivono nel robots.txt, e prima di scriverle conviene leggere i log del server per sapere chi passa davvero, con che frequenza e su quali sezioni.

Approfondimento sul blog Crawling: cos’è, come funziona e perché serve la scansione Inizia tutto da qui. È grazie al crawling che i motori di ricerca come Google riescono a scoprire, esplorare e organizzare i contenuti presenti sul web, navigando il web, i miliardi di pagine connesse e… Leggi la guida sul blog

Il mercato non aspetta.
Prendi il controllo adesso.

L’unica piattaforma per presidiare Google e i Motori AI.

  • Piattaforma
    completa (anche in trial)
  • Demo strategica
    con un esperto
  • Assistenza
    Italiana