Spesso si presenta una domanda apparentemente semplice: dobbiamo aggiungere llms.txt affinché l’intelligenza artificiale legga correttamente il nostro sito web e, allo stesso tempo, non utilizzi i nostri contenuti per l’addestramento? Non esiste un sì o un no universale. Sono state mescolate tre cose diverse: accesso dei crawler, visibilità nella ricerca e indicazioni per gli agenti AI.
Separarle è più importante del file stesso. Altrimenti potremmo bloccare il traffico che desideriamo, senza ottenere la protezione che ci aspettavamo.
Chiarisci prima cosa vuoi ottenere
- Voglio che Google o ChatGPT Search trovino la pagina. Occorre intervenire su indicizzazione, SEO tecnica e regole del crawler specifico.
- Non voglio fornire contenuti per l’addestramento dei modelli. Occorre intervenire sul crawler di addestramento e sui termini del servizio.
- Voglio offrire a un agente una mappa concisa della documentazione. È qui che
llms.txtpuò avere senso. - Voglio proteggere contenuti non pubblici. Nessun file di testo è sufficiente. Servono autenticazione, autorizzazione e sicurezza reale.
Queste decisioni sono tecnicamente indipendenti. Il crawler di ricerca e quello di addestramento di un’azienda possono avere nomi e regole diversi.
Cosa è e cosa non è llms.txt
LLMs.txt è una proposta per un semplice file Markdown nella radice di un sito web. Offre a un agente una breve descrizione e link a fonti importanti. Per una documentazione estesa può essere una directory: prodotto, API, termini e procedure comuni.
Non è una politica di accesso. Non stabilisce in modo autorevole chi può usare i contenuti per l’addestramento, non impedisce di scaricare una pagina e non garantisce la citazione nei risultati. Google afferma esplicitamente che per le sue funzioni AI nella Ricerca non serve alcun file AI speciale e che llms.txt non aggiunge nulla a Google Search.
Su un sito aziendale lo implementerei quando possiamo mantenere un elenco di fonti breve, accurato e utile, non come gesto SEO vuoto. Una mappa obsoleta è peggiore di nessuna mappa perché offre prezzi non validi, istruzioni vecchie o pagine rimosse.
Robots.txt controlla il crawling, non la fiducia o la sicurezza
Il file robots.txt indica ai crawler collaborativi dove possono o non possono andare. È pubblico, le sue regole dipendono dallo user agent e non è un firewall contro un robot disobbediente.
Bloccare in robots.txt non è un modo affidabile per rimuovere un URL da un motore di ricerca. Google può conoscere l’indirizzo da altri link anche se non riesce a leggerne il contenuto. Per i dati non pubblici usa l’accesso autenticato. Per una pagina che non dovrebbe apparire nei risultati, in genere usa noindex su un URL accessibile al crawling o il codice di stato appropriato.
Non esiste un unico interruttore per tutti i robot AI
OpenAI: ricerca e addestramento possono essere decisi separatamente
OpenAI documenta crawler separati. OAI-SearchBot individua i contenuti per la ricerca di ChatGPT, mentre GPTBot riguarda il possibile utilizzo per migliorare i modelli generativi. Puoi quindi consentire il primo e bloccare il secondo:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /ChatGPT-User identifica una richiesta attivata da un utente e non è un meccanismo per l’inclusione nella ricerca. Leggi i termini aggiornati del provider invece di copiare un vecchio elenco di user agent.
Google: Search e Google-Extended non sono la stessa cosa
Secondo la documentazione di Google Search, AI Overviews e AI Mode utilizzano l’indice di ricerca e i relativi sistemi. L’accesso di Googlebot influisce quindi sulla ricerca ordinaria e sull’idoneità a queste funzioni.
Google-Extended è un token di prodotto separato per usare i contenuti nel miglioramento dei modelli Gemini e per il grounding in alcuni prodotti. Google afferma che bloccarlo non influisce sull’inclusione o sul posizionamento nella Ricerca. Non sostituisce le regole per Googlebot.
Gli altri servizi hanno regole proprie
Anthropic distingue ClaudeBot, Claude-SearchBot e il caricamento avviato dall’utente. Perplexity descrive PerplexityBot per il proprio indice di ricerca. Nomi e finalità possono cambiare. Mantieni un elenco dei servizi importanti e confrontalo con la loro documentazione primaria.
Come deciderei per un sito aziendale
- Metti per iscritto l’obiettivo aziendale. Voglio traffico organico, citazioni, protezione dei contenuti a pagamento o tutto questo con regole diverse?
- Controlla le basi tecniche. URL canonici, indicizzazione, codici di stato, sitemap e link interni. Nessun file speciale può compensare fondamenta mancanti.
- Separa i crawler in base allo scopo. Ricerca, addestramento e caricamento avviato dall’utente sono categorie diverse.
- Proteggi davvero i dati non pubblici. Offerte ai clienti, amministrazione e documenti interni non sono protetti semplicemente impartendo istruzioni a un robot.
- Aggiungi LLMs.txt solo con un responsabile dei contenuti. Qualcuno deve assicurarsi che link e descrizioni restino accurati.
- Misura il risultato. Monitora i log, Search Console e le visite dalle fonti rilevanti; l’esistenza del file non equivale a un’ottimizzazione completata.
Se vuoi diventare una fonte per le risposte dell’IA, inizia da contenuti e prove invece che da un file nella radice del sito. Ne parlo in Come AI e Google scelgono le fonti. Per controllare le impostazioni dei crawler senza rischiare il traffico organico, usa la pagina dei contatti.