LLMs.txt, robots.txt e rastreadores de IA: o que cada arquivo realmente controla

Uma pergunta aparentemente simples surge com frequência: devemos adicionar llms.txt para que a inteligência artificial leia nosso site corretamente — e, ao mesmo tempo, não use nosso conteúdo para treinamento? Não existe um sim ou não universal. Três coisas diferentes foram misturadas: acesso dos rastreadores, visibilidade na pesquisa e instruções para agentes de IA.

Separá-las importa mais do que o próprio arquivo. Caso contrário, podemos bloquear tráfego que queremos e ainda deixar de obter a proteção esperada.

Primeiro esclareça o que você quer alcançar

  • Quero que o Google ou o ChatGPT Search encontre a página. Cuide da indexação, do SEO técnico e das regras do rastreador de pesquisa específico.
  • Não quero fornecer conteúdo para treinamento de modelos. Cuide do rastreador de treinamento e dos termos do serviço.
  • Quero oferecer a um agente um mapa conciso da documentação. É aqui que llms.txt pode fazer sentido.
  • Quero proteger conteúdo não público. Nenhum arquivo de texto é suficiente. Você precisa de autenticação, autorização e segurança real.

Essas decisões são tecnicamente independentes. O rastreador de pesquisa de uma empresa e seu rastreador de treinamento podem ter nomes e regras diferentes.

O que llms.txt é — e o que não é

LLMs.txt é uma proposta de um arquivo Markdown simples na raiz de um site. Ele oferece a um agente uma descrição curta e links para fontes importantes. Para uma documentação extensa, pode ser um diretório: produto, API, termos e procedimentos comuns.

Ele não é uma política de acesso. Não informa de forma autoritativa quem pode usar o conteúdo para treinamento, não impede o download de uma página nem garante citação nos resultados. O Google afirma explicitamente que nenhum arquivo especial de IA é necessário para seus recursos de IA na Pesquisa e que llms.txt não acrescenta nada à Pesquisa Google.

Em um site empresarial, eu o implementaria quando pudéssemos manter uma lista de fontes curta, precisa e útil — não como um gesto vazio de SEO. Um mapa desatualizado é pior do que nenhum mapa, pois oferece preços inválidos, instruções antigas ou páginas removidas.

Robots.txt controla o rastreamento, não a confiança nem a segurança

O arquivo robots.txt informa aos rastreadores cooperantes onde eles podem ou não ir. Ele é público, suas regras dependem do user agent e não é um firewall contra um robô desobediente.

Bloquear em robots.txt não é uma forma confiável de remover uma URL de um mecanismo de pesquisa. O Google pode conhecer o endereço por meio de outros links mesmo sem conseguir ler seu conteúdo. Para dados não públicos, use login. Para uma página que não deve aparecer nos resultados, normalmente use noindex em uma URL rastreável ou o código de status apropriado.

Não existe um único interruptor para todos os robôs de IA

OpenAI: pesquisa e treinamento podem ser decididos separadamente

A OpenAI documenta rastreadores separados. OAI-SearchBot descobre conteúdo para a pesquisa do ChatGPT, enquanto GPTBot diz respeito ao possível uso para melhorar modelos generativos. Portanto, você pode permitir o primeiro e bloquear o segundo:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

ChatGPT-User identifica uma solicitação acionada por um usuário e não é um mecanismo para inclusão na pesquisa. Leia os termos atuais do provedor em vez de copiar uma lista antiga de user agents.

Google: Search e Google-Extended não são a mesma coisa

De acordo com a documentação da Pesquisa Google, as Visões gerais de IA e o Modo IA usam o índice de pesquisa e seus sistemas. O acesso do Googlebot afeta, portanto, a pesquisa comum e a elegibilidade para esses recursos.

Google-Extended é um token de produto separado para usar conteúdo na melhoria dos modelos Gemini e para fundamentação em alguns produtos. O Google afirma que bloqueá-lo não afeta a inclusão nem a classificação na Pesquisa. Ele não substitui as regras do Googlebot.

Outros serviços têm suas próprias regras

A Anthropic diferencia ClaudeBot, Claude-SearchBot e o carregamento iniciado pelo usuário. A Perplexity descreve PerplexityBot para seu índice de pesquisa. Nomes e finalidades podem mudar. Mantenha uma lista dos serviços importantes e confira-a na documentação primária deles.

Como eu decidiria em um site empresarial

  1. Anote o objetivo do negócio. Quero tráfego orgânico, citações, proteção de conteúdo pago ou tudo isso com regras diferentes?
  2. Verifique a base técnica. URLs canônicas, indexação, códigos de status, sitemap e links internos. Nenhum arquivo especial salva uma base ausente.
  3. Separe os rastreadores por finalidade. Pesquisa, treinamento e carregamento acionado pelo usuário são categorias diferentes.
  4. Proteja de verdade os dados não públicos. Ofertas para clientes, administração e documentos internos não ficam protegidos apenas por instruir um robô.
  5. Adicione LLMs.txt somente com um responsável pelo conteúdo. Alguém precisa garantir que os links e as descrições continuem precisos.
  6. Meça o resultado. Monitore logs, Search Console e visitas de fontes relevantes; a existência do arquivo não representa uma otimização concluída.

Se você quer se tornar uma fonte para respostas de IA, comece pelo conteúdo e pelas evidências, não por um arquivo na raiz do site. Discuto isso em Como a IA e o Google escolhem fontes. Para revisar as configurações dos rastreadores sem arriscar o tráfego orgânico, use a página de contato.

Precisa de clareza no marketing?

Primeiro, vamos esclarecer a situação.

Se sua empresa estiver diante de uma decisão semelhante, envie-me brevemente o contexto. Vamos avaliar se faz sentido continuar.

Descreva a situação