Termo de marketing em contexto

robots.txt

Em resumo: robots.txt é um arquivo de texto na raiz do host por meio do qual um site informa aos rastreadores compatíveis quais caminhos eles podem acessar. Ele não é uma ferramenta confiável para remover URLs de um índice.

Como uso robots.txt na prática

Na prática, não uso o termo robots.txt como mais um número para uma apresentação. Primeiro, determino qual decisão ele deve tornar mais precisa, em quais dados ou observações se baseia e quem mudará algo com base no resultado. Verifico o arquivo real em cada host, as regras para um user agent específico e se o bloqueio impede o conteúdo ou a diretiva noindex de ser acessado. Também registro a linha de base, a data da medição e os limites de interpretação. Assim, é possível distinguir mais tarde uma mudança genuína de uma alteração na ferramenta, na amostra ou na formulação da consulta.

O que observar

O maior risco é uma precisão apenas aparente. Uma URL bloqueada ainda pode aparecer nos resultados sem um snippet, porque o robô não lê seu noindex nem sua resposta de status. Por isso, comparo o resultado ao longo do tempo, em uma amostra estável e junto com o contexto do negócio. Se o termo não levar a um próximo passo concreto, ele não produziu uma análise, apenas um novo rótulo.

Perguntas para a tomada de decisão

  • A qual robô a regra se aplica?
  • Ela bloqueia CSS, JavaScript ou páginas importantes?
  • A URL não deve ser rastreada ou realmente não deve ser indexada?
  • O arquivo lista o sitemap correto?

Prática relacionada