Em resumo: robots.txt é um arquivo de texto na raiz do host por meio do qual um site informa aos rastreadores compatíveis quais caminhos eles podem acessar. Ele não é uma ferramenta confiável para remover URLs de um índice.
Como uso robots.txt na prática
Na prática, não uso o termo robots.txt como mais um número para uma apresentação. Primeiro, determino qual decisão ele deve tornar mais precisa, em quais dados ou observações se baseia e quem mudará algo com base no resultado. Verifico o arquivo real em cada host, as regras para um user agent específico e se o bloqueio impede o conteúdo ou a diretiva noindex de ser acessado. Também registro a linha de base, a data da medição e os limites de interpretação. Assim, é possível distinguir mais tarde uma mudança genuína de uma alteração na ferramenta, na amostra ou na formulação da consulta.
O que observar
O maior risco é uma precisão apenas aparente. Uma URL bloqueada ainda pode aparecer nos resultados sem um snippet, porque o robô não lê seu noindex nem sua resposta de status. Por isso, comparo o resultado ao longo do tempo, em uma amostra estável e junto com o contexto do negócio. Se o termo não levar a um próximo passo concreto, ele não produziu uma análise, apenas um novo rótulo.
Perguntas para a tomada de decisão
- A qual robô a regra se aplica?
- Ela bloqueia CSS, JavaScript ou páginas importantes?
- A URL não deve ser rastreada ou realmente não deve ser indexada?
- O arquivo lista o sitemap correto?