A menudo surge una pregunta aparentemente sencilla: ¿Deberíamos añadir llms.txt para que la inteligencia artificial lea correctamente nuestro sitio web y, al mismo tiempo, no utilice nuestro contenido para entrenarse? No existe una respuesta universal de sí o no. Se han mezclado tres cosas distintas: el acceso de los rastreadores, la visibilidad en buscadores y las indicaciones para los agentes de IA.
Separarlas importa más que el propio archivo. De lo contrario, podemos bloquear tráfico que queremos mientras no conseguimos la protección que esperábamos.
Aclara primero qué quieres conseguir
- Quiero que Google o ChatGPT Search encuentren la página. Aborda la indexación, el SEO técnico y las reglas del rastreador de búsqueda correspondiente.
- No quiero proporcionar contenido para el entrenamiento de modelos. Aborda el rastreador de entrenamiento y las condiciones del servicio.
- Quiero ofrecer a un agente un mapa conciso de la documentación. Aquí
llms.txtpuede tener sentido. - Quiero proteger contenido no público. Ningún archivo de texto es suficiente. Necesitas autenticación, autorización y seguridad real.
Estas decisiones son técnicamente independientes. El rastreador de búsqueda de una empresa y su rastreador de entrenamiento pueden tener nombres y reglas diferentes.
Qué es —y qué no es— llms.txt
LLMs.txt es una propuesta de archivo Markdown sencillo en la raíz de un sitio web. Ofrece a un agente una breve descripción y enlaces a fuentes importantes. Para una documentación amplia puede ser un directorio: producto, API, condiciones y procedimientos habituales.
No es una política de acceso. No establece de forma autoritativa quién puede utilizar el contenido para entrenar modelos ni impide descargar una página, ni garantiza que se cite en los resultados. Google afirma explícitamente que no se necesita ningún archivo especial de IA para sus funciones de IA en la Búsqueda y que llms.txt no añade nada a Google Search.
En el sitio web de una empresa lo implementaría cuando pudiéramos mantener una lista de fuentes breve, precisa y útil; no como un gesto SEO vacío. Un mapa desactualizado es peor que no tener ninguno porque ofrece precios incorrectos, instrucciones antiguas o páginas eliminadas.
Robots.txt controla el rastreo, no la confianza ni la seguridad
El archivo robots.txt indica a los rastreadores que cooperan adónde pueden ir y adónde no. Es público, sus reglas dependen del agente de usuario y no es un cortafuegos contra un robot que no obedezca.
Bloquear en robots.txt no es una forma fiable de eliminar una URL de un buscador. Google puede conocer la dirección a través de otros enlaces aunque no pueda leer su contenido. Para datos no públicos, utiliza el inicio de sesión. Para una página que no deba aparecer en los resultados, normalmente utiliza noindex en una URL rastreable o el código de estado adecuado.
No existe un único interruptor para todos los robots de IA
OpenAI: la búsqueda y el entrenamiento pueden decidirse por separado
La documentación de OpenAI recoge rastreadores separados. OAI-SearchBot descubre contenido para la búsqueda de ChatGPT, mientras que GPTBot se refiere a un posible uso para mejorar los modelos generativos. Por tanto, puedes permitir el primero y bloquear el segundo:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /ChatGPT-User identifica una solicitud activada por un usuario y no es un mecanismo para aparecer en los resultados de búsqueda. Lee las condiciones actuales del proveedor en lugar de copiar una lista antigua de agentes de usuario.
Google: Search y Google-Extended no son lo mismo
Según la documentación de Google Search, las vistas generales de IA y el modo IA utilizan el índice de búsqueda y sus sistemas. Por tanto, el acceso de Googlebot afecta a la búsqueda normal y a la posibilidad de aparecer en estas funciones.
Google-Extended es un token de producto independiente para utilizar contenido con el fin de mejorar los modelos Gemini y para fundamentar las respuestas en algunos productos. Google afirma que bloquearlo no afecta a la inclusión ni a la clasificación en la Búsqueda. No sustituye a las reglas de Googlebot.
Otros servicios tienen sus propias reglas
Anthropic distingue entre ClaudeBot, Claude-SearchBot y la carga iniciada por el usuario. Perplexity describe PerplexityBot para su índice de búsqueda. Los nombres y las finalidades pueden cambiar. Mantén una lista de los servicios importantes y compárala con su documentación principal.
Cómo decidiría en el sitio web de una empresa
- Anoto el objetivo de negocio. ¿Quiero tráfico orgánico, citas, proteger contenido de pago o todo ello con reglas diferentes?
- Comprueba los fundamentos técnicos. URL canónicas, indexación, códigos de estado, mapa del sitio y enlaces internos. Ningún archivo especial puede salvar unos fundamentos inexistentes.
- Separa los rastreadores por finalidad. La búsqueda, el entrenamiento y la carga activada por el usuario son categorías diferentes.
- Protege de verdad los datos no públicos. Las ofertas para clientes, la administración y los documentos internos no están protegidos simplemente dando instrucciones a un robot.
- Añade LLMs.txt solo con un responsable del contenido. Alguien debe asegurarse de que los enlaces y las descripciones sigan siendo precisos.
- Mide el resultado. Supervisa los registros, Search Console y las visitas procedentes de fuentes relevantes; la existencia del archivo no equivale a una optimización terminada.
Si quieres convertirte en una fuente para las respuestas de IA, empieza por el contenido y las pruebas, no por un archivo en la raíz del sitio web. Lo explico en Cómo eligen las fuentes la IA y Google. Para revisar la configuración de los rastreadores sin poner en riesgo el tráfico orgánico, utiliza la página de contacto.