En till synes enkel fråga dyker ofta upp: Bör vi lägga till llms.txt så att artificiell intelligens läser vår webbplats korrekt – och samtidigt inte använder vårt innehåll för träning? Det finns inget universellt ja eller nej. Tre olika saker har blandats ihop: crawleråtkomst, synlighet i sökresultat och vägledning för AI-agenter.
Det är viktigare att skilja dem åt än att fokusera på själva filen. Annars kan vi blockera trafik som vi vill ha, samtidigt som vi inte får det skydd vi förväntade oss.
Klargör först vad du vill uppnå
- Jag vill att Google eller ChatGPT Search ska hitta sidan. Hantera indexering, teknisk SEO och reglerna för den aktuella sökcrawlern.
- Jag vill inte tillhandahålla innehåll för modellträning. Hantera träningscrawlern och tjänstens villkor.
- Jag vill erbjuda en agent en kortfattad dokumentationskarta. Det är här
llms.txtkan vara meningsfullt. - Jag vill skydda icke-offentligt innehåll. Ingen textfil räcker. Du behöver autentisering, behörighetskontroll och verklig säkerhet.
Dessa beslut är tekniskt oberoende av varandra. Ett företags sökcrawler och träningscrawler kan ha olika namn och regler.
Vad llms.txt är – och inte är
LLMs.txt är ett förslag på en enkel Markdown-fil i webbplatsens rot. Den erbjuder en agent en kort beskrivning och länkar till viktiga källor. För omfattande dokumentation kan det vara en katalog: produkt, API, villkor och vanliga procedurer.
Det är inte en åtkomstpolicy. Den anger inte auktoritativt vem som får använda innehåll för träning, hindrar inte nedladdning av en sida och garanterar inte citering i resultat. Google säger uttryckligen att ingen särskild AI-fil behövs för AI-funktionerna i Sök och att llms.txt inte tillför något till Google Search.
På en företagswebbplats skulle jag införa den när vi kan underhålla en kort, korrekt och användbar källista – inte som en tom SEO-åtgärd. En inaktuell karta är sämre än ingen, eftersom den erbjuder felaktiga priser, gamla instruktioner eller borttagna sidor.
Robots.txt styr crawling, inte förtroende eller säkerhet
Filen robots.txt talar om för samarbetande crawlers vart de får eller inte får gå. Den är offentlig, reglerna beror på user agent och den är ingen brandvägg mot en olydig robot.
Blockering i robots.txt är inte ett tillförlitligt sätt att ta bort en URL från en sökmotor. Google kan känna till adressen via andra länkar även om Google inte kan läsa innehållet. För icke-offentliga data använder du inloggning. För en sida som inte ska visas i resultaten använder du vanligtvis noindex på en crawlbar URL eller lämplig statuskod.
Det finns inget enda reglage för alla AI-robotar
OpenAI: sökning och träning kan beslutas separat
OpenAI dokumenterar separata crawlers. OAI-SearchBot upptäcker innehåll för ChatGPT-sökning, medan GPTBot kan användas för att förbättra generativa modeller. Du kan därför tillåta den första och blockera den andra:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /ChatGPT-User identifierar en förfrågan som utlöses av en användare och är inte en mekanism för att inkluderas i sökresultat. Läs leverantörens aktuella villkor i stället för att kopiera en gammal lista över user agents.
Google: Search och Google-Extended är inte samma sak
Enligt Googles sökdokumentation använder AI Overviews och AI Mode sökindexet och dess system. Googlebots åtkomst påverkar därför vanlig sökning och behörighet för dessa funktioner.
Google-Extended är en separat produkttoken för användning av innehåll för att förbättra Gemini-modeller och för att hämta kontext i vissa produkter. Google säger att blockering av den inte påverkar inkludering eller ranking i Sök. Den ersätter inte Googles regler för Googlebot.
Andra tjänster har egna regler
Anthropic skiljer mellan ClaudeBot, Claude-SearchBot och användarinitierad laddning. Perplexity beskriver PerplexityBot som en crawler för sitt sökindex. Namn och syften kan förändras. Håll en lista över viktiga tjänster och kontrollera den mot deras primära dokumentation.
Så skulle jag fatta beslut för en företagswebbplats
- Skriv ner affärsmålet. Vill jag ha organisk trafik, citeringar, skydd av betalt innehåll eller allt detta med olika regler?
- Kontrollera den tekniska grunden. Canonical-URL:er, indexering, statuskoder, sitemap och interna länkar. Ingen särskild fil kan rädda en bristande grund.
- Separera crawlers efter syfte. Sökning, träning och användarutlöst laddning är olika kategorier.
- Skydda icke-offentliga data på riktigt. Kundofferter, administration och interna dokument skyddas inte bara genom att instruera en robot.
- Lägg till LLMs.txt endast med en innehållsansvarig. Någon måste se till att länkar och beskrivningar förblir korrekta.
- Mät resultatet. Övervaka loggar, Search Console och besök från relevanta källor; filens existens innebär inte att optimeringen är slutförd.
Om du vill bli en källa för AI-svar bör du börja med innehåll och belägg, inte med en fil i webbplatsens rot. Jag diskuterar detta i Hur AI och Google väljer källor. Om du vill granska crawlerinställningar utan att riskera organisk trafik kan du använda kontaktsidan.