LLMs.txt, robots.txt og AI-søkeroboter: hva hver fil faktisk styrer

Et tilsynelatende enkelt spørsmål dukker ofte opp: Bør vi legge til llms.txt slik at kunstig intelligens leser nettstedet vårt riktig – og samtidig ikke tar innholdet vårt til trening? Det finnes ikke et universelt ja eller nei. Tre forskjellige ting har blitt blandet sammen: tilgang for søkeroboter, synlighet i søk og veiledning for AI-agenter.

Det er viktigere å skille dem fra hverandre enn å fokusere på selve filen. Ellers kan vi blokkere trafikk vi ønsker, samtidig som vi ikke oppnår beskyttelsen vi forventet.

Avklar først hva du vil oppnå

  • Jeg vil at Google eller ChatGPT Search skal finne siden. Håndter indeksering, teknisk SEO og reglene for den aktuelle søkeroboten.
  • Jeg vil ikke levere innhold til modelltrening. Håndter treningsroboten og tjenestens vilkår.
  • Jeg vil tilby en agent et kort dokumentasjonskart. Det er her llms.txt kan gi mening.
  • Jeg vil beskytte ikke-offentlig innhold. Ingen tekstfil er tilstrekkelig. Du trenger autentisering, autorisasjon og reell sikkerhet.

Disse beslutningene er teknisk uavhengige. En bedrifts søkerobot og treningsrobot kan ha forskjellige navn og regler.

Hva llms.txt er – og ikke er

LLMs.txt er et forslag til en enkel Markdown-fil i roten av et nettsted. Den gir en agent en kort beskrivelse og lenker til viktige kilder. For omfattende dokumentasjon kan det være en katalog: produkt, API, vilkår og vanlige prosedyrer.

Det er ikke en tilgangspolicy. Den sier ikke autoritativt hvem som kan bruke innhold til trening, hindrer ikke nedlasting av en side og garanterer ikke sitering i resultater. Google sier uttrykkelig at det ikke trengs en egen AI-fil for AI-funksjonene i Søk, og at llms.txt ikke tilfører noe til Google Søk.

På et bedriftsnettsted ville jeg tatt den i bruk når vi kan vedlikeholde en kort, nøyaktig og nyttig kildeliste – ikke som en tom SEO-handling. Et utdatert kart er verre enn ingenting, fordi det viser ugyldige priser, gamle instruksjoner eller fjernede sider.

Robots.txt styrer crawling, ikke tillit eller sikkerhet

Filen robots.txt forteller samarbeidende søkeroboter hvor de kan eller ikke kan gå. Den er offentlig, reglene avhenger av brukeragenten, og den er ikke en brannmur mot en ulydig robot.

Blokkering av en URL i robots.txt er ikke en pålitelig måte å fjerne den fra en søkemotor på. Google kan kjenne adressen fra andre lenker selv om den ikke kan lese innholdet. For ikke-offentlige data bør du bruke innlogging. For en side som ikke skal vises i resultater, bruker du vanligvis noindex på en URL som kan gjennomsøkes, eller riktig statuskode.

Det finnes ingen enkeltbryter for alle AI-roboter

OpenAI: søk og trening kan avgjøres separat

OpenAI dokumenterer separate søkeroboter. OAI-SearchBot oppdager innhold for ChatGPT-søk, mens GPTBot gjelder mulig bruk til å forbedre generative modeller. Du kan derfor tillate den første og blokkere den andre:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

ChatGPT-User identifiserer en forespørsel utløst av en bruker og er ikke en mekanisme for å bli inkludert i søk. Les leverandørens gjeldende vilkår i stedet for å kopiere en gammel liste over brukeragenter.

Google: Søk og Google-Extended er ikke det samme

Ifølge Googles søkedokumentasjon bruker AI Overviews og AI Mode søkeindeksen og systemene dens. Tilgang for Googlebot påvirker derfor vanlig søk og om innholdet kan kvalifisere for disse funksjonene.

Google-Extended er et separat produkttoken for bruk av innhold til å forbedre Gemini-modeller og for forankring i enkelte produkter. Google sier at blokkering av den ikke påvirker inkludering eller rangering i Søk. Den erstatter ikke reglene for Googlebot.

Andre tjenester har egne regler

Anthropic skiller mellom ClaudeBot, Claude-SearchBot og brukerinitiert lasting. Perplexity beskriver PerplexityBot for sin søkeindeks. Navn og formål kan endre seg. Hold en liste over viktige tjenester og kontroller den mot deres primærdokumentasjon.

Slik ville jeg tatt beslutningen for et bedriftsnettsted

  1. Skriv ned forretningsmålet. Ønsker jeg organisk trafikk, siteringer, beskyttelse av betalt innhold eller alt dette med forskjellige regler?
  2. Kontroller det tekniske grunnlaget. Kanoniske URL-er, indeksering, statuskoder, sitemap og interne lenker. Ingen spesialfil kan redde et manglende grunnlag.
  3. Skill søkerobotene etter formål. Søk, trening og brukerutløst lasting er forskjellige kategorier.
  4. Sikre ikke-offentlige data på ordentlig. Kundetilbud, administrasjon og interne dokumenter er ikke beskyttet bare ved å instruere en robot.
  5. Legg til LLMs.txt bare med en innholdsansvarlig. Noen må sørge for at lenker og beskrivelser forblir korrekte.
  6. Mål resultatet. Følg med på logger, Search Console og besøk fra relevante kilder; at filen finnes, er ikke en ferdig optimalisering.

Hvis du vil bli en kilde til AI-svar, bør du begynne med innhold og dokumentasjon i stedet for en fil i roten av nettstedet. Jeg diskuterer dette i Hvordan AI og Google velger kilder. For å gjennomgå innstillingene for søkeroboter uten å risikere organisk trafikk kan du bruke kontaktsiden.

Trenger du klarhet i markedsføringen?

La oss først gjøre situasjonen tydelig.

Hvis bedriften din står overfor en lignende beslutning, kan du sende meg litt kontekst. Så ser vi om det gir mening å fortsette.

Beskriv situasjonen