Et tilsyneladende enkelt spørgsmål dukker ofte op: Bør vi tilføje llms.txt, så kunstig intelligens læser vores website korrekt – og samtidig ikke tager vores indhold til træning? Der findes ikke et universelt ja eller nej. Tre forskellige ting er blevet blandet sammen: crawleradgang, søgesynlighed og vejledning til AI-agenter.
Det er vigtigere at adskille dem end selve filen. Ellers kan vi blokere trafik, vi ønsker, uden at opnå den beskyttelse, vi forventede.
Afklar først, hvad du vil opnå
- Jeg vil have, at Google eller ChatGPT Search finder siden. Arbejd med indeksering, teknisk SEO og reglerne for den specifikke søgecrawler.
- Jeg vil ikke levere indhold til modeltræning. Arbejd med træningscrawleren og tjenestens vilkår.
- Jeg vil tilbyde en agent et kort dokumentationskort. Det er her,
llms.txtkan give mening. - Jeg vil beskytte ikke-offentligt indhold. Ingen tekstfil er tilstrækkelig. Du har brug for autentificering, autorisation og reel sikkerhed.
Disse beslutninger er teknisk uafhængige. En virksomheds søgecrawler og træningscrawler kan have forskellige navne og regler.
Hvad llms.txt er – og ikke er
LLMs.txt er et forslag til en simpel Markdown-fil i roden af et website. Den giver en agent en kort beskrivelse og links til vigtige kilder. Ved omfattende dokumentation kan det være en mappe: produkt, API, vilkår og almindelige procedurer.
Det er ikke en adgangspolitik. Den angiver ikke autoritativt, hvem der må bruge indhold til træning, forhindrer ikke download af en side og garanterer ikke citationer i resultater. Google siger udtrykkeligt, at der ikke kræves en særlig AI-fil til Googles AI-funktioner i Search, og at llms.txt ikke tilføjer noget til Google Search.
På et virksomhedswebsite ville jeg implementere den, når vi kan vedligeholde en kort, præcis og nyttig kildeliste – ikke som en tom SEO-gestus. Et forældet kort er værre end intet, fordi det tilbyder ugyldige priser, gamle instruktioner eller fjernede sider.
Robots.txt styrer crawling, ikke tillid eller sikkerhed
Filen robots.txt fortæller samarbejdende crawlere, hvor de må eller ikke må gå. Den er offentlig, dens regler afhænger af user agent, og den er ikke en firewall mod en ulydig robot.
Blokering i robots.txt er ikke en pålidelig måde at fjerne en URL fra en søgemaskine på. Google kan kende adressen fra andre links, selv om den ikke kan læse indholdet. Brug login til ikke-offentlige data. Brug typisk noindex på en crawlbar URL eller den passende statuskode til en side, der ikke skal vises i resultater.
Der findes ingen enkelt kontakt til alle AI-robotter
OpenAI: søgning og træning kan besluttes separat
OpenAI dokumenterer separate crawlere. OAI-SearchBot opdager indhold til ChatGPT-søgning, mens GPTBot vedrører mulig brug til forbedring af generative modeller. Du kan derfor tillade den første og blokere den anden:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /ChatGPT-User identificerer en anmodning udløst af en bruger og er ikke en mekanisme til optagelse i søgning. Læs udbyderens aktuelle vilkår i stedet for at kopiere en gammel user-agent-liste.
Google: Search og Google-Extended er ikke det samme
Ifølge Googles Search-dokumentation bruger AI Overviews og AI Mode søgeindekset og dets systemer. Googlebot-adgang påvirker derfor almindelig søgning og egnethed til disse funktioner.
Google-Extended er et separat produkt-token til brug af indhold til forbedring af Gemini-modeller og til grounding i nogle produkter. Google siger, at blokering af det ikke påvirker optagelse eller placering i Search. Det erstatter ikke Googlebot-regler.
Andre tjenester har deres egne regler
Anthropic skelner mellem ClaudeBot, Claude-SearchBot og brugerinitieret indlæsning. Perplexity beskriver PerplexityBot til sit søgeindeks. Navne og formål kan ændre sig. Hold en liste over vigtige tjenester, og kontrollér den mod deres primære dokumentation.
Sådan ville jeg beslutte det på et virksomhedswebsite
- Skriv forretningsmålet ned. Ønsker jeg organisk trafik, citationer, beskyttelse af betalt indhold eller alt dette med forskellige regler?
- Kontrollér det tekniske fundament. Canonical-URL'er, indeksering, statuskoder, sitemap og interne links. Ingen særlig fil kan redde et manglende fundament.
- Adskil crawlere efter formål. Søgning, træning og brugerudløst indlæsning er forskellige kategorier.
- Sikr ikke-offentlige data reelt. Kundetilbud, administration og interne dokumenter beskyttes ikke blot ved at instruere en robot.
- Tilføj kun LLMs.txt med en indholdsejer. Nogen skal sikre, at links og beskrivelser forbliver korrekte.
- Mål resultatet. Overvåg logs, Search Console og besøg fra relevante kilder; filens eksistens er ikke en færdig optimering.
Hvis du vil blive en kilde til AI-svar, så begynd med indhold og dokumentation frem for en fil i websitets rod. Jeg gennemgår det i Sådan vælger AI og Google kilder. Hvis du vil gennemgå crawlerindstillinger uden at risikere organisk trafik, kan du bruge kontaktsiden.