Vaak komt er een ogenschijnlijk eenvoudige vraag naar voren: moeten we llms.txt toevoegen zodat kunstmatige intelligentie onze website correct leest — en tegelijkertijd onze content niet voor training gebruikt? Daar bestaat geen universeel ja of nee op. Drie verschillende zaken zijn door elkaar gehaald: toegang voor crawlers, zichtbaarheid in zoekmachines en richtlijnen voor AI-agents.
Het is belangrijker om ze van elkaar te scheiden dan om ons op het bestand zelf te richten. Anders blokkeren we mogelijk verkeer dat we juist willen, terwijl we de bescherming waarop we rekenden niet krijgen.
Bepaal eerst wat je wilt bereiken
- Ik wil dat Google of ChatGPT Search de pagina vindt. Richt je op indexering, technische SEO en de regels van de specifieke zoekcrawler.
- Ik wil geen content voor modeltraining beschikbaar stellen. Richt je op de trainingscrawler en de voorwaarden van de dienst.
- Ik wil een agent een beknopte documentatiekaart bieden. Hiervoor kan
llms.txtzinvol zijn. - Ik wil niet-openbare content beschermen. Geen enkel tekstbestand is daarvoor voldoende. Je hebt authenticatie, autorisatie en echte beveiliging nodig.
Deze beslissingen staan technisch los van elkaar. De zoekcrawler en trainingscrawler van een bedrijf kunnen verschillende namen en regels hebben.
Wat llms.txt wel en niet is
LLMs.txt is een voorstel voor een eenvoudig Markdown-bestand in de root van een website. Het biedt een agent een korte beschrijving en links naar belangrijke bronnen. Voor uitgebreide documentatie kan het een directory zijn met productinformatie, API, voorwaarden en veelgebruikte procedures.
Het is geen toegangsbeleid. Het bepaalt niet op gezaghebbende wijze wie content voor training mag gebruiken, voorkomt niet dat een pagina wordt gedownload en garandeert geen citatie in resultaten. Google zegt expliciet dat er geen speciaal AI-bestand nodig is voor zijn AI-functies in Search en dat llms.txt niets toevoegt aan Google Search.
Op een bedrijfswebsite zou ik het implementeren wanneer we een korte, accurate en nuttige bronnenlijst kunnen onderhouden — niet als een lege SEO-handeling. Een verouderde kaart is erger dan geen kaart, omdat die onjuiste prijzen, oude instructies of verwijderde pagina's kan aanbieden.
Robots.txt regelt crawling, geen vertrouwen of beveiliging
Het bestand robots.txt vertelt meewerkende crawlers waar ze wel en niet mogen komen. Het is openbaar, de regels hangen af van de user-agent en het is geen firewall tegen een robot die zich niet aan de regels houdt.
Blokkeren in robots.txt is geen betrouwbare manier om een URL uit een zoekmachine te verwijderen. Google kan het adres via andere links kennen, zelfs als de inhoud niet kan worden gelezen. Gebruik voor niet-openbare gegevens een inlog. Gebruik voor een pagina die niet in de resultaten mag verschijnen doorgaans noindex op een crawlbare URL of de juiste statuscode.
Er is geen enkele schakelaar voor alle AI-robots
OpenAI: over zoeken en training kun je afzonderlijk beslissen
OpenAI documenteert afzonderlijke crawlers. OAI-SearchBot ontdekt content voor ChatGPT Search, terwijl GPTBot betrekking heeft op mogelijk gebruik voor het verbeteren van generatieve modellen. Je kunt de eerste dus toestaan en de tweede blokkeren:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /ChatGPT-User identificeert een verzoek dat door een gebruiker is gestart en is geen mechanisme voor opname in zoekresultaten. Lees de actuele voorwaarden van de provider in plaats van een oude user-agentlijst te kopiëren.
Google: Search en Google-Extended zijn niet hetzelfde
Volgens de Google Search-documentatie gebruiken AI Overviews en AI Mode de zoekindex en de bijbehorende systemen. Toegang door Googlebot heeft daarom invloed op gewone zoekresultaten en op de geschiktheid voor deze functies.
Google-Extended is een afzonderlijk producttoken voor het gebruiken van content om Gemini-modellen te verbeteren en voor grounding in sommige producten. Google zegt dat het blokkeren ervan geen invloed heeft op opname of ranking in Search. Het is geen vervanging voor Googlebot-regels.
Andere diensten hebben hun eigen regels
Anthropic maakt onderscheid tussen ClaudeBot, Claude-SearchBot en het laden op initiatief van de gebruiker. Perplexity beschrijft PerplexityBot voor zijn zoekindex. Namen en doeleinden kunnen veranderen. Houd een lijst bij van belangrijke diensten en controleer die aan de hand van hun primaire documentatie.
Hoe ik een beslissing zou nemen voor een bedrijfswebsite
- Leg het bedrijfsdoel vast. Wil ik organisch verkeer, citaties, bescherming van betaalde content, of al deze zaken met verschillende regels?
- Controleer de technische basis. Canonieke URL's, indexering, statuscodes, sitemap en interne links. Geen enkel speciaal bestand kan een ontbrekende basis herstellen.
- Scheid crawlers op basis van hun doel. Zoeken, training en laden op initiatief van de gebruiker zijn verschillende categorieën.
- Beveilig niet-openbare gegevens daadwerkelijk. Klantoffertes, administratie en interne documenten zijn niet beschermd doordat je een robot instructies geeft.
- Voeg LLMs.txt alleen toe met een contenteigenaar. Iemand moet ervoor zorgen dat links en beschrijvingen correct blijven.
- Meet het resultaat. Monitor logs, Search Console en bezoeken vanuit relevante bronnen; het bestaan van het bestand is geen voltooide optimalisatie.
Als je een bron voor AI-antwoorden wilt worden, begin dan met content en bewijs in plaats van met een bestand in de root van de website. Ik bespreek dit in Hoe AI en Google bronnen kiezen. Gebruik de contactpagina om crawlerinstellingen te controleren zonder organisch verkeer in gevaar te brengen.