LLMs.txt, robots.txt ja tekoälyn indeksoijat: mitä kukin tiedosto todella hallitsee

Näennäisen yksinkertainen kysymys tulee usein vastaan: pitäisikö meidän lisätä llms.txt-tiedoston, jotta tekoäly lukee verkkosivustomme oikein – eikä samalla käytä sisältöämme koulutukseen? Yhtä yleispätevää kyllä- tai ei-vastausta ei ole. Kolme eri asiaa on sekoitettu keskenään: indeksoijan pääsy, näkyvyys haussa ja tekoälyagenttien ohjeistus.

Niiden erottaminen toisistaan on tärkeämpää kuin itse tiedosto. Muuten saatamme estää liikenteen, jota haluamme, emmekä silti saa odottamaamme suojaa.

Selvitä ensin, mitä haluat saavuttaa

  • Haluan, että Google tai ChatGPT Search löytää sivun. Huolehdi indeksoinnista, teknisestä SEO:sta ja kyseisen hakurobotin säännöistä.
  • En halua tarjota sisältöä mallien koulutukseen. Huolehdi koulutusindeksoijasta ja palvelun ehdoista.
  • Haluan tarjota agentille tiiviin dokumentaatiokartan. Tässä llms.txt-tiedostosta voi olla hyötyä.
  • Haluan suojata ei-julkisen sisällön. Mikään tekstitiedosto ei riitä. Tarvitset tunnistautumisen, käyttöoikeudet ja todellisen tietoturvan.

Nämä päätökset ovat teknisesti toisistaan riippumattomia. Yrityksen hakurobotilla ja koulutusindeksoijalla voi olla eri nimet ja säännöt.

Mitä llms.txt on – ja mitä se ei ole

LLMs.txt on ehdotus yksinkertaisesta Markdown-tiedostosta verkkosivuston juuressa. Se tarjoaa agentille lyhyen kuvauksen ja linkit tärkeisiin lähteisiin. Laajassa dokumentaatiossa se voi olla hakemisto: tuote, API, ehdot ja yleiset menettelyt.

Se ei ole käyttöoikeuskäytäntö. Se ei määritä sitovasti, kuka saa käyttää sisältöä koulutukseen, estä sivun lataamista tai takaa viittauksia tuloksissa. Google sanoo suoraan, ettei sen hakutoimintojen tekoälyominaisuuksia varten tarvita erityistä tekoälytiedostoa eikä llms.txt lisää mitään Google-hakuun.

Yrityksen verkkosivustolle ottaisin sen käyttöön, kun voimme ylläpitää lyhyttä, täsmällistä ja hyödyllistä lähdeluetteloa – en tyhjänä SEO-eleenä. Vanhentunut kartta on huonompi kuin ei karttaa lainkaan, koska se tarjoaa virheellisiä hintoja, vanhoja ohjeita tai poistettuja sivuja.

Robots.txt hallitsee indeksointia, ei luottamusta tai tietoturvaa

robots.txt-tiedosto kertoo yhteistyöhaluisille indeksoijille, minne ne saavat mennä ja minne eivät. Se on julkinen, sen säännöt riippuvat käyttäjäagentista, eikä se ole palomuuri tottelematonta robottia vastaan.

Estäminen robots.txt-tiedostossa ei ole luotettava tapa poistaa URL-osoitetta hakukoneesta. Google voi tietää osoitteen muista linkeistä, vaikka se ei pystyisi lukemaan sen sisältöä. Käytä ei-julkiseen dataan kirjautumista. Sivulle, jonka ei pitäisi näkyä tuloksissa, käytetään yleensä noindex-määritettä indeksoitavalla URL-osoitteella tai asianmukaista tilakoodia.

Kaikille tekoälyroboteille ei ole yhtä kytkintä

OpenAI: haku ja koulutus voidaan päättää erikseen

OpenAI dokumentoi erilliset indeksoijat. OAI-SearchBot etsii sisältöä ChatGPT-hakua varten, kun taas GPTBot liittyy mahdolliseen käyttöön generatiivisten mallien parantamiseen. Voit siis sallia ensimmäisen ja estää toisen:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

ChatGPT-User tunnistaa käyttäjän käynnistämän pyynnön eikä ole hakutuloksiin sisällyttämisen mekanismi. Lue palveluntarjoajan ajantasaiset ehdot sen sijaan, että kopioisit vanhan käyttäjäagenttiluettelon.

Google: Search ja Google-Extended eivät ole sama asia

Google-haun dokumentaation mukaan AI Overviews ja AI Mode käyttävät hakemistoa ja sen järjestelmiä. Googlebotin pääsy vaikuttaa siksi tavalliseen hakuun ja näiden ominaisuuksien käyttökelpoisuuteen.

Google-Extended on erillinen tuotetunniste, jolla sisältöä käytetään Gemini-mallien parantamiseen ja pohjustamiseen joissakin tuotteissa. Googlen mukaan sen estäminen ei vaikuta sisällyttämiseen tai sijoitukseen haussa. Se ei korvaa Googlebotin sääntöjä.

Muilla palveluilla on omat sääntönsä

Anthropic erottaa toisistaan ClaudeBot-indeksoijan, Claude-SearchBot-indeksoijan ja käyttäjän käynnistämän latauksen. Perplexity kuvaa PerplexityBot-indeksoijaa omaa hakemistoaan varten. Nimet ja käyttötarkoitukset voivat muuttua. Pidä luettelo tärkeistä palveluista ja tarkista se niiden ensisijaisista dokumentaatioista.

Näin tekisin päätöksen yrityksen verkkosivustolla

  1. Kirjaa liiketoimintatavoite. Haluanko orgaanista liikennettä, viittauksia, maksullisen sisällön suojaamista vai kaikkia näitä eri säännöillä?
  2. Tarkista tekninen perusta. Kanoniset URL-osoitteet, indeksointi, tilakoodit, sivukartta ja sisäiset linkit. Mikään erityistiedosto ei pelasta puuttuvaa perustaa.
  3. Erottele indeksoijat käyttötarkoituksen mukaan. Haku, koulutus ja käyttäjän käynnistämä lataus ovat eri kategorioita.
  4. Suojaa ei-julkinen data oikeasti. Asiakastarjouksia, hallintoa ja sisäisiä asiakirjoja ei suojata pelkästään ohjeistamalla robottia.
  5. Lisää LLMs.txt vain sisältövastaavan kanssa. Jonkun on varmistettava, että linkit ja kuvaukset pysyvät täsmällisinä.
  6. Mittaa tulos. Seuraa lokeja, Search Consolea ja käyntejä merkityksellisistä lähteistä; tiedoston olemassaolo ei ole valmis optimointi.

Jos haluat tulla tekoälyvastausten lähteeksi, aloita sisällöstä ja todisteista verkkosivuston juuressa olevan tiedoston sijaan. Keskustelen tästä artikkelissa Kuinka tekoäly ja Google valitsevat lähteet. Jos haluat tarkistaa indeksoijien asetukset vaarantamatta orgaanista liikennettä, käytä yhteydenottosivua.

Tarvitsetko selkeyttä markkinointiin?

Selkeytetään ensin tilanne.

Jos yrityksesi on samanlaisen päätöksen edessä, lähetä minulle lyhyesti taustatiedot. Katsotaan, onko järkevää jatkaa.

Kuvaile tilanne