Kort fortalt: robots.txt er en tekstfil i webhotellets rod, hvor et website fortæller understøttede crawlere, hvilke stier de må hente. Den er ikke et pålideligt værktøj til at fjerne URL'er fra et indeks.
Sådan bruger jeg robots.txt i praksis
I praksis bruger jeg ikke begrebet robots.txt som endnu et tal til en præsentation. Først fastslår jeg, hvilken beslutning det skal gøre mere præcis, hvilke data eller observationer det bygger på, og hvem der vil ændre noget på baggrund af resultatet. Jeg kontrollerer den faktiske fil på hver host, regler for en bestemt user agent, og om blokeringen forhindrer, at indholdet eller noindex-direktivet bliver hentet. Jeg registrerer også baseline, måledato og fortolkningsbegrænsninger. Det gør det senere muligt at skelne en reel ændring fra en ændring i værktøj, stikprøve eller formuleringen af forespørgslen.
Det skal du være opmærksom på
Den største risiko er en præcision, der kun er tilsyneladende. En blokeret URL kan stadig vises i resultaterne uden et uddrag, fordi botten ikke læser dens noindex eller statusrespons. Derfor sammenligner jeg resultatet over tid, på en stabil stikprøve og sammen med den forretningsmæssige kontekst. Hvis begrebet ikke fører til et konkret næste skridt, har det ikke skabt en analyse, men kun en ny betegnelse.
Spørgsmål til beslutningstagning
- Hvilken bot gælder reglen for?
- Blokerer den vigtig CSS, JavaScript eller sider?
- Skal URL'en ikke crawles, eller skal den reelt ikke indekseres?
- Angiver filen det korrekte sitemap?