Ordliste · GEO

robots.txt

En tekstfil i roden af dit website som fortæller crawlere hvad de må hente. Filen styrer adgang og ikke indeksering. Den er en anmodning, og crawleren vælger selv om den vil følge den.

Test en robots.txt

Skriv et domæne eller en adresse, og se hvilke crawlere der må hente den.

Testen læser kun robots.txt. Den kan ikke se om Cloudflare eller serveren afviser den rigtige crawler.

Engelsk
robots.txt (Robots Exclusion Protocol)
Dansk
robots.txt
Kort sagt
En fil der fortæller crawlere hvad de må hente.

robots.txt er en tekstfil der ligger i roden af dit website og fortæller crawlere hvilke adresser de må hente. Filen ligger altid samme sted, fx lasse-enggaard.dk/robots.txt.

En crawler der følger reglerne, henter filen først og læser hvad der gælder for den. Googlebot gør det, og OpenAI og Anthropic skriver at deres crawlere gør det samme.

Reglerne står pr. crawler. Hver gruppe begynder med et navn og fortsætter med de stier crawleren ikke må hente.

User-agent: *
Disallow: /kurv/

User-agent: GPTBot
Disallow: /

Sitemap: https://dinside.dk/sitemap.xml

Første gruppe gælder alle crawlere og spærrer kurven. Anden gruppe gælder kun GPTBot, som ikke må hente noget. Sidste linje viser hvor sitemappet ligger.

robots.txt fjerner ikke en side fra Google

robots.txt bestemmer om en crawler må hente en side. Filen bestemmer ikke om siden må stå i søgeresultaterne.

Spærrer du en side i robots.txt, kan den stadig dukke op i Google hvis andre sider linker til den. Den står så uden beskrivelse fordi Google ikke har måttet læse den.

Vil du have en side ud af Google, skal du bruge noindex på selve siden. Siden må så ikke være spærret i robots.txt, for Google skal hente den for at se noindex.

Fjerner ikke siden fra Google

Disallow: /gammel-side/ i robots.txt.

Google må ikke hente siden, men den kan stadig stå i søgeresultaterne.

Fjerner siden fra Google

<meta name="robots" content="noindex"> på selve siden.

Google henter siden, læser beskeden og tager den ud af indekset.

robots.txt er en anmodning

robots.txt kan ikke stoppe nogen. Filen er en besked, og crawleren vælger selv om den vil følge den. De store søgemaskiner gør det. En skraber der vil have dit indhold, gør det ikke.

Vil du lukke en crawler helt ude, skal det ske på serveren eller i et CDN som Cloudflare. Der bliver forespørgslen afvist uanset hvad crawleren har tænkt sig.

Når robots.txt aldrig bliver læst

En blokering i et CDN sker før forespørgslen når din server. Crawleren får en fejl og kommer aldrig frem til din robots.txt. En tilladelse i filen hjælper derfor ikke hvis crawleren er spærret længere ude.

Det sker når Training står på Block i Cloudflare. Googlebot bliver afvist i Cloudflares net selvom din robots.txt tillader den. Jeg har beskrevet det i artiklen om Cloudflare og Googlebot.

De to lag taler ikke sammen. robots.txt siger hvad du ønsker. Cloudflare bestemmer hvad der slipper igennem.

robots.txt og AI

AI-firmaerne har givet deres crawlere egne navne som du kan bruge i robots.txt. Hos OpenAI henter GPTBot til træning og OAI-SearchBot til søgning. Spærrer du GPTBot, siger du nej til træning og kan stadig blive fundet i ChatGPT. Forskellen står under AI-crawler.

Google og Apple har lavet navne der kun gælder træning. Google-Extended styrer om Google må bruge dit indhold til at træne Gemini uden at det påvirker Google-søgning. Applebot-Extended gør det samme hos Apple.

Cloudflare kan skrive de regler for dig. Indstillingen Disallow AI Training lægger reglerne øverst i din robots.txt, foran dem du selv har skrevet.

Sådan tjekker du din robots.txt

  1. 1

    Åbn filen i browseren

    Skriv dit domæne efterfulgt af /robots.txt. Får du en fejl eller en tom side, har du ingen fil.

  2. 2

    Læs hvem reglerne gælder

    Se efter linjerne der begynder med User-agent. En stjerne gælder alle crawlere.

  3. 3

    Se efter en linje der spærrer alt

    Disallow med en enkelt skråstreg spærrer hele sitet for den crawler. Står den under stjernen, er hele sitet lukket.

  4. 4

    Åbn rapporten i Search Console

    Under Indstillinger ligger en rapport for robots.txt. Den viser hvilken udgave Google har hentet, og om der var fejl.

  5. 5

    Test en vigtig side

    Kør URL-inspektion på siden. Den viser om siden er blokeret af robots.txt.

Ofte stillede spørgsmål

Skal alle hjemmesider have en robots.txt?

Nej. Uden en fil må crawlere hente alt. Filen er kun nødvendig hvis du vil spærre noget eller vise hvor sitemappet ligger.

Gælder robots.txt for underdomæner?

Nej. Filen gælder kun det domæne den ligger på. Har du en shop på shop.dinside.dk, skal den have sin egen robots.txt.

Kan jeg skjule fortrolige sider med robots.txt?

Nej. Alle kan læse filen, så den viser netop hvor siderne ligger. Fortroligt indhold skal ligge bag login.

Hvor hurtigt virker en ændring i robots.txt?

Google henter typisk filen igen inden for et døgn. Andre crawlere har deres egen rytme.

Begrebet står også i ordlisten sammen med de øvrige termer om AI-synlighed.