Ordliste · GEO
robots.txt
En tekstfil i roden af dit website som fortæller crawlere hvad de må hente. Filen styrer adgang og ikke indeksering. Den er en anmodning, og crawleren vælger selv om den vil følge den.
Test en robots.txt
Skriv et domæne eller en adresse, og se hvilke crawlere der må hente den.
Testen læser kun robots.txt. Den kan ikke se om Cloudflare eller serveren afviser den rigtige crawler.
- Engelsk
- robots.txt (Robots Exclusion Protocol)
- Dansk
- robots.txt
- Kort sagt
- En fil der fortæller crawlere hvad de må hente.
robots.txt er en tekstfil der ligger i roden af dit website og fortæller crawlere hvilke adresser de må hente. Filen ligger altid samme sted, fx lasse-enggaard.dk/robots.txt.
En crawler der følger reglerne, henter filen først og læser hvad der gælder for den. Googlebot gør det, og OpenAI og Anthropic skriver at deres crawlere gør det samme.
Reglerne står pr. crawler. Hver gruppe begynder med et navn og fortsætter med de stier crawleren ikke må hente.
User-agent: * Disallow: /kurv/ User-agent: GPTBot Disallow: / Sitemap: https://dinside.dk/sitemap.xml
Første gruppe gælder alle crawlere og spærrer kurven. Anden gruppe gælder kun GPTBot, som ikke må hente noget. Sidste linje viser hvor sitemappet ligger.
robots.txt fjerner ikke en side fra Google
robots.txt bestemmer om en crawler må hente en side. Filen bestemmer ikke om siden må stå i søgeresultaterne.
Spærrer du en side i robots.txt, kan den stadig dukke op i Google hvis andre sider linker til den. Den står så uden beskrivelse fordi Google ikke har måttet læse den.
Vil du have en side ud af Google, skal du bruge noindex på selve siden. Siden må så ikke være spærret i robots.txt, for Google skal hente den for at se noindex.
Fjerner ikke siden fra Google
Disallow: /gammel-side/ i robots.txt.
Google må ikke hente siden, men den kan stadig stå i søgeresultaterne.
Fjerner siden fra Google
<meta name="robots" content="noindex"> på selve siden.
Google henter siden, læser beskeden og tager den ud af indekset.
robots.txt er en anmodning
robots.txt kan ikke stoppe nogen. Filen er en besked, og crawleren vælger selv om den vil følge den. De store søgemaskiner gør det. En skraber der vil have dit indhold, gør det ikke.
Vil du lukke en crawler helt ude, skal det ske på serveren eller i et CDN som Cloudflare. Der bliver forespørgslen afvist uanset hvad crawleren har tænkt sig.
Når robots.txt aldrig bliver læst
En blokering i et CDN sker før forespørgslen når din server. Crawleren får en fejl og kommer aldrig frem til din robots.txt. En tilladelse i filen hjælper derfor ikke hvis crawleren er spærret længere ude.
Det sker når Training står på Block i Cloudflare. Googlebot bliver afvist i Cloudflares net selvom din robots.txt tillader den. Jeg har beskrevet det i artiklen om Cloudflare og Googlebot.
De to lag taler ikke sammen. robots.txt siger hvad du ønsker. Cloudflare bestemmer hvad der slipper igennem.
robots.txt og AI
AI-firmaerne har givet deres crawlere egne navne som du kan bruge i robots.txt. Hos OpenAI henter GPTBot til træning og OAI-SearchBot til søgning. Spærrer du GPTBot, siger du nej til træning og kan stadig blive fundet i ChatGPT. Forskellen står under AI-crawler.
Google og Apple har lavet navne der kun gælder træning. Google-Extended styrer om Google må bruge dit indhold til at træne Gemini uden at det påvirker Google-søgning. Applebot-Extended gør det samme hos Apple.
Cloudflare kan skrive de regler for dig. Indstillingen Disallow AI Training lægger reglerne øverst i din robots.txt, foran dem du selv har skrevet.
Sådan tjekker du din robots.txt
- 1
Åbn filen i browseren
Skriv dit domæne efterfulgt af /robots.txt. Får du en fejl eller en tom side, har du ingen fil.
- 2
Læs hvem reglerne gælder
Se efter linjerne der begynder med User-agent. En stjerne gælder alle crawlere.
- 3
Se efter en linje der spærrer alt
Disallow med en enkelt skråstreg spærrer hele sitet for den crawler. Står den under stjernen, er hele sitet lukket.
- 4
Åbn rapporten i Search Console
Under Indstillinger ligger en rapport for robots.txt. Den viser hvilken udgave Google har hentet, og om der var fejl.
- 5
Test en vigtig side
Kør URL-inspektion på siden. Den viser om siden er blokeret af robots.txt.
Ofte stillede spørgsmål
Skal alle hjemmesider have en robots.txt?
Nej. Uden en fil må crawlere hente alt. Filen er kun nødvendig hvis du vil spærre noget eller vise hvor sitemappet ligger.
Gælder robots.txt for underdomæner?
Nej. Filen gælder kun det domæne den ligger på. Har du en shop på shop.dinside.dk, skal den have sin egen robots.txt.
Kan jeg skjule fortrolige sider med robots.txt?
Nej. Alle kan læse filen, så den viser netop hvor siderne ligger. Fortroligt indhold skal ligge bag login.
Hvor hurtigt virker en ændring i robots.txt?
Google henter typisk filen igen inden for et døgn. Andre crawlere har deres egen rytme.
Begrebet står også i ordlisten sammen med de øvrige termer om AI-synlighed.