Robots.txt-politik for AI-crawlere: Beslutningsguiden

Din robots.txt er blevet en forretningspolitik: den afgør, hvilke AI-systemer der må bruge dit indhold. Dermed afgør den også, hvor du er synlig i AI-søgningens økosystem. “Bloker alt” og “tillad alt” er sjældent det rigtige svar — det rigtige svar er en differentieret politik, der skelner mellem crawler-typernes formål.

Beslutningen er blevet mere presserende, i takt med at AI-crawlere udgør en voksende andel af trafikken på almindelige danske sites. Mange siteejere har reelt allerede truffet valget uden at vide det — via en firewall-standard eller en gammel robots.txt — og opdager det først, når synligheden udebliver. Denne guide giver beslutningsrammen, en praktisk skabelon og vedligeholdelsesrutinen.

Kort fortalt

  • AI-crawlere falder i tre typer med hver sin afvejning: svar-crawlere (tillad), trænings-crawlere (afvej) og klassiske søge-crawlere (tillad altid).
  • Skriv user-agent-specifikke blokke, dokumentér begrundelsen, og genbesøg politikken kvartalsvis.
  • Hold robots.txt konsistent med din llms.txt — bloker ikke i den ene fil, hvad du inviterer til i den anden.

Hvilke tre crawler-typer skal politikken skelne mellem?

Forskellen på crawler-typerne er formålet med hentningen — og dermed hvad du får igen for at åbne døren. Robots-standarden RFC 9309 (2022) lader dig svare hver enkelt user-agent forskelligt, og det er præcis det, en moderne politik gør.

Type 1 · tilladSvar-crawlere

PerplexityBot, OAI-SearchBot og ChatGPT-User henter indhold for at besvare konkrete spørgsmål — med citat og link. Det er her, synligheden ligger.

Type 2 · afvejTrænings-crawlere

GPTBot og Google-Extended indsamler til modeltræning. Marketingindhold vinder ved at være i modellernes verdensbillede; unikt betalt indhold gør måske ikke.

Type 3 · tillad altidKlassiske søge-crawlere

Googlebot og Bingbot er fundamentet under al synlighed — også AI Overviews bygger på Googles indeks. Blokér dem aldrig.

Bemærk det vigtige skel hos OpenAI: GPTBot er trænings-crawleren, mens OAI-SearchBot og ChatGPT-User henter til søgning og live-svar. Du kan blokere GPTBot og stadig optræde i ChatGPTs søgeresultater med citat. Tilsvarende styrer Google-Extended kun AI-træningsbrug — den påvirker ikke din klassiske Google-indeksering. Hele crawler-oversigten står i crawler-guiden.

Hvordan træffer du selve beslutningen?

Stil to spørgsmål om din forretning. Først: lever du af opmærksomhed eller af eksklusivt indhold? Marketingdrevne sites, konsulentvirksomheder og webshops lever af at blive fundet og anbefalet — for dem er åbenhed over for både svar-crawlere som PerplexityBot og trænings-crawlere som GPTBot som regel det rigtige, fordi tilstedeværelse i modellernes verdensbillede er gratis markedsføring. Medier og udgivere, der sælger adgang til indholdet, har en reel modsatrettet interesse i træningsspørgsmålet.

Dernæst: hvad er dit indholds halveringstid? Nyheds- og prisindhold forældes hurtigt — her betyder træningsbrug lidt, for modellerne skal alligevel hente live for at svare korrekt. Tidløst unikt indhold (metoder, data, værker) lever længe i en models vægte, og dér vejer beskyttelseshensynet tungere. Skriv konklusionen ned med begrundelse: en dokumenteret politik kan genbesøges — en tilfældig konfiguration kan kun opdages.

Mange siteejere har allerede truffet valget uden at vide det — via en firewall-standard eller en gammel robots.txt.

Den praktiske skabelon

En differentieret robots.txt for et marketingdrevet site, der tillader svar-crawlere og træning, men beskytter interne stier, kan se sådan ud:

# Svar-crawlere: tilladt (synlighed med citat)
User-agent: PerplexityBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
Allow: /

# Trænings-crawlere: tilladt efter afvejning [dato + begrundelse internt]
User-agent: GPTBot
User-agent: Google-Extended
Allow: /

# Alle: interne stier undtaget
User-agent: *
Disallow: /wp-admin/
Sitemap: https://ditdomæne.dk/sitemap.xml

Vil du i stedet blokere træning, erstattes Allow med Disallow: / i trænings-blokken — resten står uændret. Husk to forbehold: robots.txt er en anmodning, ikke en teknisk barriere (seriøse aktører respekterer den; ondsindede gør ikke), og håndhævelse kræver derfor bot-beskyttelse som supplement, hvis beskyttelsen er kritisk.

Vedligehold politikken som det, den er: en politik

Sæt et kvartalsvist genbesøg i kalenderen. Nye crawlere kommer til, eksisterende skifter navn og formål, og din egen forretning flytter sig. Tjek samtidig konsistensen med din llms.txt — at blokere en crawler i robots.txt og invitere den i llms.txt er en selvmodsigelse, hvor blokeringen vinder — og verificér effekten i dine access-logs: svarer serveren faktisk som besluttet? Metoden står i log-casen, og det store billede af, hvorfor politikken overhovedet betyder noget, står i Hvad er agentic SEO?

Hvad med crawlere, der ignorerer reglerne?

Robots.txt binder kun dem, der vælger at følge den — og det gør de store navngivne crawlere, mens anonyme scrapere ikke gør. Er håndhævelse vigtig for dig, kræver det et lag mere: bot-beskyttelse på server- eller CDN-niveau, der identificerer og afviser uønskede klienter på adfærd og IP frem for på selvrapporteret user-agent. De store udbydere publicerer deres officielle IP-intervaller, så du kan verificere, at en klient, der kalder sig GPTBot, faktisk er det.

Afvej dog håndhævelsens pris: aggressive regler er den hyppigste årsag til, at legitime crawlere utilsigtet blokeres — fejlmønsteret fra log-casen, hvor sites troede, de var åbne, men svarede 403. Tommelfingerreglen: håndhæv kun det, din politik faktisk kræver, whitelist de crawlere, du har valgt at lukke ind, og verificér effekten i loggene efter hver regelændring.

Ofte stillede spørgsmål

Respekterer AI-crawlere overhovedet robots.txt?

De store aktører — OpenAI, Google, Anthropic — dokumenterer offentligt deres user-agents og erklærer, at de respekterer robots.txt. Mindre og useriøse scrapere gør ofte ikke. Robots.txt styrer altså de aktører, der betyder noget for din synlighed, men er ikke en sikkerhedsforanstaltning.

Mister jeg Google-placeringer ved at blokere Google-Extended?

Nej. Google-Extended styrer alene, om dit indhold må bruges til at træne Googles AI-modeller. Din klassiske indeksering og ranking via Googlebot påvirkes ikke — det er netop pointen med den separate user-agent.

Kan jeg fortryde en blokering?

Ja, for svar-crawlere som PerplexityBot og OAI-SearchBot: fjern blokeringen, og synligheden kan genopbygges, i takt med at de henter igen. For trænings-crawlere som GPTBot og Google-Extended er sagen mere blandet — hvad der allerede er trænet ind i en modelgeneration, forbliver der, men fremtidige generationer følger din nye politik.

Senest revideret 31. august 2026. Artiklen gennemgås løbende, når AI-søgelandskabet flytter sig.