
Waarom je robots.txt je zichtbaarheid al vóór je content blokkeert
AI, Marketing & CommunicatieDe eerste blokkade zit vaak niet in je content, maar in je robots.txt
Als je site niet zichtbaar is voor AI-systemen, ligt het probleem lang niet altijd bij je teksten. Soms begint het al bij de voordeur: crawltoegang. Een recente scan van de 500 populairste Nederlandse domeinen, uitgevoerd op 10 juni 2026, laat zien dat van de 393 bereikbare domeinen 21,1% actief minstens één AI-crawler blokkeert via robots.txt. Domeinen die blokkeren, doen dat gemiddeld voor 6,3 bots tegelijk.
Dat is geen abstract SEO-risico meer. Het betekent dat voor ongeveer een vijfde van de Nederlandse topdomeinen het probleem al speelt voordat de eerste zin van een pagina überhaupt gelezen kan worden.
Niet elke bot is hetzelfde
Een veelgemaakte fout is om “AI-bot” als één categorie te behandelen. In de praktijk maken verschillende crawlers verschillende dingen mogelijk. Google documenteert bijvoorbeeld Google-Extended als token in robots.txt voor controle over gebruik in generatieve AI, terwijl Anthropic expliciet uitlegt dat ClaudeBot via robots.txt kan worden geblokkeerd. OpenAI gebruikt meerdere crawlers met verschillende functies, waaronder GPTBot, OAI-SearchBot en ChatGPT-User.
De scan uit het Nederlandse onderzoek laat zien dat GPTBot en CCBot het vaakst worden geblokkeerd, allebei door 16,3% van de sites. Daarna volgen onder meer Bytespider, ClaudeBot, Google-Extended en PerplexityBot. Binnen de OpenAI-bots verschilt het effect ook: GPTBot wordt door 16,3% geblokkeerd, ChatGPT-User door 11,2% en OAI-SearchBot door 7,9%. Volgens het onderzoek is dat verschil relevant, omdat GPTBot voor training wordt gebruikt, terwijl OAI-SearchBot pagina’s ophaalt om ze in live antwoorden te citeren.
De les: wie blind blokkeert, blokkeert vaak meer dan bedoeld.
Robots.txt is vaak geërfd, niet bewust gekozen
Het onderzoek noemt drie oorzaken die dit patroon verklaren: robots.txt-regels worden vaak overgenomen uit een oud sjabloon, niemand voelt zich eigenaar van AI-vindbaarheid, en FAQ-schema wordt nog te vaak gezien als een nice-to-have in plaats van als een technische kans. Dat is herkenbaar. Veel websites hebben regels die ooit logisch waren voor klassieke zoekmachines, maar nooit zijn herzien voor AI-crawlers.
Voor uitgevers kan streng blokkeren verdedigbaar zijn. Nieuwsmerken zoals NOS, NU.nl, AD, RTL Nieuws, de Volkskrant, Trouw en Het Parool blokkeren in het onderzoek elk 10 van de 11 bots. NRC blokkeert er 2 en BNR 6. Als je businessmodel direct draait op je artikelen, is terughoudendheid logisch. Maar buiten de mediasector is hetzelfde gedrag vaak minder te verdedigen, zeker als je juist gevonden wilt worden via AI-zoek- en antwoordsystemen.
Wie OpenAI wil beperken, moet precies weten wat hij blokkeert
Hier gaat het in de praktijk vaak mis. Als je alleen AI-training wilt beperken, maar wel zichtbaar wilt blijven in antwoorden en zoekervaringen, moet je onderscheid maken tussen verschillende OpenAI-bots. Dat is niet alleen een nuance, maar een strategische keuze. De documentatie van OpenAI en Google laat zien dat crawlers en gebruikstoepassingen van elkaar kunnen verschillen, en dat robots.txt daarop gericht moet worden afgestemd. Google benadrukt bovendien dat robots.txt bedoeld is om crawlgedrag te beheren, niet om willekeurig alles af te sluiten.
Kort gezegd: het blokkeren van training is niet automatisch hetzelfde als onzichtbaar worden in live AI-antwoorden. Wie de regels te breed zet, kan zichzelf onbedoeld uit de relevante antwoordlagen verwijderen.
Machineleesbaarheid wordt nog veel te weinig benut
Het Nederlandse onderzoek laat ook zien hoeveel organisaties hun content nog niet “AI-vriendelijk” hebben ingericht. Slechts 1,5% van de openstaande sites heeft FAQ-schema op de homepage. 6,6% heeft een llms.txt-bestand. 6,4% gebruikt een tabel op de homepage. Dat zijn precies de signalen die systemen relatief eenvoudig kunnen verwerken, maar die dus opvallend weinig slim worden ingezet.
Dat is opvallend, zeker omdat structured data al jaren een officiële weg is om expliciete context aan zoekmachines te geven. Google schrijft dat structured data pagina’s begrijpelijker kan maken en kan bijdragen aan rich results, al garandeert het geen zichtbaarheid. Google heeft FAQ rich results inmiddels bovendien uitgefaseerd voor de reguliere zoekresultaten, waardoor FAQ-schema niet meer de oude SERP-belofte heeft, maar het blijft wel een bruikbaar semantisch signaal voor andere systemen en voor machineleesbaarheid in bredere zin.
Wat je nu moet controleren
Begin niet bij copy, maar bij toegang.
- Check robots.txt op de juiste bots
Kijk specifiek naar GPTBot, ClaudeBot, CCBot, Google-Extended en PerplexityBot. Het onderzoek adviseert juist deze set als eerste controlepunt.
- Splits training af van live zichtbaarheid
Als je OpenAI voor training wilt beperken, maar wel zichtbaar wilt blijven in antwoordsystemen, blokkeer dan niet onnodig bots als OAI-SearchBot en ChatGPT-User.
- Maak belangrijke pagina’s direct leesbaar
Zet FAQ-schema in op pagina’s waar echte vragen en antwoorden centraal staan, gebruik koppen als echte vragen en zet het antwoord bovenaan. Voor Q&A-achtige content ondersteunt Google expliciet QAPage, Question en Answer-markering.
- Gebruik tabellen waar structuur telt
Voor prijzen, specificaties en vergelijkingen zijn tabellen vaak veel beter te verwerken dan lange alinea’s. Dat is geen designkwestie, maar een vindbaarheidskwestie.
De echte vraag is niet of je AI-bots blokkeert, maar waarom
Voor veel organisaties is de reflex om alles dicht te zetten. Maar dat is een dure standaardinstelling. Als je site bedoeld is om ontdekt, geciteerd of gebruikt te worden in AI-gedreven zoekervaringen, dan moet je crawltoegang bewust ontwerpen in plaats van erven.
De belangrijkste conclusie uit dit onderzoek is simpel: AI-proof content begint niet bij betere copy, maar bij technische toegang, slimme botkeuzes en een pagina-opbouw die machines direct begrijpen. Wie dat negeert, verliest zichtbaarheid nog vóór de eerste zin.
Volgende stap: laat je robots.txt, homepage-structuur en belangrijkste contentpagina’s nu expliciet auditen op AI-crawltoegang. Dat levert vaak meer zichtbaarheid op dan nog een ronde content herschrijven.
Meld je aan voor de nieuwsbrief van
Brabant in Business



