# Welke AI-tools mogen je site bekijken?

> Crawlerbeleid vraagt onderscheid tussen search, user-triggered fetchers en training. Welke regels welke AI-bots toelaten, en hoe je dat correct instelt.

Bron: https://www.citeerbaar.nl/blog/robots-txt-ai-crawlers/

Door [Ronald Wildschut](https://www.citeerbaar.nl/over-ronald/) · Gepubliceerd: 12 mei 2026 · Laatst bijgewerkt: 30 september 2026 · 5 min leestijd

Niet elke AI-bezoeker hoort dezelfde toegang te krijgen. Waarom de keuze welke tools je toelaat strategisch is.

In het kort

Wie je in robots.txt toelaat, bepaalt of AI-zoektools je content kunnen gebruiken om klanten naar je toe te sturen. Er zijn drie soorten AI-bezoekers: bots die AI-antwoorden vullen, bots die taalmodellen trainen en bots die alleen serverbelasting opleveren. Voor de meeste bedrijven is open toegang gewenst, maar niet onbeperkt: per user-agent kies je wie je toelaat.

Iedere dag bezoeken geautomatiseerde AI-bezoekers websites om content op te halen. Sommige doen dat om gebruikers van [AI-zoekfuncties direct van een antwoord](https://docs.perplexity.ai/docs/resources/perplexity-crawlers) te voorzien. Andere doen dat om [hun taalmodellen te trainen](https://developers.openai.com/api/docs/bots). En sommige zijn rommelige bots die belasting toevoegen zonder iets terug te geven. De vraag wie je toelaat is geen technische detail, het is een strategische keuze.

## Waarom is robots.txt belangrijk voor AI?

Toegang openzetten voor AI-zoektools betekent dat jouw content kan worden gebruikt om klanten [naar jou te leiden via AI-antwoorden](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler). Toegang afsluiten betekent dat je onzichtbaar wordt voor die laag. Voor de meeste bedrijven is open toegang gewenst, maar niet onbeperkt. Er zijn ook tools die je content oogsten voor doeleinden waar je niet aan wilt bijdragen.

Voor publishers, contentmakers en bedrijven met sterke intellectuele eigendommen kan het verstandig zijn bepaalde toegangsregels strenger te zetten. Voor MKB, horeca, retail en dienstverleners is het juist belangrijk om de toegangsdeuren voor klantgerichte AI-zoektools wagenwijd open te hebben.

## Wat gaat er mis in robots.txt bij AI-crawlers?

Twee uitersten komen we regelmatig tegen. In het ene geval staat de toegang voor AI-zoekfuncties per ongeluk dicht, vaak omdat [een algemene blokkade is geconfigureerd](https://www.rfc-editor.org/rfc/rfc9309.html) zonder onderscheid te maken. Resultaat: het bedrijf is voor AI praktisch onzichtbaar. In het andere geval staat alles wagenwijd open, inclusief crawlers die geen klantwaarde leveren maar wel serverbelasting toevoegen.

Daartussenin zit het juiste evenwicht: bewust openzetten waar dat bijdraagt aan je AI-vindbaarheid, en bewust sluiten waar dat alleen kosten oplevert.

## Welke soorten AI-bezoekers zijn er?

Bewust kiezen begint bij weten wie er eigenlijk aanklopt. AI-bezoekers vallen grofweg in drie categorieën, en per categorie kan je afweging anders uitvallen. Een compleet overzicht vind je in ons artikel over [welke AI-crawlers er bestaan](/blog/welke-ai-crawlers-bestaan-er/).

### Zoek- en citatiecrawlers

Bots zoals OAI-SearchBot van OpenAI en PerplexityBot maken content beschikbaar voor de zoekfuncties van ChatGPT en Perplexity. Wat er daarna nodig is om ook echt [vindbaar te zijn in Perplexity](/gevonden-worden-in-ai-chatbots/) en ChatGPT, verschilt per platform. Laat je ze toe, dan kan jouw content worden aangehaald als bron, inclusief link naar je site. Voor vrijwel elk bedrijf dat gevonden wil worden is dit de categorie die open hoort te staan.

### Training-crawlers

GPTBot en ClaudeBot halen content op om er toekomstige taalmodellen mee te trainen. Google-Extended is geen aparte bot maar een robots.txt-instelling die bepaalt of Google jouw content mag gebruiken voor Gemini-training en voor het onderbouwen van Gemini-antwoorden. Op je plek in Google Search heeft het geen invloed. Daar staat geen directe verwijzing of bezoeker tegenover: je content wordt onderdeel van wat het model weet. Juist hier verschilt de afweging: voor een lokale dienstverlener is meetrainen meestal gunstig, een publisher met betaalde content staat daar vaak anders in.

### User-triggered fetchers

Bezoekers zoals ChatGPT-User en Perplexity-User halen een pagina op het moment dat een gebruiker er in een gesprek om vraagt. Ze gedragen zich meer als een menselijke bezoeker dan als een klassieke crawler: er zit iemand achter met een concrete vraag. Deze categorie blokkeren betekent dat het AI-antwoord jouw pagina niet kan inzien, precies op het moment dat iemand naar jou vraagt.

## laten (al specifiek genoeg)

Drie fouten komen we in de praktijk steeds opnieuw tegen:

- **Alles blokkeren met `User-agent: *`.** Een algemene blokkade, vaak ooit ingesteld tegen scrapers of voor een testomgeving, geldt ook voor elke AI-bot die zich netjes aan de regels houdt. Nieuwe AI-crawlers vallen automatisch onder die wildcard, dus je sluit ook deuren waarvan je het bestaan niet kent.
- **Verouderde botnamen laten staan.** Online circuleren kant-en-klare blokkadelijsten van jaren geleden, terwijl AI-bedrijven hun botnamen regelmatig wijzigen en nieuwe bots lanceren. Wie zo’n lijst ooit heeft overgenomen, blokkeert nu mogelijk namen die niet meer in gebruik zijn en mist juist de bots die er vandaag toe doen.
- **Blokkeren en toch verwachten dat je geciteerd wordt.** Een citatiecrawler die jouw site niet mag ophalen, kan jou ook niet als bron opvoeren. Het antwoord verwijst dan naar een concurrent die wel bereikbaar is. Wie zichtbaar wil zijn in AI-antwoorden, moet de bijbehorende bots dus actief toelaten.

Benieuwd hoe zo’n bewuste configuratie eruitziet? Elk robots.txt-bestand is openbaar, dus ook [dat van onszelf](/robots.txt). Daarin zie je precies welke keuzes wij voor onze eigen site maken.

## Wat beoordeelt Citeerbaar aan je robots.txt?

We brengen in kaart welke AI-bezoekers je website nu wel en niet bezoeken, en in welke configuratie de toegang staat. We adviseren welke toegangsregels passen bij jouw sector en doelstelling, en zetten de juiste configuratie voor je live.

## Waarom is dit per site anders?

De optimale toegangsregels verschillen per bedrijfstype. Een lokaal restaurant heeft baat bij maximale openheid voor klantgerichte AI-zoektools. Een publisher of kennisbank wil [bepaalde training-crawlers buiten houden](https://developers.google.com/crawling/docs/crawlers-fetchers/google-special-case-crawlers). Een softwarebedrijf weegt het afhankelijk van hun open-source strategie. We bepalen de juiste mix per klant.

Veelgestelde vragen

## De korte antwoorden.

### **Welke AI-crawlers bestaan er?**

De belangrijkste in 2026: GPTBot (OpenAI training), OAI-SearchBot (zoekindex ChatGPT), ChatGPT-User (ophalen op verzoek in ChatGPT), ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User en Bingbot (Microsoft Copilot). Google-Extended en Applebot-Extended zijn geen crawlers maar robots.txt-instellingen voor AI-training (bij Google ook voor het onderbouwen van Gemini-antwoorden).

### **Mogen AI-crawlers mijn site lezen?**

Standaard wel, tenzij je het in robots.txt blokkeert. Voor GEO wil je ze juist toelaten via Allow: / per crawler-agent. Sommige clients blokkeren training-bots zoals GPTBot maar laten search-bots wel toe.

## Bronnen en verdieping

Officiele documentatie en onderzoek waar dit artikel waar mogelijk op gebaseerd is.

- [robots.txt specificatie (RFC 9309)](https://www.rfc-editor.org/rfc/rfc9309.html) IETF Robots Exclusion Protocol standaard
- [OpenAI GPTBot documentation](https://developers.openai.com/api/docs/bots) OpenAI crawler-toegang configureren
- [Anthropic ClaudeBot documentation](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) Anthropic crawler-toegang
- [Perplexity bot documentation](https://docs.perplexity.ai/docs/resources/perplexity-crawlers) PerplexityBot crawler-toegang
- [Google-Extended documentation](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers#google-extended) robots.txt-instelling voor Gemini-training en grounding
- [Apple: Applebot documentation](https://support.apple.com/en-us/119829) Applebot-Extended toegangsregels

Verder lezen

## Andere artikelen uit de blog.

Korte uitleg over AI-vindbaarheid, GEO, schema en hoe AI-tools je site lezen.

### [Google verbouwde AI Overviews in mei 2026. Dit verandert er voor je website.](https://www.citeerbaar.nl/blog/ai-overviews-update-mei-2026/)

Tussen 6 en 11 mei 2026 rolde Google een serie updates uit op AI Overviews. Bronlinks staan nu dichter bij de tekst, Reddit-quotes verschijnen in het antwoord, en FAQ rich results zijn verdwenen. Wat dat betekent voor sites die nog niet geciteerd worden.

### [Vijf op de zes fastfoodzaken onzichtbaar in AI](https://www.citeerbaar.nl/blog/restaurants-onzichtbaar-in-ai/)

Een rapport van Uberall (7 mei 2026) laat zien dat 83 procent van de vestigingen van fastfoodketens niet voorkomt in AI-aanbevelingen, terwijl 86 procent wel op Google staat. Het verschil zit niet in marketing, maar in hoe je site door AI gelezen wordt.

### [Citation density: zo word je het citaat in Google AI](https://www.citeerbaar.nl/blog/citation-density-zo-word-je-geciteerd/)

AI-antwoorden kunnen informatie uit meerdere bronnen combineren. Door belangrijke claims helder, specifiek en controleerbaar te formuleren, maak je passages makkelijker te begrijpen en eventueel als bron te gebruiken. Dat noemen wij citation density.
