Welke soorten AI-bezoekers bestaan er?

Welke AI-crawlers bestaan er?

AI-bezoekers vallen in drie groepen: bots voor zoeken en ophalen op verzoek, training-crawlers en rommelbots. Welke je toelaat is een strategische keuze voor je AI-vindbaarheid.

In het kort

Er komen drie soorten AI-bots op je website: bots voor de zoek- en antwoordfuncties van AI, bots die taalmodellen trainen en bots die je niets opleveren. In de eerste groep zitten zoekcrawlers die een index bouwen, zoals OAI-SearchBot en PerplexityBot, en bots die een pagina ophalen als een gebruiker erom vraagt, zoals ChatGPT-User en Perplexity-User. Zet die groep open als je sector van vindbaarheid leeft. Een bezoek is nog geen vermelding of klik. Je regelt het per user-agent in robots.txt, afhankelijk van wat je publiceert.

Grofweg komen er drie soorten AI-bots op je website. De eerste groep maakt je vindbaar in de zoek- en antwoordfuncties van AI: sommige bouwen een zoekindex, andere halen een pagina op als een gebruiker erom vraagt. De tweede traint er taalmodellen mee. De derde levert je niets. Hieronder per groep welke bots het zijn, te herkennen aan hun user-agent, en of je ze wilt toelaten.

Welke AI-bots maken je vindbaar?

Deze bots maken het mogelijk dat je in AI-antwoorden terechtkomt. Er zitten twee functies in deze groep: zoekcrawlers bouwen een index, ophaalbots halen een pagina op als een gebruiker erom vraagt. Een bezoek betekent niet dat je pagina in het antwoord wordt gebruikt, geciteerd of aangeklikt. Zet ze open, zeker als je sector van vindbaarheid leeft.

  • OAI-SearchBot en ChatGPT-User (OpenAI): de eerste is de crawler waarmee OpenAI websites in ChatGPT Search-resultaten kan tonen, de tweede haalt een pagina op als een gebruiker daar in ChatGPT om vraagt.
  • PerplexityBot en Perplexity-User: de eerste bouwt de zoekindex van Perplexity, de tweede haalt een pagina op als een gebruiker erom vraagt.
  • Googlebot plus Google-Extended: Googlebot indexeert je site voor Google Search en de AI Overviews die daarbovenop draaien. Google-Extended is geen aparte crawler maar een instelling in robots.txt, zie hieronder.
  • Bingbot: voedt de Bing-index, die Microsoft Copilot en ChatGPT search onder meer gebruiken. Bing-zichtbaarheid helpt dus als je in Copilot gevonden wilt worden.
  • Claude-SearchBot en Claude-User (Anthropic): de eerste bouwt de zoekindex van Claude, de tweede haalt een pagina op als een gebruiker erom vraagt.

Wat doen de training-crawlers?

Deze bots halen je content op om er taalmodellen mee te trainen. Voor de een prima, want het vergroot de kans dat een model je later kent; voor de ander ongewenst, omdat je werk vrij wordt geoogst.

  • GPTBot (OpenAI) traint toekomstige modellen en is los te regelen van de zoek-bots hierboven.
  • ClaudeBot (Anthropic), CCBot (Common Crawl, de open dataset waar veel modellen op leunen) en Meta-ExternalAgent (Meta AI) verzamelen inhoud voor training. Applebot-Extended is geen crawler maar een regel in je robots.txt: daarmee bepaal je of Apple wat Applebot ophaalt mag gebruiken voor Apple Intelligence. Je blijft gewoon vindbaar in Apples zoekresultaten.

Google-Extended hoort in geen van beide lijsten. Het is een instelling in robots.txt, geen aparte crawler met een eigen user-agent. Het regelt of inhoud die Google ophaalt mag worden gebruikt voor Gemini-training en voor het onderbouwen van Gemini-antwoorden. Het heeft geen invloed op je opname of positie in Google Search.

Welke bots kun je beter weren?

Bytespider (ByteDance, het bedrijf achter TikTok) staat bekend als agressief en negeert soms afspraken. Daarnaast is er een reeks scraper- en aggregator-bots zoals Diffbot en ImagesiftBot die je content oogsten zonder er iets voor terug te doen. Deze groep levert je niets op en alleen serverbelasting. Weren doe je in robots.txt en, voor bots die zich daar niet aan houden, in je firewall.

Hoe kies je per type bedrijf?

De juiste mix hangt af van wat je publiceert en voor wie:

  • Lokaal bedrijf of horeca: maximaal open voor groep 1, want je wilt genoemd worden als iemand ChatGPT vraagt waar je in de buurt kunt eten. Training is minder relevant.
  • Publisher of contentmaker: groep 1 open, groep 2 blokkeren, zodat je werk niet gratis wordt geoogst. GPTBot en Applebot-Extended zet je daarvoor los uit.
  • Dienstverlener met vakinhoud: weeg per document af. Je algemene pagina’s open voor vindbaarheid, je diepste whitepapers eventueel dicht voor training.

Waar gaat het in de praktijk mis?

We zien twee uitersten. Of alles staat wagenwijd open, inclusief de rommelbots. Of er staat een te brede blokkade, bijvoorbeeld een kale Disallow: / voor alles wat op een bot lijkt. Daarmee sluit je per ongeluk ook OAI-SearchBot en PerplexityBot buiten en word je onzichtbaar in AI-antwoorden. Beide kosten je zichtbaarheid of serverruimte. Het beheren van crawler-toegang is een van de vijf punten waarop SEO voor AI-systemen afwijkt van klassieke SEO.

Het regelen gebeurt per user-agent in je robots.txt. Dat is een instructie, geen beveiliging: nette crawlers houden zich eraan, maar voor bezoeken die een gebruiker zelf start kunnen andere regels gelden. OpenAI en Perplexity geven aan dat robots.txt dan niet altijd van toepassing is. Kijk daarom ook in je serverlogs en firewall. Er is geen universele configuratie die voor elke site klopt. Het hangt af van wat je publiceert en welke afweging je maakt tussen vindbaarheid en bescherming van je werk. Bij Citeerbaar brengen we als GEO bureau in kaart welke bots je site bezoeken, stellen de juiste toegang per groep in en zetten dat live.

Veelgestelde vragen

De korte antwoorden.

Welke AI-crawlers bestaan er in 2026?

De belangrijkste AI-crawlers in 2026: GPTBot (OpenAI training), OAI-SearchBot (zoekindex ChatGPT), ChatGPT-User (ophalen op verzoek in ChatGPT), ClaudeBot (Anthropic training), Claude-SearchBot (zoekindex Claude), Claude-User (ophalen op verzoek in Claude), PerplexityBot (zoekindex Perplexity) en Perplexity-User (ophalen op verzoek in Perplexity). Daarnaast Bingbot (Bing-index, gebruikt door Microsoft Copilot) en CCBot (Common Crawl). Google-Extended en Applebot-Extended zijn geen crawlers maar robots.txt-instellingen voor AI-training (bij Google ook voor het onderbouwen van Gemini-antwoorden).

Wat is het verschil tussen training-crawlers en search-crawlers?

Training-crawlers zoals GPTBot en ClaudeBot verzamelen inhoud voor modeltraining. Zoekcrawlers zoals OAI-SearchBot en PerplexityBot bouwen een zoekindex. ChatGPT-User en Perplexity-User halen een pagina op als een gebruiker erom vraagt. Een bezoek betekent niet dat je pagina in het antwoord wordt gebruikt, geciteerd of aangeklikt. Voor GEO laat je zoekcrawlers toe.

Welke AI-crawler hoort bij Microsoft Copilot?

Microsoft Copilot gebruikt de Bing-zoekindex als primaire bron, en die wordt gevuld door Bingbot. Een aparte Copilot-crawler bestaat niet. Bingbot toelaten maakt indexering door Bing mogelijk, wat relevant is voor Copilot, maar garandeert geen indexatie of vermelding.

Verder lezen

Andere artikelen uit de blog.

Korte uitleg over AI-vindbaarheid, GEO, schema en hoe AI-tools je site lezen.

/ 02

Citation density: zo word je het citaat in Google AI

AI-antwoorden kunnen informatie uit meerdere bronnen combineren. Door belangrijke claims helder, specifiek en controleerbaar te formuleren, maak je passages makkelijker te begrijpen en eventueel als bron te gebruiken. Dat noemen wij citation density.

Lees verder

Volgende stap

Wil je weten of jouw site al genoemd wordt?

Stuur je website. Wij checken hoe AI je nu beschrijft, wat ontbreekt en welke verbeteringen logisch zijn. Reactie binnen 2 werkdagen.