# Welke soorten AI-bezoekers bestaan er?

> AI-crawlers vallen in drie groepen: zoeken en ophalen op verzoek, training en rommelbots. Welke je toelaat is een strategische keuze voor je AI-vindbaarheid.

Bron: https://www.citeerbaar.nl/blog/welke-ai-crawlers-bestaan-er/

Door [Ronald Wildschut](https://www.citeerbaar.nl/over-ronald/) · Gepubliceerd: 12 mei 2026 · Laatst bijgewerkt: 4 oktober 2026 · 5 min leestijd

AI-bezoekers vallen in drie groepen: bots voor zoeken en ophalen op verzoek, training-crawlers en rommelbots. Welke je toelaat is een strategische keuze voor je AI-vindbaarheid.

In het kort

Er komen drie soorten AI-bots op je website: bots voor de zoek- en antwoordfuncties van AI, bots die taalmodellen trainen en bots die je niets opleveren. In de eerste groep zitten zoekcrawlers die een index bouwen, zoals OAI-SearchBot en PerplexityBot, en bots die een pagina ophalen als een gebruiker erom vraagt, zoals ChatGPT-User en Perplexity-User. Zet die groep open als je sector van vindbaarheid leeft. Een bezoek is nog geen vermelding of klik. Je regelt het per user-agent in robots.txt, afhankelijk van wat je publiceert.

Grofweg komen er drie soorten AI-bots op je website. De eerste groep maakt je [vindbaar in de zoek- en antwoordfuncties van AI](https://developers.openai.com/api/docs/bots): sommige bouwen een zoekindex, andere halen een pagina op als een gebruiker erom vraagt. De tweede traint er taalmodellen mee. De derde levert je niets. Hieronder per groep welke bots het zijn, te herkennen aan hun user-agent, en of je ze wilt toelaten.

## Welke AI-bots maken je vindbaar?

Deze bots maken het mogelijk dat je in AI-antwoorden terechtkomt. Er zitten twee functies in deze groep: zoekcrawlers bouwen een index, ophaalbots halen een pagina op als een gebruiker erom vraagt. Een bezoek betekent niet dat je pagina in het antwoord wordt gebruikt, geciteerd of aangeklikt. Zet ze open, zeker als je sector van vindbaarheid leeft.

- **OAI-SearchBot** en **ChatGPT-User** (OpenAI): de eerste is de crawler waarmee OpenAI websites in ChatGPT Search-resultaten kan tonen, de tweede haalt een pagina op als een gebruiker daar in ChatGPT om vraagt.
- **PerplexityBot** en **Perplexity-User**: de eerste bouwt de [zoekindex van Perplexity](https://docs.perplexity.ai/docs/resources/perplexity-crawlers), de tweede haalt een pagina op als een gebruiker erom vraagt.
- **Googlebot** plus **Google-Extended**: Googlebot indexeert je site voor Google Search en de AI Overviews die daarbovenop draaien. [Google-Extended](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers#google-extended) is geen aparte crawler maar een instelling in robots.txt, zie hieronder.
- **Bingbot**: voedt de Bing-index, die Microsoft Copilot en ChatGPT search onder meer gebruiken. Bing-zichtbaarheid helpt dus als je in Copilot gevonden wilt worden.
- **Claude-SearchBot** en **Claude-User** (Anthropic): de eerste bouwt de [zoekindex van Claude](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler), de tweede haalt een pagina op als een gebruiker erom vraagt.

## Wat doen de training-crawlers?

Deze bots halen je content op om er taalmodellen mee te trainen. Voor de een prima, want het vergroot de kans dat een model je later kent; voor de ander ongewenst, omdat je werk vrij wordt geoogst.

- **GPTBot** (OpenAI) traint toekomstige modellen en is los te regelen van de zoek-bots hierboven.
- **ClaudeBot** (Anthropic), **CCBot** (Common Crawl, de open dataset waar veel modellen op leunen) en **Meta-ExternalAgent** (Meta AI) verzamelen inhoud voor training. **Applebot-Extended** is geen crawler maar een regel in je robots.txt: daarmee bepaal je of Apple wat Applebot ophaalt mag gebruiken voor [Apple Intelligence](https://support.apple.com/en-us/119829). Je blijft gewoon vindbaar in Apples zoekresultaten.

Google-Extended hoort in geen van beide lijsten. Het is een instelling in robots.txt, geen aparte crawler met een eigen user-agent. Het regelt of inhoud die Google ophaalt mag worden gebruikt voor Gemini-training en voor het onderbouwen van Gemini-antwoorden. Het heeft geen invloed op je opname of positie in Google Search.

## Welke bots kun je beter weren?

**Bytespider** (ByteDance, het bedrijf achter TikTok) staat bekend als agressief en negeert soms afspraken. Daarnaast is er een reeks scraper- en aggregator-bots zoals Diffbot en ImagesiftBot die je content oogsten zonder er iets voor terug te doen. Deze groep levert je niets op en alleen serverbelasting. Weren doe je in robots.txt en, voor bots die zich daar niet aan houden, in je firewall.

## Hoe kies je per type bedrijf?

De juiste mix hangt af van wat je publiceert en voor wie:

- **Lokaal bedrijf of horeca**: maximaal open voor groep 1, want je wilt genoemd worden als iemand ChatGPT vraagt waar je in de buurt kunt eten. Training is minder relevant.
- **Publisher of contentmaker**: groep 1 open, groep 2 blokkeren, zodat je werk niet gratis wordt geoogst. GPTBot en Applebot-Extended zet je daarvoor los uit.
- **Dienstverlener met vakinhoud**: weeg per document af. Je algemene pagina’s open voor vindbaarheid, je diepste whitepapers eventueel dicht voor training.

## Waar gaat het in de praktijk mis?

We zien twee uitersten. Of alles staat wagenwijd open, inclusief de rommelbots. Of er staat een te brede blokkade, bijvoorbeeld een kale `Disallow: /` voor alles wat op een bot lijkt. Daarmee sluit je per ongeluk ook OAI-SearchBot en PerplexityBot buiten en word je onzichtbaar in AI-antwoorden. Beide kosten je zichtbaarheid of serverruimte. Het beheren van crawler-toegang is een van de vijf punten waarop [SEO voor AI-systemen](/blog/seo-voor-ai-systemen/) afwijkt van klassieke SEO.

Het regelen gebeurt per user-agent in je [robots.txt](/blog/robots-txt-ai-crawlers/). Dat is een instructie, geen beveiliging: nette crawlers houden zich eraan, maar voor bezoeken die een gebruiker zelf start kunnen andere regels gelden. OpenAI en Perplexity geven aan dat robots.txt dan niet altijd van toepassing is. Kijk daarom ook in je serverlogs en firewall. Er is geen universele configuratie die voor elke site klopt. Het hangt af van wat je publiceert en welke afweging je maakt tussen vindbaarheid en bescherming van je werk. Bij Citeerbaar brengen we als [GEO bureau](/geo-bureau/) in kaart welke bots je site bezoeken, stellen de juiste toegang per groep in en zetten dat live.

## Wat zegt onderzoek?

- **10+ AI-crawlers actief** vragen in 2026 toegang tot websites, van GPTBot tot Applebot-Extended, elk met een eigen rol in training of search. Bron: OpenAI, Anthropic, Perplexity, Microsoft, Google, Apple bot-documentatie
- **Bij bijna de helft van de zoekopdrachten** die BrightEdge volgt, staat al een AI Overview bovenaan (48 procent, februari 2026), gevoed door de gewone Google-index. Bron: [BrightEdge, februari 2026](https://www.brightedge.com/resources/weekly-ai-search-insights/ai-overviews-one-year-presence-size-citing)
- **Copilot leunt op Bing** er bestaat geen aparte Copilot-crawler, Microsoft gebruikt de Bing-zoekindex als primaire bron voor Copilot-antwoorden. Bron: [Microsoft Bing Webmaster Documentation 2024](https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0)

Veelgestelde vragen

## De korte antwoorden.

### **Welke AI-crawlers bestaan er in 2026?**

De belangrijkste AI-crawlers in 2026: GPTBot (OpenAI training), OAI-SearchBot (zoekindex ChatGPT), ChatGPT-User (ophalen op verzoek in ChatGPT), ClaudeBot (Anthropic training), Claude-SearchBot (zoekindex Claude), Claude-User (ophalen op verzoek in Claude), PerplexityBot (zoekindex Perplexity) en Perplexity-User (ophalen op verzoek in Perplexity). Daarnaast Bingbot (Bing-index, gebruikt door Microsoft Copilot) en CCBot (Common Crawl). Google-Extended en Applebot-Extended zijn geen crawlers maar robots.txt-instellingen voor AI-training (bij Google ook voor het onderbouwen van Gemini-antwoorden).

### **Wat is het verschil tussen training-crawlers en search-crawlers?**

Training-crawlers zoals GPTBot en ClaudeBot verzamelen inhoud voor modeltraining. Zoekcrawlers zoals OAI-SearchBot en PerplexityBot bouwen een zoekindex. ChatGPT-User en Perplexity-User halen een pagina op als een gebruiker erom vraagt. Een bezoek betekent niet dat je pagina in het antwoord wordt gebruikt, geciteerd of aangeklikt. Voor GEO laat je zoekcrawlers toe.

### **Welke AI-crawler hoort bij Microsoft Copilot?**

Microsoft Copilot gebruikt de Bing-zoekindex als primaire bron, en die wordt gevuld door Bingbot. Een aparte Copilot-crawler bestaat niet. Bingbot toelaten maakt indexering door Bing mogelijk, wat relevant is voor Copilot, maar garandeert geen indexatie of vermelding.

## Bronnen en verdieping

Officiele documentatie en onderzoek waar dit artikel waar mogelijk op gebaseerd is.

- [OpenAI bots documentation](https://developers.openai.com/api/docs/bots) GPTBot, OAI-SearchBot, ChatGPT-User
- [Anthropic crawler documentation](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) ClaudeBot, Claude-SearchBot, Claude-User
- [Perplexity bots documentation](https://docs.perplexity.ai/docs/resources/perplexity-crawlers) PerplexityBot en Perplexity-User
- [Microsoft Bing crawler list](https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0) Bingbot en gerelateerde crawlers
- [Google common crawlers: Google-Extended](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers#google-extended) robots.txt-instelling voor Gemini-training en grounding
- [Apple: Applebot-Extended](https://support.apple.com/en-us/119829) Regel voor AI-training

Verder lezen

## Andere artikelen uit de blog.

Korte uitleg over AI-vindbaarheid, GEO, schema en hoe AI-tools je site lezen.

### [GEO bureau kiezen: waar let je op?](https://www.citeerbaar.nl/blog/geo-bureau-kiezen/)

Vijf punten waar je op let bij het kiezen van een bureau voor AI-vindbaarheid, plus wat GEO, AEO en AI SEO als namen voor hetzelfde werk betekenen.

### [Citation density: zo word je het citaat in Google AI](https://www.citeerbaar.nl/blog/citation-density-zo-word-je-geciteerd/)

AI-antwoorden kunnen informatie uit meerdere bronnen combineren. Door belangrijke claims helder, specifiek en controleerbaar te formuleren, maak je passages makkelijker te begrijpen en eventueel als bron te gebruiken. Dat noemen wij citation density.

### [Google verbouwde AI Overviews in mei 2026. Dit verandert er voor je website.](https://www.citeerbaar.nl/blog/ai-overviews-update-mei-2026/)

Tussen 6 en 11 mei 2026 rolde Google een serie updates uit op AI Overviews. Bronlinks staan nu dichter bij de tekst, Reddit-quotes verschijnen in het antwoord, en FAQ rich results zijn verdwenen. Wat dat betekent voor sites die nog niet geciteerd worden.
