Jesse Commandeur logo

Waar haalt ChatGPT zijn informatie vandaan? Zo werkt “Labrador”

10 september 2026 · 9 min leestijd

Inhoud

Twee jaar lang gold één simpele stelregel: scoor goed in Bing en ChatGPT vindt je vanzelf. Die vlieger gaat niet meer op.

OpenAI bouwt al enkele jaren aan een eigen zoekindex. Die index draait inmiddels mee in echte gesprekken. OpenAI bevestigt zelf dat ChatGPT geïndexeerde en gecachete webcontent kan gebruiken. Onderzoek van Peec AI wijst erop dat een deel van die infrastructuur intern de naam “Labrador” draagt. Jouw zichtbaarheid in ChatGPT hangt dus niet langer aan één externe zoekmachine.

ChatGPT verklapte twee maanden lang zijn eigen bronnen

Tomek Rudzki van Peec AI publiceerde op 4 september 2026 zijn analyse. Tussen 21 mei en 21 juli 2026 dook een veld op in de server-side events van ChatGPT: result_source.

Die server-side events vormen de datastroom die de servers van ChatGPT naar je browser sturen terwijl het antwoord verschijnt. Het veld bevatte vier terugkerende waarden: Labrador, Bright, Oxylabs en SERP.

Bright wordt gekoppeld aan Bright Data en Oxylabs aan de gelijknamige dataprovider. SERP lijkt een apart kanaal voor zoekresultaten. Labrador wijst volgens het onderzoek op OpenAI’s eigen index. OpenAI heeft de codenaam Labrador zelf niet openbaar gedocumenteerd.

Wat is Labrador precies?

Labrador lijkt geen enkele grote database te zijn. Het onderzoek van Peec AI naar de index van ChatGPT wijst op een familie van gespecialiseerde indexen, elk gericht op een ander type content.

Rudzki trof indexen aan voor het algemene web, PDF’s, YouTube, nieuws, arXiv, Wikipedia, lokale resultaten, finance, juridisch, medisch, shopping en afbeeldingen. De nieuwsindex kent zelfs verschillende lagen voor recente en oudere content.

Volgens de aangetroffen gegevens bewaart Labrador onder meer de tekst van de pagina, crawldatum en publicatiedatum. Daarmee lijkt de opbouw op die van traditionele zoekmachines: een brede webindex met aparte onderdelen voor specifieke soorten informatie.

Die nieuwslagen vertellen je iets praktisch. Verse content wordt binnen het systeem anders behandeld dan oudere content. Zorg daarom dat je publicatiedatum en eventuele wijzigingsdatum duidelijk is en leesbaar is voor machines. Dat helpt systemen om te begrijpen hoe actueel een artikel is. Het onderzoek bewijst alleen niet dat een publicatiedatum op zichzelf een rankingfactor binnen Labrador is.

Hoe weten we dat OpenAI dit echt zelf bouwt?

Nick Turley, Head of Product bij ChatGPT, getuigde in de Amerikaanse antitrustzaak tegen Google over OpenAI’s zoekplannen. Hij vertelde dat OpenAI problemen zag met de kwaliteit van zoekdata van bestaande partners. OpenAI wilde ook toegang tot de zoektechnologie van Google, maar Google wees die samenwerking af.

Tegelijk bouwde OpenAI aan een eigen index. Het bedrijf hanteerde daarbij een zogenoemde 80/20-benadering: ongeveer 80 procent van de zoekvragen zou met een eigen index haalbaar moeten zijn. De laatste 20 procent is veel moeilijker, omdat die bestaat uit zeldzame en zeer specifieke zoekvragen.

Turley schatte tijdens de rechtszaak dat OpenAI ongeveer vijf jaar nodig zou kunnen hebben om een eigen index te bouwen die 100 procent van de vragen kan afhandelen, zelfs wanneer het toegang zou krijgen tot Google’s zoekdata. Hij gaf daarbij zelf aan dat hij de moeilijkheid van dit probleem eerder had onderschat.

Vacatures van OpenAI bevestigen het beeld verder. Een vacature voor Engineering Manager Online Data Systems beschrijft eigen database- en indextechnologie op multi-region-, multi-cloud- en exabyteschaal. Ook noemt OpenAI expliciet indexing technologies en vector search.

De techniek achter ChatGPT Shopping

Bij shopping zie je de eigen index het duidelijkst in actie. Rudzki zag midden augustus 2026 een A/B-test met de naam prefer-index-over-serp-v3. Die test draaide op dat moment bij ongeveer 8 procent van de gesprekken.

Op 2 september 2026 zag hij minstens vijf shoppingexperimenten tegelijk. Volgens zijn analyse gebruikten twee daarvan bevestigd de eigen index van ChatGPT.

Bij een andere shoppingtest waren meer technische details zichtbaar. Een BM25-component beperkte de selectie tot tien bronnen voor ranking. Daarnaast was er een rerank400-onderdeel dat een pool van 400 kandidaten opnieuw rangschikte en een prod400-onderdeel met 400 producten als input.

Daarbovenop draaide approximate nearest neighbor, oftewel vector search. In de aangetroffen configuratie stonden dimensies van 12.288 en 4.096. Je ziet hier dus zowel zoeken op woorden als zoeken op betekenis terug.

Dat is interessant voor productteksten. BM25 kijkt sterk naar de woorden die in je content staan. Vector search kan ook overeenkomsten in betekenis vinden wanneer iemand andere woorden gebruikt.

Daarom blijft volledige productinformatie belangrijk. Noem niet alleen je merk en productnaam, maar beschrijf ook materiaal, afmetingen, eigenschappen en toepassingen. We weten alleen niet precies hoeveel gewicht ChatGPT aan ieder veld geeft. Uit deze tests kun je dus niet concluderen dat een bepaald aantal woorden of specificaties automatisch voor een betere positie zorgt.

Waarom ChatGPT pagina’s uit een cache kan halen

Bij miljoenen zoekvragen is het niet efficiënt om iedere webpagina voor iedere vraag opnieuw live op te halen. OpenAI bevestigt zelf dat ChatGPT gebruik kan maken van geïndexeerde en gecachete webcontent.

Peec AI deed daarnaast een opvallende crawltest. Onderzoeker Metehan Yesilyurt zette een testsite op met één miljard pagina’s. Begin september 2026 had OpenAI ongeveer 6 miljoen daarvan gecrawld. Op dat moment kwamen er ongeveer 35.000 verzoeken per uur binnen.

Dat ondersteunt het beeld dat OpenAI op grote schaal pagina’s verzamelt voor later gebruik. Hoe OpenAI die pagina’s daarna precies verwerkt, filtert en omzet in embeddings is niet openbaar. Het is daarom te stellig om te zeggen dat iedere gecrawlde pagina automatisch in een vaste cache terechtkomt of vooraf een embedding krijgt.

Voor jou heeft zo’n cache wel een mogelijke keerzijde. De opgeslagen versie kan ouder zijn dan je huidige pagina. OpenAI waarschuwt daar zelf voor: de dekking en actualiteit van geïndexeerde content verschilt per website en pagina en er is geen vaste termijn waarbinnen een URL opnieuw wordt bijgewerkt.

Drie checks van tien minuten

Hieronder deel ik graag drie eenvoudige checks met je:

Staat jouw pagina al in de index of cache?

Zet Lockdown Mode aan via de beveiligingsinstellingen van ChatGPT. In deze modus kan ChatGPT binnen geschikte werkruimtes gebruikmaken van content die al bij OpenAI is geïndexeerd of gecachet.

Vraag ChatGPT daarna om een specifieke URL van je website te openen of de inhoud ervan te beschrijven. Kan ChatGPT die URL via offline web search gebruiken, dan is de pagina beschikbaar in de index of cache van OpenAI.

Rudzki testte dit onder meer met pagina’s van Search Engine Journal, Search Engine Land en Search Engine Roundtable.

Welke OpenAI-bot bezoekt je site?

Splits je serverlogs per bot, want OpenAI gebruikt verschillende bots voor verschillende doelen.

Volgens de officiële documentatie van OpenAI over zijn crawlers crawlt OAI-SearchBot websites zodat pagina’s kunnen verschijnen in de zoekfuncties van ChatGPT. GPTBot crawlt content die mogelijk wordt gebruikt om de generatieve basismodellen van OpenAI te verbeteren en te trainen. ChatGPT-User bezoekt pagina’s bij bepaalde acties die een gebruiker zelf start.

Behandel deze bots dus niet als één groep. Je kunt GPTBot bijvoorbeeld blokkeren voor training en OAI-SearchBot tegelijkertijd toegang geven voor ChatGPT Search.

Blokkeert je robots.txt de verkeerde bot?

Lees je robots.txt regel voor regel. Wil je kans maken om als bron in ChatGPT Search te verschijnen, geef OAI-SearchBot dan toegang.

OpenAI zegt dat websites die OAI-SearchBot blokkeren niet via deze crawler beschikbaar worden gemaakt voor ChatGPT Search. Een URL kan in sommige gevallen nog wel op andere manieren als link verschijnen.

Controleer daarnaast je CDN en firewall. Een goede robots.txt helpt je niet wanneer een beveiligingsregel de crawler alsnog blokkeert.

Let bij Cloudflare wel op het verschil tussen search-, training- en agentbots. Cloudflare biedt aparte instellingen om AI-crawlers te beheren of te blokkeren. Controleer daarom welke categorie je blokkeert voordat je alle AI-bots uitsluit.

Wat betekent dit voor je AI-strategie?

Google en Microsoft tellen nog altijd mee. Peec AI beschrijft bijvoorbeeld een experiment waarbij Malte Landwehr een website zonder organisch verkeer gebruikte en alleen op vaste dagen via ChatGPT naar die site zocht. Search Console liet op die dagen activiteit zien. Peec ziet dit als aanwijzing dat Google nog een rol speelt binnen de zoekstack van ChatGPT.

Ook Microsoft speelt aantoonbaar een rol. Microsoft noemt zijn zoekplatform Web IQ als infrastructuur die onder andere ChatGPT ondersteunt. Web IQ is gebouwd op technologie uit Bing en richt zich op snelle informatievoorziening voor AI-systemen.

Daarnaast vond Peec AI minstens acht andere bronnen en datakanalen in de bredere retrievalstack, waaronder Yelp en TripAdvisor. Welke bron ChatGPT gebruikt, kan verschillen per type vraag.

Draait jouw bedrijf op lokale vindbaarheid? Zorg dan dat belangrijke externe vermeldingen zoals TripAdvisor correct en volledig is. Zie ze alleen niet als dé belangrijkste rankingfactor. Daarvoor is nog geen bewijs.

Meet je zichtbaarheid in ChatGPT daarom apart van je posities in Bing en Google. Alleen goed scoren in Bing betekent niet automatisch dat je ook zichtbaar bent in ChatGPT.

En houd er rekening mee dat het systeem snel verandert. De technische velden en experimenten die onderzoekers vandaag zien, kunnen over een paar weken alweer verdwenen of aangepast zijn.

Veelgestelde vragen

Ik licht graag een aantal veelgestelde vragen toe:

Heeft ChatGPT een eigen zoekindex?
Ja. OpenAI bevestigt dat ChatGPT eigen geïndexeerde en gecachete webcontent kan gebruiken. Onafhankelijk onderzoek van Peec AI wijst erop dat een deel van de eigen retrievalinfrastructuur intern Labrador heet. Die codenaam is niet officieel door OpenAI gedocumenteerd.

Waar haalt ChatGPT zijn informatie vandaan?
Uit een mix van bronnen. Daaronder vallen OpenAI’s eigen index en cache, maar ook externe zoek- en datadiensten. Onderzoekers zagen onder meer Bright Data, Oxylabs, Yelp en TripAdvisor terug.

Wat is het verschil tussen OAI-SearchBot en GPTBot?
OAI-SearchBot crawlt pagina’s voor de zoekfuncties van ChatGPT. GPTBot crawlt content die mogelijk wordt gebruikt voor het trainen en verbeteren van de basismodellen van OpenAI. Je kunt beide bots apart toestaan of blokkeren.

Betekent zichtbaarheid in Bing ook zichtbaarheid in ChatGPT?
Nee. ChatGPT gebruikt meerdere manieren om informatie te vinden. Microsoft-technologie speelt nog steeds een rol, maar OpenAI beschikt ook over eigen indexing en gebruikt andere databronnen. Meet je zichtbaarheid in ChatGPT daarom los van je rankings in Bing.

Hoe controleer ik of ChatGPT mijn pagina heeft opgeslagen?
Als je toegang hebt tot een ChatGPT-configuratie met offline web search, kun je vragen om een specifieke URL te gebruiken. Als ChatGPT de inhoud van die URL via offline web search kan ophalen, is die pagina beschikbaar in de index of cache van OpenAI. Houd er rekening mee dat de opgeslagen versie ouder kan zijn dan de live pagina.

Ik verkoop producten. Waar let ik dan op?
Zorg vooral voor volledige en duidelijke productinformatie. Uit shoppingexperimenten blijkt dat ChatGPT zowel lexicale zoektechnieken zoals BM25 als vector search gebruikt. Duidelijke titels, relevante specificaties en goede beschrijvingen geven zulke systemen meer informatie om je product te begrijpen. Er is nog geen openbare formule waarmee je kunt voorspellen wanneer een product daadwerkelijk wordt geselecteerd.

Wil je weten hoe jij vindbaar kan worden in ChatGPT? Neem gerust contact op via jessecommandeur.nl.

Jesse Commandeur aan het werk

Over: Jesse Commandeur

Freelance SEO en AI SEO specialist bij Commandeur Marketing

Jesse werkte bij een online marketingbureau voordat hij in 2021 Commandeur Marketing begon. Inmiddels hielp hij ruim 75 bedrijven aan meer omzet en leads uit Google en AI, van mkb tot webshop. Hij doet techniek, content en autoriteit zelf, zonder tussenlagen en zonder jaarcontract. Daarnaast runt hij zijn eigen webshop Geurvana, waar hij dezelfde aanpak in de praktijk test, en bouwt hij eigen tooling om SEO werkzaamheden nog efficiënter te maken.