Drie collega's stellen op dezelfde middag dezelfde vraag aan drie verschillende AI-assistenten, benieuwd of het eigen merk genoemd wordt. De een krijgt het merk keurig in het lijstje, de ander ziet het pas als tweede keuze, de derde krijgt het merk helemaal niet te zien. Alle drie hebben gelijk over wat ze zagen, en toch spreken ze elkaar tegen zodra ze de resultaten naast elkaar leggen. Wie hieruit concludeert dat "het antwoord" nu bekend is, heeft in werkelijkheid een steekproef van één gezien, drie keer herhaald.

Waarom modellen verschillen

Verschillende AI-modellen komen tot verschillende antwoorden om een paar samenhangende redenen. Elk model is getraind op een andere verzameling data en heeft dus een ander uitgangspunt over wat "bekend" is. Sommige modellen gebruiken websearch om hun antwoord aan te vullen met actuele bronnen, andere leunen zwaarder op wat ze al tijdens de training hebben meegekregen. En zelfs bij een identieke vraag aan hetzelfde model kan het antwoord van beurt tot beurt verschillen, omdat een taalmodel met een zekere mate van variatie werkt in plaats van elke keer letterlijk hetzelfde te formuleren. Geen van deze verschillen is een fout; het is gewoon hoe deze systemen werken, en het betekent dat één blik op één model nooit het volledige beeld geeft.

Er komt nog een laag bovenop: modellen worden regelmatig bijgewerkt. Een antwoord dat vandaag klopt, hoeft over een paar weken niet meer te kloppen, simpelweg omdat de aanbieder een nieuwe versie heeft uitgerold met een ander gewicht aan bronnen of een andere manier van formuleren. Wie één keer een goed resultaat zag en daarna stopte met kijken, meet dus eigenlijk niets meer op het moment dat iemand er weken later naar vraagt.

Wat dat betekent voor meten

Als één model al van beurt tot beurt kan wisselen, dan is meten via één model per definitie onvolledig. De enige manier om een betrouwbaar beeld te krijgen, is dezelfde vragen herhaald te stellen aan meerdere providers, en de uitkomsten naast elkaar te leggen in plaats van op te tellen tot één cijfer. GripIQ laat prompts daarom periodiek beantwoorden via meerdere AI-providers, en volgt daarbij de modelversies die consumenten daadwerkelijk gebruiken, zodat een meting aansluit bij wat uw klanten vandaag te zien krijgen wanneer ze diezelfde vraag stellen.

Dat herhaalde meten over meerdere providers is ook de reden waarom een eenmalige demonstratie van een AI-assistent op kantoor weinig zegt. Een collega die op een dinsdagmiddag één assistent opent, ziet één momentopname van één model. Betrouwbare conclusies over uw zichtbaarheid vragen om dezelfde set vragen, herhaald over tijd en over providers, precies zoals u dat ook bij zoekwoordposities zou doen in plaats van op basis van één zoekopdracht een oordeel te vellen.

Lezen van een modelvergelijking

Op het dashboard toont de AI-modelvergelijking het percentage vermeldingen per aanbieder, met een tag-filter waarmee u die vergelijking kunt beperken tot een specifieke set prompts. Modelvarianten van dezelfde aanbieder worden daarbij samengeklapt, zodat de vergelijking leesbaar blijft in plaats van te verzanden in een lange lijst bijna-identieke modelnamen. Zo'n vergelijking laat u in één oogopslag zien of uw merk bij de ene aanbieder structureel beter scoort dan bij de andere, en dat is nuttige informatie: het wijst op een verschil in de bronnen die elk model gebruikt, niet op toeval.

De AI Monitor noemt de assistenten daarbij bij hun eigen naam, zoals ChatGPT, Gemini of Claude, in plaats van bij het bedrijf erachter. Dat is meer dan een cosmetisch detail: het is ook zo dat uw klanten de assistent noemen, en een vergelijking die dezelfde namen gebruikt, is direct te herkennen zonder eerst te moeten vertalen welke naam bij welke aanbieder hoort.

Wat u doet als één model u negeert

Ziet u dat uw merk bij één aanbieder consequent afwezig blijft terwijl het bij de andere wel verschijnt, dan is de eerste stap niet paniek, maar uitzoeken waarom. Kijk naar de bronvermeldingen bij de antwoorden van de aanbieders waar u wel verschijnt: welke sites voeden dat antwoord, en zijn die sites ook zichtbaar voor het model dat u mist. Vaak zit het verschil in welke bronnen een model meeneemt, niet in een oordeel over uw merk. Structureel afwezig blijven bij één aanbieder is een signaal om te volgen over de tijd, niet een reden om op basis van één meting bij te sturen.

Het is ook nuttig om te onthouden dat dit geen wedstrijd is waarin u één aanbieder als "de beste" moet aanwijzen. Elke aanbieder bedient een deel van de markt, en een merk dat structureel bij twee van de drie aanbieders opduikt, staat er beter voor dan een merk dat af en toe bij alle drie verschijnt zonder patroon. De vergelijking is bedoeld om gaten op te sporen, niet om aanbieders tegen elkaar uit te spelen.

Wat u nu kunt doen

  • Baseer een conclusie over uw zichtbaarheid nooit op één model of één losse vraag; kijk naar de modelvergelijking over meerdere providers.
  • Gebruik het tag-filter om de vergelijking te beperken tot de prompts die voor uw team het meest relevant zijn.
  • Zoek bij een structureel verschil tussen aanbieders eerst naar de bronnen die elk antwoord voeden, voor u concludeert dat er iets mis is met uw merk.

Wilt u weten hoe u een goede promptset samenstelt om deze vergelijking op te baseren? Lees Zo kiest u de prompts die uw markt echt stelt. Voor de bredere vraag waarom het ene merk vaker genoemd wordt dan het andere, leest u Waarom uw concurrent vaker genoemd wordt.

Wilt u de modelvergelijking met uw eigen merk bekijken? Vraag een demo aan.