LLM-ondersteunde beoordeling van 50.000 zoekopdrachten
Uitgangssituatie
Het bedrijf beheerde Google Shopping-campagnes voor kleding, accessoires en horloges. Die campagnes leverden dagelijks duizenden nieuwe zoektermen op.
Het marketingteam moest bepalen welke zoekopdrachten behouden of uitgesloten moesten worden en waar budget beter kon worden ingezet. Het volume was handmatig niet bij te houden. Merknamen van concurrenten, zoekopdrachten in de verkeerde categorie, termen voor aanpalende producten en dubbelzinnige specifieke zoekopdrachten stapelden zich sneller op dan een handmatig proces kon verwerken.
Er bestond geen vaste methode om relevantie op schaal te beoordelen. Besluiten hingen af van persoonlijk oordeel en werden niet consequent toegepast tussen beoordelaars en campagnes. Termen die waarschijnlijk eerder hadden moeten worden uitgesloten, bleven actief. Twijfelgevallen bleven liggen omdat niemand tijd had om ze goed te beoordelen.
Het team zag geaggregeerde prestatiecijfers, maar had weinig zicht op welke afzonderlijke zoektermen werkelijk waarde toevoegden. De vraag was of dit systematischer kon.
Onze aanpak
We ontwierpen en voerden een gestructureerde beoordeling uit: kon een classificatiepijplijn met een LLM zoektermen beoordelen op een kwaliteitsniveau dat bruikbaar was in echte campagnes?
De pijplijn werd getest op zes dagen aan echte Shopping-campagnegegevens: circa 50.000 zoektermen en 197.000 vertoningen.
Voor iedere zoekterm beoordeelde het systeem de relevantie ten opzichte van de werkelijke productcatalogus. Het leverde een gestructureerde en controleerbare uitkomst: een beslissing — BEHOUDEN, BLOKKEREN, BEOORDELEN of VOLGEN —, een relevantiescore van 0 tot 1, een categorie, een begrijpelijke toelichting en waar nodig voorgestelde negatieve zoekwoorden.
De pijplijn was geen zwarte doos. Iedere classificatie kreeg een uitleg die het marketingteam kon lezen, betwisten en omzetten in een handeling. Dat was bewust: bij AI-ondersteund zoektermbeheer is controleerbaarheid net zo belangrijk als snelheid.
Ook uitzonderingen werden opgevangen. Dubbelzinnige of contextafhankelijke termen kregen BEOORDELEN in plaats van een automatische beslissing, zodat menselijke controle behouden bleef waar die het belangrijkst was. Termen met vroege signalen maar te weinig gegevens kregen VOLGEN voor latere herbeoordeling.
Wat de resultaten aangeven
De pijplijn classificeerde alle circa 50.000 zoektermen met een gestructureerde onderbouwing, wees 178 termen toe aan BLOKKEREN en vond ongeveer 8.800 mogelijke negatieve zoekwoorden voor menselijke beoordeling.
De belangrijkste waarde is prioritering. Bij een campagne met duizenden nieuwe termen per dag is het duurste probleem niet de overduidelijk irrelevante zoekopdracht, maar de term die ongemerkt budget verbruikt omdat niemand tijd heeft om ernaar te kijken. Zo'n pijplijn kan die termen als eerste naar voren halen, zodat handmatige aandacht gaat naar de grootste financiële blootstelling en niet naar een willekeurige volgorde.
Daarnaast wijst de beoordeling erop dat een team mogelijk het volledige dagelijkse volume kan verwerken zonder achterstanden op te bouwen, negatieve zoekwoorden kan baseren op systematische analyse in plaats van steekproeven en gestructureerd zicht kan houden op een zoektermlandschap dat handmatige beoordeling alleen nauwelijks kan bijhouden.
De proef liet zien dat de pijplijn op campagneschaal gestructureerde en uitlegbare classificaties kon produceren. Voor automatisering zou een volgende fase de nauwkeurigheid moeten meten, fouten analyseren en drempels voor menselijke beoordeling vastleggen.
Betekenis voor de directie
Dit was een gestructureerde beoordeling van de vraag of een LLM de controle van zoektermen kon ondersteunen, getest op echte campagnegegevens en op campagneschaal.
De pijplijn leverde herleidbare classificaties voor 50.000 termen en scheidde duidelijke acties van situaties waarin menselijk oordeel nodig was. Daarmee ontstond een praktische basis voor een gecontroleerde vergelijkings- en validatiefase.
Voor ingebruikname zijn afgesproken kwaliteitsdrempels, foutbewaking en menselijke controles nodig. De beoordeling leverde de onderbouwing voor die volgende beslissing.