Evaluation

Meet AI search per querytype en bescherm wat al goed werkt.

Een demo met enkele mooie voorbeelden zegt weinig over dagelijkse zoekkwaliteit. Evaluation gebruikt vaste querysets, menselijke relevantiebeoordelingen en werkelijk zoekgedrag om te bepalen waar een wijziging helpt, waar zij schaadt en of de zoekervaring stabiel blijft.

Waarom één gemiddelde score niet genoeg is

Een wijziging kan natuurlijke taal verbeteren en tegelijk SKU-search verslechteren. Een algemeen gemiddelde kan die schade verbergen. Evalueer daarom per querytype, categorie, taal, apparaat en eventueel klantsegment.

Belangrijke segmenten zijn exacte identifiers, merken, categorieën, attributen, probleemgerichte vragen, long-tail queries en zoekvragen met constraints. Ieder segment heeft eigen succescriteria en risico’s.

Bouw een representatieve queryset

Gebruik echte geanonimiseerde zoekvragen uit de webshop, aangevuld met bedrijfskritieke cases. Neem zowel populaire queries als zeldzame moeilijke vragen op. No-results en vaak herformuleerde queries zijn extra waardevol omdat daar bestaande problemen zichtbaar zijn.

Bevries een kernset voor regressietests en vernieuw daarnaast periodiek een dynamische set. Zo bescherm je bekende kwaliteit zonder alleen voor historische vragen te optimaliseren.

Leg relevance judgments vast

Voor iedere query wordt beoordeeld welke producten zeer relevant, bruikbaar, marginaal of ongeschikt zijn. Bij technische producten hoort feitelijke compatibiliteit in die beoordeling. Bij brede inspiratievragen kunnen meerdere productgroepen relevant zijn.

Laat twijfelgevallen beoordelen door mensen met assortimentskennis. Documenteer waarom een resultaat relevant is; dat voorkomt dat beoordelingen bij een volgende ronde stilzwijgend een andere betekenis krijgen.

Offline metrics

  • Precision op de eerste posities: hoeveel vroege resultaten zijn werkelijk bruikbaar?
  • Recall: worden belangrijke passende producten überhaupt gevonden?
  • Rankingkwaliteit: staan de beste kandidaten hoger dan zwakkere alternatieven?
  • No-results: blijft de set leeg terwijl passend assortiment bestaat?
  • Regressies: welke eerder goede queries zijn achteruitgegaan?

Geen enkele metric vertelt het hele verhaal. Combineer ze met segmentanalyse en concrete foutvoorbeelden.

Online gedrag als aanvullend bewijs

Klikratio, productdetailbezoek, filtergebruik, herformuleringen, toevoegen aan winkelmand en conversie laten zien wat klanten doen. Ze moeten voorzichtig worden geïnterpreteerd: een hoge klikratio kan ook ontstaan doordat de klant meerdere verkeerde resultaten moet openen.

Bekijk daarom de hele zoekfunnel en vergelijk vergelijkbare periodes of gecontroleerde experimenten. Let op seizoenseffecten, campagnes en assortimentwijzigingen.

Golden queries en releasebescherming

Golden queries zijn bedrijfskritieke vragen die altijd correct moeten blijven, zoals bekende SKU’s, topmerken of veelgebruikte categorieën. Voor iedere release wordt automatisch gecontroleerd of de verwachte producten en posities behouden blijven.

Voeg nieuwe regressies toe aan deze set. Zo wordt iedere gevonden fout een blijvende test in plaats van een eenmalige handmatige correctie.

Van fout naar actie

Classificeer oorzaken: query understanding, ontbrekende entiteit, slechte productdata, verkeerde constraint, retrieval, ranking of merchandising. Een lage klikratio vraagt een andere oplossing wanneer de juiste producten ontbreken dan wanneer ze alleen te laag staan.

Findoviq koppelt evaluatie aan zoekanalytics en configuratiebeheer. Daardoor kan een team gericht aanpassen, opnieuw testen en alleen wijzigingen vrijgeven die aantoonbaar helpen zonder kritieke zoekroutes te beschadigen.

Bespreek jouw zoekvragen

Wil je weten hoe deze aanpak past bij jouw assortiment, productdata en klantgedrag? We bekijken samen welke querytypen prioriteit hebben en waar exacte, semantische en zakelijke signalen elkaar moeten aanvullen.

Plan een vrijblijvende demo Terug naar AI Search