Entity Recognition

Herken welke woorden een merk, producttype of harde eigenschap zijn.

Entity recognition benoemt de betekenisvolle onderdelen van een zoekvraag. Het systeem ziet daardoor niet alleen losse woorden, maar herkent bijvoorbeeld een merk, modelcode, maat, materiaal en productcategorie. Die structuur maakt nauwkeuriger zoeken en filteren mogelijk.

Wat is een entiteit in webshopsearch?

Een entiteit is een herkenbaar onderdeel met een specifieke rol. In “Nike hardloopschoen dames maat 39” zijn Nike, hardloopschoen, dames en maat 39 verschillende entiteiten. Ze moeten niet alleen in de producttekst voorkomen; ze hebben elk een andere betekenis voor filtering en ranking.

Door die rollen te herkennen, kan de zoekmachine een merkfilter toepassen, het juiste producttype selecteren en maat 39 als harde voorwaarde behandelen. Zonder entity recognition kan een resultaat toevallig alle woorden bevatten, maar toch een verkeerd merk, doelgroep of maat tonen.

Welke entiteiten zijn belangrijk?

  • Merken en productlijnen, inclusief schrijfvarianten en afkortingen.
  • SKU’s, EAN’s en modelcodes die exact moeten blijven.
  • Producttypes en categorieën waarmee de relevante catalogusruimte wordt bepaald.
  • Attributen zoals kleur, materiaal, maat, vermogen, inhoud en aansluiting.
  • Toepassingen en compatibiliteit, bijvoorbeeld “voor buiten” of “geschikt voor model X”.
  • Hoeveelheden en eenheden, waarbij 10 mm iets anders betekent dan maat 10.

De juiste set verschilt per assortiment. Mode heeft andere kernentiteiten dan elektronica, bouwmaterialen of industriële onderdelen. De producttaxonomie en echte zoekvragen bepalen welke typen prioriteit krijgen.

Herkennen én koppelen

Het herkennen van een term is pas de eerste stap. Daarna moet de term worden gekoppeld aan de waarde in de productdata. “Donkerblauw”, “navy” en “marine” kunnen bijvoorbeeld naar dezelfde genormaliseerde kleurwaarde verwijzen, terwijl de originele klanttaal behouden blijft voor uitleg en analyse.

Voor merken en modelcodes is voorzichtigheid nodig. Een automatisch gecorrigeerde code kan naar een ander product verwijzen. Exacte cataloguswaarden, bekende aliassen en gecontroleerde synoniemen zijn daarom belangrijker dan brede taalassociaties.

Context voorkomt verkeerde labels

Dezelfde term kan meerdere rollen hebben. “Orange” kan een kleur, merk of productnaam zijn. “Pro” kan een serieaanduiding zijn, maar ook een algemeen woord. Entity recognition gebruikt omliggende woorden, categoriecontext en cataloguskennis om de waarschijnlijkste rol te bepalen.

Bij twijfel kan het systeem meerdere interpretaties meenemen en de uitkomst later laten beslissen door beschikbare producten, filters en confidence. Zo wordt een onzekere herkenning niet direct een harde uitsluiting.

Productdata als fundament

Entity recognition wordt sterker wanneer merken, categorieën en attributen in afzonderlijke velden staan. Als alle informatie alleen in één lange omschrijving zit, is het moeilijker om een herkende waarde betrouwbaar te koppelen en als filter te gebruiken.

Controleer daarom vaste eenheden, consistente waardelijsten, complete identifiers en een heldere categorieboom. Afwijkende schrijfwijzen kunnen worden gemapt, maar tegenstrijdige brondata moet bij de bron worden opgelost. De zoeklaag hoort geen onzeker productfeit te verzinnen.

Praktijkvoorbeeld

Bij “rode leren dameslaars maat 40” kan de zoekmachine laars als producttype herkennen, rood als kleur, leer als materiaal, dames als doelgroep en 40 als maat. Producten die semantisch op laarzen lijken maar niet in maat 40 beschikbaar zijn, vallen af wanneer voorraad per variant betrouwbaar beschikbaar is.

Ontbreekt materiaaldata bij een deel van het assortiment, dan kan de zoekmachine expliciet gemarkeerde leren producten hoger rangschikken en onbekende gevallen apart behandelen. Dat is transparanter dan aannemen dat iedere passende omschrijving leer betekent.

Kwaliteit controleren

Meet herkenning per entiteitstype. Kijk naar gemiste waarden, verkeerd gelabelde termen en foutieve koppelingen aan catalogusvelden. Gebruik echte zoekvragen, vooral combinaties met meerdere attributen en termen die in verschillende categorieën iets anders betekenen.

Findoviq gebruikt deze structuur om query understanding, constraints en hybride retrieval gerichter aan te sturen. Daardoor blijven modelcodes en harde eigenschappen beschermd, terwijl natuurlijke taal bruikbaar wordt voor een bredere productontdekking.

Bespreek jouw zoekvragen

Wil je weten hoe deze aanpak past bij jouw assortiment, productdata en klantgedrag? We bekijken samen welke querytypen prioriteit hebben en waar exacte, semantische en zakelijke signalen elkaar moeten aanvullen.

Plan een vrijblijvende demo Terug naar AI Search