Embeddings
Wat zijn embeddings?
Embeddings zijn numerieke weergaven van informatie. Een embedding zet bijvoorbeeld een woord, zin, document of afbeelding om in een reeks getallen die een vector wordt genoemd. Deze getallen leggen kenmerken en betekenis vast op een manier die een computer kan verwerken. Embeddings worden veel gebruikt binnen taalmodellen, zoekfuncties en andere toepassingen van machine learning.
In een zogeheten embedding space worden gegevens met een vergelijkbare betekenis dicht bij elkaar geplaatst. De woorden “hond” en “puppy” zullen daar meestal dichter bij elkaar liggen dan “hond” en “boekhouding”. Het systeem kijkt dus niet alleen naar dezelfde woorden, maar ook naar inhoudelijke overeenkomsten. Hierdoor kan AI verbanden herkennen die met een gewone zoekopdracht op exacte termen lastiger te vinden zijn.
Hoe maakt een AI-model een embedding?
Een speciaal embeddingmodel verwerkt de invoer en vertaalt deze naar een vector. Tekst wordt eerst opgedeeld in tokens, waarna het model patronen en relaties tussen de onderdelen analyseert. De betekenis wordt vervolgens vastgelegd als een reeks getallen. De lengte en opbouw van deze vector hangen af van het gebruikte embeddingmodel.
Verschillende vectoren kunnen met een wiskundige berekening met elkaar worden vergeleken. Hoe kleiner de afstand tussen twee embeddings, hoe groter meestal de inhoudelijke overeenkomst. Hiervoor worden methoden gebruikt zoals cosine similarity, dot product en Euclidische afstand. De embeddings kunnen worden opgeslagen in een vector database, zodat grote hoeveelheden informatie snel op betekenis kunnen worden doorzocht.
Waar worden embeddings voor gebruikt?
Een bekende toepassing is semantic search. Daarbij zoekt een systeem naar informatie die inhoudelijk bij een vraag past, ook wanneer de gebruikte woorden niet exact overeenkomen. Iemand kan bijvoorbeeld zoeken naar “kosten verlagen met automatisering”, terwijl een relevant document spreekt over “efficiëntere bedrijfsprocessen”. Embeddings helpen om deze inhoudelijke relatie te herkennen.
Ze worden ook gebruikt voor aanbevelingen, het groeperen van vergelijkbare documenten en het classificeren van teksten. Binnen een AI-systeem kunnen embeddings relevante informatie uit een kennisbank ophalen voordat een taalmodel antwoord geeft. Dit vormt vaak een onderdeel van RAG, waarbij externe informatie aan de context van het model wordt toegevoegd.
Embeddings zijn krachtig, maar begrijpen informatie niet op dezelfde manier als een mens. De kwaliteit hangt af van het gebruikte model, de ingevoerde gegevens en het doel waarvoor de embeddings zijn gemaakt. Een hoge numerieke overeenkomst betekent bovendien niet automatisch dat twee stukken informatie in iedere situatie hetzelfde betekenen. Test daarom altijd of de gekozen methode passende resultaten oplevert voor de uiteindelijke toepassing.