Vector database

Wat is een vector database?

Een vector database is een database die is ingericht voor het opslaan en doorzoeken van vectoren. Zo’n vector is een reeks getallen die de kenmerken of betekenis van informatie weergeeft. Teksten, afbeeldingen en andere gegevens kunnen met een embeddingmodel worden omgezet naar deze numerieke vorm. Informatie met een vergelijkbare betekenis krijgt doorgaans een vergelijkbare positie in de zogeheten vectorruimte.

Een gewone database zoekt vaak naar exacte waarden, woorden of voorwaarden. Een vector database zoekt juist naar gegevens die inhoudelijk het meest op een zoekvraag lijken. Hierdoor kan een zoekopdracht naar “kosten besparen met automatisering” ook documenten vinden waarin termen als “efficiëntere processen” of “minder handmatig werk” staan. De woorden hoeven dus niet precies met elkaar overeen te komen.

Hoe werkt zoeken met vectoren?

Voordat informatie wordt opgeslagen, zet een embeddingmodel ieder document of tekstgedeelte om in een vector. De zoekvraag van de gebruiker wordt met hetzelfde model eveneens omgezet. De vector database vergelijkt vervolgens de afstanden tussen de zoekvector en de opgeslagen vectoren. De resultaten die het dichtst in de buurt liggen, worden als meest vergelijkbaar teruggegeven. Dit wordt vector search, similarity search of nearest-neighbor search genoemd.

Naast de vector kan de database aanvullende gegevens opslaan, zoals de oorspronkelijke tekst, een documentnaam, datum of categorie. Met filters kan de zoekopdracht worden beperkt tot informatie die aan bepaalde voorwaarden voldoet. Vector search kan ook worden gecombineerd met zoeken op exacte woorden. Deze hybride zoekmethode is nuttig wanneer zowel betekenis als specifieke productnamen, codes of vaktermen belangrijk zijn.

Toepassingen en aandachtspunten

Vector databases worden gebruikt voor semantische zoekfuncties, aanbevelingen en het vinden van vergelijkbare afbeeldingen of documenten. Ze spelen daarnaast vaak een rol bij RAG, oftewel Retrieval-Augmented Generation. Daarbij zoekt een AI-systeem eerst relevante informatie uit een eigen kennisbron. Die informatie wordt daarna als context aan een LLM toegevoegd, zodat het antwoord beter aansluit op interne of actuele gegevens.

Niet iedere toepassing heeft een afzonderlijke vector database nodig. Vector search kan ook worden toegevoegd aan bestaande databases, bijvoorbeeld via pgvector voor PostgreSQL. De juiste keuze hangt af van de hoeveelheid gegevens, gewenste zoeksnelheid, beschikbare filters en technische omgeving. Ook het embeddingmodel en de kwaliteit van de opgeslagen informatie bepalen hoe bruikbaar de resultaten zijn. Een vector database vindt vooral overeenkomst en kan niet zelfstandig beoordelen of informatie feitelijk juist of geschikt voor de situatie is.

D2e99129 a242 4d39 94e8 4d250d781bca min

Klik_gevonden? Kom een koffietje met ons drinken