Inference

Wat is inference?

Inference is het proces waarbij een getraind AI-model wordt gebruikt om een uitkomst te genereren. Het model krijgt nieuwe invoer, zoals een prompt, afbeelding of verzameling gegevens, en past daarop de patronen toe die het tijdens de training heeft geleerd. Bij een taalmodel bestaat de uitkomst bijvoorbeeld uit een antwoord, samenvatting of vertaling. Een model voor beeldherkenning kan tijdens inference bepalen welk object waarschijnlijk op een afbeelding staat.

Inference wordt ook wel de gebruiksfase van een AI-model genoemd. Het model leert tijdens dit proces normaal gesproken niet opnieuw. Het gebruikt de bestaande parameters om de invoer te verwerken en een voorspelling te maken. Een gesprek met een AI-tool kan uit meerdere inference-stappen bestaan, omdat het model telkens nieuwe tokens genereert op basis van de beschikbare context.

Het verschil tussen training en inference

Tijdens de training leert een AI-model patronen uit grote hoeveelheden training data. De parameters van het model worden daarbij steeds aangepast om betere voorspellingen te kunnen doen. Dit proces vraagt meestal veel rekenkracht en vindt plaats voordat het model beschikbaar wordt gemaakt voor gebruikers.

Bij inference staan de parameters in principe vast. Het model gebruikt wat het eerder heeft geleerd om nieuwe opdrachten uit te voeren. Een prompt verandert het onderliggende model dus niet, maar geeft context voor de huidige taak. Ook informatie binnen het context window wordt alleen voor die interactie gebruikt, tenzij een AI-systeem deze apart opslaat via AI memory.

Waarom inference belangrijk is

De snelheid en kosten van een AI-toepassing hangen voor een deel af van de inference. Een groot model heeft vaak meer rekenkracht nodig om een antwoord te genereren dan een kleiner model. Ook de lengte van de invoer, het aantal tokens in het antwoord en het aantal gebruikers hebben invloed op de benodigde capaciteit.

Voor sommige toepassingen is een snel antwoord belangrijker dan maximale nauwkeurigheid. Denk aan een chatbot die direct op eenvoudige vragen moet reageren. Bij uitgebreid onderzoek of analyse mag inference langer duren wanneer dit een beter resultaat oplevert. Organisaties moeten daarom afwegen welk model past bij de taak, de gewenste snelheid en de beschikbare kosten.

Inference kan plaatsvinden in de cloud, op een eigen server of lokaal op een apparaat. Welke aanpak geschikt is, hangt onder meer af van prestaties, privacy en technische mogelijkheden. Ongeacht de omgeving blijft controle belangrijk. Een model kan tijdens inference een aannemelijk maar onjuist antwoord genereren, waardoor menselijke beoordeling bij belangrijke toepassingen nodig blijft.

D2e99129 a242 4d39 94e8 4d250d781bca min

Klik_gevonden? Kom een koffietje met ons drinken