Inference: waarom hetzelfde antwoord er soms anders uitziet
Je stelt AI twee keer dezelfde vraag en krijgt twee net andere antwoorden terug, of je wacht ineens langer op een reactie. Dat zit in hoe het model werkt: het bouwt elk antwoord ter plekke opnieuw op. Dat moment heet inference, en het verklaart een hoop vreemd gedrag.
Introductie
Je stelt AI twee keer achter elkaar exact dezelfde vraag, en krijgt twee net iets andere antwoorden terug. Of je merkt dat je bij de ene vraag meteen antwoord krijgt en bij de andere een paar seconden moet wachten. Het voelt alsof er iets wisselvalligs aan de hand is, maar er zit een vaste reden achter.
Denk aan een kok die jarenlang geoefend en gekookt heeft. Op het moment dat er een bestelling binnenkomt, gaat hij niet opnieuw leren koken: hij past ter plekke toe wat hij al kan, voor dit ene gerecht, op basis van wat er nu op het bord moet komen. Zo werkt een AI-model ook: het is eerst getraind, en gebruikt die training vervolgens elke keer opnieuw om, stukje voor stukje, een nieuw antwoord op te bouwen.
Dat moment van ter plekke toepassen heeft een naam: inference. Trainen gebeurt één keer, of af en toe opnieuw, door de aanbieder van het model. Inference gebeurt elke keer dat jij een vraag stelt, zonder dat het model er iets bij leert van jouw gesprek.
Waarom is dit belangrijk?
Zodra je weet dat elk antwoord een aparte, losse inference-stap is, snap je de twee ervaringen uit de intro meteen. Twee identieke vragen leveren soms een net ander antwoord op omdat het model het antwoord telkens opnieuw genereert op basis van waarschijnlijkheden, niet omdat het iets opzoekt. En een antwoord komt trager binnen naarmate de vraag groter of complexer is: meer rekenwerk kost meer tijd.
Het verklaart ook waarom een model niets automatisch onthoudt tussen gesprekken door, en geen weet heeft van wat er sinds zijn training in de wereld is veranderd, tenzij het actief zoekt of jij het aanreikt.
Voor bedrijven die AI inzetten in een product is inference ook een kostenpost: elke aanvraag kost rekenkracht, ongeacht of het antwoord goed uitpakt.
Wanneer gebruik je dit?
- Ondernemer (MKB): je gebruikt een AI-chatbot om snel op leads te reageren. Komt een antwoord traag binnen bij een lange, ingewikkelde vraag, dan komt dat door de omvang van de taak, niet door een storing.
- Verkoop/zzp'er: je vraagt AI twee keer om hetzelfde soort tekst en krijgt telkens een net andere formulering terug. Dat hoort bij hoe inference werkt, geen reden tot zorg.
- Office/administratie: je zet AI in voor terugkerende taken zoals verslagen opstellen. Bouw een vaste, korte briefing die je telkens meegeeft, zodat elke inference met dezelfde basis start.
- Corporate teams (manager, HR, marketing, IT): IT ontwerpt een systeem waarin AI live klantvragen beantwoordt en houdt rekening met tijd en kosten per aanroep, HR laat sollicitaties voorsorteren en weet dat elk gesprek een onafhankelijke inference is, en manager en marketing vragen zich af waarom "hetzelfde" antwoord soms toch anders klinkt.
Stap voor stap
- Besef dat elk antwoord opnieuw wordt gegenereerd: het model onthoudt niets tussen aparte gesprekken door.
- Geef relevante achtergrond steeds mee in de prompt, verwacht niet dat het model die al kent.
- Accepteer kleine verschillen tussen twee keer dezelfde vraag stellen: dat is normaal gedrag.
- Vraag bij twijfel over actualiteit expliciet of het model recente informatie heeft, of geef die zelf mee.
- Bouw bij herhaald gebruik een vaste, korte briefing die je telkens meegeeft, zodat elke inference met dezelfde basis start.
Praktijkvoorbeeld
Een klantenserviceteam gebruikt een AI-chatbot voor veelgestelde vragen. Een medewerker merkt dat de bot twee klanten met dezelfde vraag net iets anders antwoordt, en denkt dat er iets kapot is.
Dit blijkt normaal: elke vraag wordt apart verwerkt via een nieuwe inference-stap, gebaseerd op waarschijnlijkheden. Het team past de system prompt aan zodat de bot een vaste toon en structuur aanhoudt, waardoor de stijl consistenter wordt, ook al blijft de exacte formulering net anders.
Direct toepassen
- Gebruik dit morgen als een AI-model "niets meer weet" van een vorig gesprek: start met een korte samenvatting van de relevante achtergrond.
- Gebruik dit morgen bij een tijdgevoelige taak: vraag expliciet of het model actuele informatie heeft, en vul zelf aan als dat niet zo is.
- Gebruik dit morgen bij een terugkerende taak in een team: leg een vaste, korte briefing vast die iedereen meegeeft, zodat elke inference dezelfde basis heeft.
Promptbibliotheek
Alle modellen (ChatGPT, Claude, Gemini, Copilot)
Voordat je antwoord geeft: geef aan of je informatie uit je training
gebruikt of dat je (indien beschikbaar) actief zoekt naar actuele
gegevens. Als je geen actuele informatie hebt over dit onderwerp,
zeg dat expliciet in plaats van te gokken.
Claude
Behandel dit als een volledig nieuw gesprek: ik geef je hieronder
alle achtergrond die je nodig hebt, ga niet uit van eerdere gesprekken
die we samen gehad zouden hebben.
Achtergrond: [korte samenvatting van de situatie]
Vraag: [jouw vraag]
Veelgemaakte fouten
- Verwachten dat een model zich een eerder gesprek herinnert zonder die informatie opnieuw mee te geven.
- Denken dat een AI-antwoord altijd actuele informatie bevat, terwijl het model "denkt" met wat het tijdens de training meekreeg.
- Schrikken van kleine verschillen tussen twee keer dezelfde vraag: dat hoort bij hoe inference werkt.
- Bij een live toepassing geen rekening houden met tijd en kosten van elke inference-aanroep, vooral bij veel gebruikers tegelijk.
Best practices
- Geef relevante context altijd expliciet mee, ga niet uit van geheugen tussen gesprekken.
- Vraag bij tijdgevoelige onderwerpen na of het model actuele informatie heeft, en vul aan waar nodig.
- Bouw voor terugkerende taken een vaste, korte instructie voor consistentere resultaten.
- Houd bij het ontwerpen van AI-toepassingen rekening met de rekentijd en kosten van elke aanvraag.
Oefening
Stel dezelfde vraag twee keer achter elkaar in een nieuw gesprek met een AI-model naar keuze, zonder verdere context. Vergelijk de twee antwoorden: wat blijft hetzelfde, en wat verschilt in formulering? Schrijf in twee zinnen op wat dit je leert over hoe inference werkt.