QA & Release-zekerheid
AI-evaluatie & -tests
Test de AI binnen je product, niet alleen de app eromheen. We evalueren antwoordkwaliteit, grounding, permissies en foutafhandeling in agents, chatbots en LLM-functies, en stellen heldere releasecriteria op.

Wie heeft AI-evaluatie nodig
Je AI-functie oogt goed in een demo, maar niemand kan nog zeggen hoe die zich gedraagt bij echte vragen, vijandige invoer en ontbrekende gegevens, of dat het volgende model of de volgende promptwijziging het slechter maakt.
- Teams die op het punt staan een chatbot of assistent voor klanten te plaatsen
- Producteigenaren die van model, provider of prompts wisselen en een vergelijking van voor en na nodig hebben
- Bedrijven die een agent interne records laten lezen of acties in andere systemen laten activeren
Hoe elk gedrag wordt geëvalueerd
Illustratief plan voor een klantgerichte assistent; methoden verschuiven met jouw use case en risico's.
| Geautomatiseerde evals | Beoordeling door experts | Red-team-testen | Productiesignalen | |
|---|---|---|---|---|
| Antwoordnauwkeurigheid | Primaire methode | Primaire methode | Hier zelden gebruikt | Ondersteunend of gesampled |
| Onderbouwing en bronvermeldingen | Primaire methode | Ondersteunend of gesampled | Hier zelden gebruikt | Ondersteunend of gesampled |
| Rechtengrenzen | Ondersteunend of gesampled | Primaire methode | Primaire methode | Ondersteunend of gesampled |
| Prompt injection | Ondersteunend of gesampled | Ondersteunend of gesampled | Primaire methode | Ondersteunend of gesampled |
| Weigeringen en fallbacks | Primaire methode | Ondersteunend of gesampled | Ondersteunend of gesampled | Primaire methode |
- Primaire methode
- Ondersteunend of gesampled
- Hier zelden gebruikt
AI-functies testen is een andere klus
Een chatbot kan elke functionele test doorstaan en toch zelfverzekerd een verkeerd antwoord geven, gegevens tonen die hij niet zou mogen, of instructies opvolgen die verborgen zitten in een geüpload bestand. AI-functies hebben hun eigen evaluatie nodig: datasets van echte en moeilijke gevallen, controles op antwoordkwaliteit en grounding, tool- en datapermissies, blootstelling aan prompt injection, foutafhandeling, en regressiecontroles telkens wanneer een model of prompt verandert. Dat is iets anders dan het testen van een gewone app die AI heeft helpen bouwen, wat onder Software QA & Testing valt.
AI helpt op schaal te beoordelen; experts leggen de lat
Hoe AI ondersteunt
- Genereert variaties van echte gebruikersvragen die jij goedkeurt, inclusief parafrases, randgevallen en adversariële input.
- Beoordeelt grote batches antwoorden met modelgebaseerde scoring, gekalibreerd aan de hand van antwoorden die door experts zijn gelabeld.
- Clustert fouten op oorzaak, zoals ontbrekende context, een verkeerde tool-call of een genegeerde instructie.
- Vergelijkt runs over model-, prompt- of retrieval-wijzigingen en markeert waar het gedrag slechter werd.
Waar onze experts eigenaar van zijn
- Experts bepalen wat een correct, veilig en nuttig antwoord is, samen met jouw domeinspecialisten.
- Modelgebaseerde beoordelingen worden steekproefsgewijs door mensen gecontroleerd, en een beoordelaar die het oneens is met experts wordt gecorrigeerd of geschrapt.
- Mensen beslissen welke tools en data een agent mag gebruiken, en waar een mens moet goedkeuren of het moet overnemen.
- Releasecriteria en de go/no-go-beslissing blijven bij jouw team en het onze, niet bij een score alleen.
Wat u ontvangt
Evaluatie die je bij elke wijziging opnieuw kunt uitvoeren
Evaluatiedataset
Echte en synthetische gevallen gelabeld met verwacht gedrag: veelvoorkomende vragen, randgevallen, verzoeken buiten scope en eerdere fouten.
Antwoordkwaliteit en grounding
Nauwkeurigheid, relevantie en toon, en of antwoorden worden ondersteund door jouw bronnen, met gecontroleerde citaties en gemarkeerde hallucinaties.
Tool- en datapermissietests
Wat een agent kan lezen, wijzigen of triggeren, getest tegen least privilege, goedkeuringspunten en de paden voor menselijke overname.
Blootstelling aan prompt injection
Directe en indirecte injectie via berichten, geüploade bestanden, webpagina's en opgehaalde documenten, beoordeeld naar wat een aanvaller zou kunnen bereiken.
Foutafhandeling en fallbacks
Gedrag wanneer het model een time-out heeft, een provider uitvalt, retrieval niets vindt of het vertrouwen laag is: fallbacks, heldere berichten, overdracht aan mensen.
Regressiecontroles en releasecriteria
Geautomatiseerde evaluaties die opnieuw draaien wanneer modellen, prompts of data veranderen, met afgesproken criteria die bepalen of een wijziging live gaat.
Hoe een AI-evaluatie verloopt
- 01
Definieer goed gedrag
Spreek use cases, risico's, kwaliteitscriteria en permissies af met jouw team en domeinexperts, en verzamel echte voorbeelden die je ons mag laten gebruiken.
- 02
Bouw de dataset
Stel evaluatiegevallen samen en label ze, inclusief moeilijke en adversariële, en stel de releasecriteria vast waaraan elke wijziging moet voldoen.
- 03
Evalueer en onderzoek
Voer geautomatiseerde evaluaties uit met expertbeoordeling, red-team-permissies en prompt injection, en herleid fouten tot prompts, retrieval, tools of het model.
- 04
Bewaak en monitor
Voeg evaluaties toe aan je releaseproces, rapporteer resultaten met aanbevolen oplossingen, en houd de dataset actueel naarmate het product verandert.
Twee manieren om met AI-tools te werken
AI helpt bij het opstellen van tests en het onderzoeken van defecten. Kies waar deze uw code en testgegevens mag verwerken.
- Private / lokale AI-ontwikkeling
Privé gehoste modellen binnen infrastructuur die u beheert of een afgesproken geïsoleerde omgeving.
Bespreken bij dit pakket - Ontwikkeling met Claude Code / OpenAI Codex
Claude Code en/of OpenAI Codex met cloudinstellingen die uw organisatie goedkeurt.
Bespreken bij dit pakket
Niet zeker? We bevelen er een aan tijdens de scoping. Vergelijk AI-opleveropties
Typische evaluatieverzoeken
Typische scenario's die we afbakenen, geen klantcasestudy's.
Helpcentrumassistent vóór publieke lancering
Een team wil een assistent die antwoordt op basis van zijn helpartikelen. We zetten echte supportvragen om in een gelabelde set, beoordelen antwoorden en bronvermeldingen, voegen buiten-bereik- en adversariële gevallen toe en spreken releasecriteria af vóór de lancering.
Een functie verplaatsen naar een goedkoper model
Een producteigenaar wil een functie overzetten naar een goedkoper model of provider. We draaien dezelfde evaluatieset op beide, laten zien waar antwoorden beter of slechter worden en hoe de latentie verandert, en laten de beslissing aan hen.
Een agent die records kan wijzigen
Een bedrijf laat een interne agent bestellingen bijwerken. We red-teamen de toolrechten en goedkeuringspunten, planten instructies in documenten die hij leest om indirecte injectie te testen, en adviseren waar een persoon moet goedkeuren voordat hij handelt.
Waar AI-evaluatie ophoudt
- Het wijzigen van prompts, retrieval of het model zelf maakt geen deel uit van evaluatie; wij adviseren oplossingen, en jouw team voert ze uit of wij brengen ze in kaart onder LLM Integration.
- Aanvallen op de servers, API's en het cloudaccount achter de functie horen bij Penetration Testing; hier toetsen we de instructies, tools en gegevenstoegang van het model.
- Latentie, rate limits en modelkosten bij piekverkeer worden gemeten in Performance Testing.
- Juridische of regelgevende goedkeuring van je AI-gebruik is niet inbegrepen; resultaten zijn bewijs voor je eigen risico- en compliancebeoordeling.
Hoe AI-evaluatie aansluit op design, QA en operations
Design: supervisie die mensen kunnen gebruiken
Designers bepalen hoe gebruikers bronnen, onzekerheid en fouten zien, en hoe jouw medewerkers een agent beoordelen, corrigeren of overnemen.
QA: ook de rest van het product
Software QA dekt de app rondom de AI, zoals inloggen, betalingen, rollen en integraties, getest tegen requirements zoals bij elke release.
Operations: kwaliteit in productie
Productielogs, gebruikersfeedback, latency en kosten voeden monitoring en nieuwe evaluatiegevallen, met waarschuwingen wanneer de kwaliteit begint te driften.
Doorlopend: herevalueer elke wijziging
Model-upgrades, promptaanpassingen en nieuwe databronnen worden vóór release geëvalueerd, als onderdeel van met jou afgesproken AI-operations.
FAQ
Veelgestelde vragen
Hoe verschilt dit van het testen van een app die AI heeft helpen bouwen?
Een app die met AI-codeertools is geschreven, gedraagt zich nog steeds als gewone software, dus Software QA & Testing dekt dat. AI Evaluatie is voor producten waarbij een model tijdens runtime antwoorden genereert of acties onderneemt. Output varieert, dus meten we kwaliteit over vele gevallen, testen we permissies en plannen we voor falen. Veel producten hebben beide nodig, en we scopen ze samen.
Welke modellen en AI-stacks kunnen jullie evalueren?
Functies gebouwd op gehoste modellen zoals OpenAI of Claude, open-weight-modellen zoals Llama of Mistral, retrieval-pipelines en agent-frameworks. De methode is niet afhankelijk van de provider, dus je kunt die ook gebruiken om modellen of providers te vergelijken op je eigen gevallen.
Kan evaluatie voorkomen dat de AI ooit fout zit?
Nee. Modellen kunnen nog steeds fouten maken. Evaluatie laat zien waar en hoe ze falen, zodat je releasecriteria kunt opstellen, guardrails en fallbacks kunt toevoegen, menselijke beoordeling kunt ontwerpen waar fouten kostbaar zijn, en snel kunt opmerken wanneer de kwaliteit verandert.
Waar worden onze prompts, logs en evaluatiedata verwerkt?
De eigen model-calls van jouw functie gaan naar de provider die je al gebruikt. AI-tools die wij in het werk gebruiken, zoals modelgebaseerde beoordeling, draaien binnen de grens die jij kiest: Private / lokale AI-ontwikkeling op infrastructuur die jij beheert, of Ontwikkeling met Claude Code / OpenAI Codex onder afgesproken voorwaarden voor dataverwerking. Persoonsgegevens in logs worden vóór gebruik gemaskeerd, zoals met jou afgesproken.
Gerelateerde leesstof
- Het verminderen van niet-onderbouwde antwoorden in RAG-applicaties
Hoe retrieval-kwaliteit, documentrechten, bewijs en evaluatie niet-onderbouwde antwoorden kunnen verminderen—en waar een kennisassistent nog steeds grenzen nodig heeft.
Zie hoe je AI zich gedraagt voordat je hem live zet
Vertel ons wat je AI-functie doet, welk model die gebruikt en wat je zorgen baart. Wij stellen een evaluatieplan en releasecriteria voor.


