QA & Release-zekerheid

AI-evaluatie & -tests

Test de AI binnen je product, niet alleen de app eromheen. We evalueren antwoordkwaliteit, grounding, permissies en foutafhandeling in agents, chatbots en LLM-functies, en stellen heldere releasecriteria op.

Wie heeft AI-evaluatie nodig

Je AI-functie oogt goed in een demo, maar niemand kan nog zeggen hoe die zich gedraagt bij echte vragen, vijandige invoer en ontbrekende gegevens, of dat het volgende model of de volgende promptwijziging het slechter maakt.

  • Teams die op het punt staan een chatbot of assistent voor klanten te plaatsen
  • Producteigenaren die van model, provider of prompts wisselen en een vergelijking van voor en na nodig hebben
  • Bedrijven die een agent interne records laten lezen of acties in andere systemen laten activeren

Hoe elk gedrag wordt geëvalueerd

Illustratief plan voor een klantgerichte assistent; methoden verschuiven met jouw use case en risico's.

Geautomatiseerde evalsBeoordeling door expertsRed-team-testenProductiesignalen
AntwoordnauwkeurigheidPrimaire methodePrimaire methodeHier zelden gebruiktOndersteunend of gesampled
Onderbouwing en bronvermeldingenPrimaire methodeOndersteunend of gesampledHier zelden gebruiktOndersteunend of gesampled
RechtengrenzenOndersteunend of gesampledPrimaire methodePrimaire methodeOndersteunend of gesampled
Prompt injectionOndersteunend of gesampledOndersteunend of gesampledPrimaire methodeOndersteunend of gesampled
Weigeringen en fallbacksPrimaire methodeOndersteunend of gesampledOndersteunend of gesampledPrimaire methode
  • Primaire methode
  • Ondersteunend of gesampled
  • Hier zelden gebruikt

AI-functies testen is een andere klus

Een chatbot kan elke functionele test doorstaan en toch zelfverzekerd een verkeerd antwoord geven, gegevens tonen die hij niet zou mogen, of instructies opvolgen die verborgen zitten in een geüpload bestand. AI-functies hebben hun eigen evaluatie nodig: datasets van echte en moeilijke gevallen, controles op antwoordkwaliteit en grounding, tool- en datapermissies, blootstelling aan prompt injection, foutafhandeling, en regressiecontroles telkens wanneer een model of prompt verandert. Dat is iets anders dan het testen van een gewone app die AI heeft helpen bouwen, wat onder Software QA & Testing valt.

AI helpt op schaal te beoordelen; experts leggen de lat

Hoe AI ondersteunt

  • Genereert variaties van echte gebruikersvragen die jij goedkeurt, inclusief parafrases, randgevallen en adversariële input.
  • Beoordeelt grote batches antwoorden met modelgebaseerde scoring, gekalibreerd aan de hand van antwoorden die door experts zijn gelabeld.
  • Clustert fouten op oorzaak, zoals ontbrekende context, een verkeerde tool-call of een genegeerde instructie.
  • Vergelijkt runs over model-, prompt- of retrieval-wijzigingen en markeert waar het gedrag slechter werd.

Waar onze experts eigenaar van zijn

  • Experts bepalen wat een correct, veilig en nuttig antwoord is, samen met jouw domeinspecialisten.
  • Modelgebaseerde beoordelingen worden steekproefsgewijs door mensen gecontroleerd, en een beoordelaar die het oneens is met experts wordt gecorrigeerd of geschrapt.
  • Mensen beslissen welke tools en data een agent mag gebruiken, en waar een mens moet goedkeuren of het moet overnemen.
  • Releasecriteria en de go/no-go-beslissing blijven bij jouw team en het onze, niet bij een score alleen.

Wat u ontvangt

Evaluatie die je bij elke wijziging opnieuw kunt uitvoeren

  • Evaluatiedataset

    Echte en synthetische gevallen gelabeld met verwacht gedrag: veelvoorkomende vragen, randgevallen, verzoeken buiten scope en eerdere fouten.

  • Antwoordkwaliteit en grounding

    Nauwkeurigheid, relevantie en toon, en of antwoorden worden ondersteund door jouw bronnen, met gecontroleerde citaties en gemarkeerde hallucinaties.

  • Tool- en datapermissietests

    Wat een agent kan lezen, wijzigen of triggeren, getest tegen least privilege, goedkeuringspunten en de paden voor menselijke overname.

  • Blootstelling aan prompt injection

    Directe en indirecte injectie via berichten, geüploade bestanden, webpagina's en opgehaalde documenten, beoordeeld naar wat een aanvaller zou kunnen bereiken.

  • Foutafhandeling en fallbacks

    Gedrag wanneer het model een time-out heeft, een provider uitvalt, retrieval niets vindt of het vertrouwen laag is: fallbacks, heldere berichten, overdracht aan mensen.

  • Regressiecontroles en releasecriteria

    Geautomatiseerde evaluaties die opnieuw draaien wanneer modellen, prompts of data veranderen, met afgesproken criteria die bepalen of een wijziging live gaat.

Hoe een AI-evaluatie verloopt

  1. 01

    Definieer goed gedrag

    Spreek use cases, risico's, kwaliteitscriteria en permissies af met jouw team en domeinexperts, en verzamel echte voorbeelden die je ons mag laten gebruiken.

  2. 02

    Bouw de dataset

    Stel evaluatiegevallen samen en label ze, inclusief moeilijke en adversariële, en stel de releasecriteria vast waaraan elke wijziging moet voldoen.

  3. 03

    Evalueer en onderzoek

    Voer geautomatiseerde evaluaties uit met expertbeoordeling, red-team-permissies en prompt injection, en herleid fouten tot prompts, retrieval, tools of het model.

  4. 04

    Bewaak en monitor

    Voeg evaluaties toe aan je releaseproces, rapporteer resultaten met aanbevolen oplossingen, en houd de dataset actueel naarmate het product verandert.

Twee manieren om met AI-tools te werken

AI helpt bij het opstellen van tests en het onderzoeken van defecten. Kies waar deze uw code en testgegevens mag verwerken.

Niet zeker? We bevelen er een aan tijdens de scoping. Vergelijk AI-opleveropties

Typische evaluatieverzoeken

Typische scenario's die we afbakenen, geen klantcasestudy's.

  • Helpcentrumassistent vóór publieke lancering

    Een team wil een assistent die antwoordt op basis van zijn helpartikelen. We zetten echte supportvragen om in een gelabelde set, beoordelen antwoorden en bronvermeldingen, voegen buiten-bereik- en adversariële gevallen toe en spreken releasecriteria af vóór de lancering.

  • Een functie verplaatsen naar een goedkoper model

    Een producteigenaar wil een functie overzetten naar een goedkoper model of provider. We draaien dezelfde evaluatieset op beide, laten zien waar antwoorden beter of slechter worden en hoe de latentie verandert, en laten de beslissing aan hen.

  • Een agent die records kan wijzigen

    Een bedrijf laat een interne agent bestellingen bijwerken. We red-teamen de toolrechten en goedkeuringspunten, planten instructies in documenten die hij leest om indirecte injectie te testen, en adviseren waar een persoon moet goedkeuren voordat hij handelt.

Waar AI-evaluatie ophoudt

  • Het wijzigen van prompts, retrieval of het model zelf maakt geen deel uit van evaluatie; wij adviseren oplossingen, en jouw team voert ze uit of wij brengen ze in kaart onder LLM Integration.
  • Aanvallen op de servers, API's en het cloudaccount achter de functie horen bij Penetration Testing; hier toetsen we de instructies, tools en gegevenstoegang van het model.
  • Latentie, rate limits en modelkosten bij piekverkeer worden gemeten in Performance Testing.
  • Juridische of regelgevende goedkeuring van je AI-gebruik is niet inbegrepen; resultaten zijn bewijs voor je eigen risico- en compliancebeoordeling.

Hoe AI-evaluatie aansluit op design, QA en operations

  • Design: supervisie die mensen kunnen gebruiken

    Designers bepalen hoe gebruikers bronnen, onzekerheid en fouten zien, en hoe jouw medewerkers een agent beoordelen, corrigeren of overnemen.

  • QA: ook de rest van het product

    Software QA dekt de app rondom de AI, zoals inloggen, betalingen, rollen en integraties, getest tegen requirements zoals bij elke release.

  • Operations: kwaliteit in productie

    Productielogs, gebruikersfeedback, latency en kosten voeden monitoring en nieuwe evaluatiegevallen, met waarschuwingen wanneer de kwaliteit begint te driften.

  • Doorlopend: herevalueer elke wijziging

    Model-upgrades, promptaanpassingen en nieuwe databronnen worden vóór release geëvalueerd, als onderdeel van met jou afgesproken AI-operations.

FAQ

Veelgestelde vragen

Hoe verschilt dit van het testen van een app die AI heeft helpen bouwen?

Een app die met AI-codeertools is geschreven, gedraagt zich nog steeds als gewone software, dus Software QA & Testing dekt dat. AI Evaluatie is voor producten waarbij een model tijdens runtime antwoorden genereert of acties onderneemt. Output varieert, dus meten we kwaliteit over vele gevallen, testen we permissies en plannen we voor falen. Veel producten hebben beide nodig, en we scopen ze samen.

Welke modellen en AI-stacks kunnen jullie evalueren?

Functies gebouwd op gehoste modellen zoals OpenAI of Claude, open-weight-modellen zoals Llama of Mistral, retrieval-pipelines en agent-frameworks. De methode is niet afhankelijk van de provider, dus je kunt die ook gebruiken om modellen of providers te vergelijken op je eigen gevallen.

Kan evaluatie voorkomen dat de AI ooit fout zit?

Nee. Modellen kunnen nog steeds fouten maken. Evaluatie laat zien waar en hoe ze falen, zodat je releasecriteria kunt opstellen, guardrails en fallbacks kunt toevoegen, menselijke beoordeling kunt ontwerpen waar fouten kostbaar zijn, en snel kunt opmerken wanneer de kwaliteit verandert.

Waar worden onze prompts, logs en evaluatiedata verwerkt?

De eigen model-calls van jouw functie gaan naar de provider die je al gebruikt. AI-tools die wij in het werk gebruiken, zoals modelgebaseerde beoordeling, draaien binnen de grens die jij kiest: Private / lokale AI-ontwikkeling op infrastructuur die jij beheert, of Ontwikkeling met Claude Code / OpenAI Codex onder afgesproken voorwaarden voor dataverwerking. Persoonsgegevens in logs worden vóór gebruik gemaskeerd, zoals met jou afgesproken.

Gerelateerde leesstof

Zie hoe je AI zich gedraagt voordat je hem live zet

Vertel ons wat je AI-functie doet, welk model die gebruikt en wat je zorgen baart. Wij stellen een evaluatieplan en releasecriteria voor.