Assurance qualité et de mise en production

Évaluation & tests IA

Testez l'IA à l'intérieur de votre produit, pas seulement l'application autour. Nous évaluons la qualité des réponses, l'ancrage, les permissions et la gestion des défaillances dans les agents, chatbots et fonctionnalités LLM, et définissons des critères de publication clairs.

Qui a besoin d'une évaluation d'IA

Votre fonctionnalité d'IA fait bonne impression en démo, mais personne ne peut encore dire comment elle se comporte face à de vraies questions, à des entrées hostiles et à des données manquantes, ni si le prochain changement de modèle ou de prompt la dégrade.

  • Équipes sur le point de mettre un chatbot ou un assistant face aux clients
  • Responsables produit qui changent de modèle, de fournisseur ou de prompts et ont besoin d'une comparaison avant/après
  • Entreprises qui laissent un agent lire des dossiers internes ou déclencher des actions dans d'autres systèmes

Comment chaque comportement est évalué

Plan illustratif pour un assistant en contact avec les clients ; les méthodes évoluent selon votre cas d'usage et vos risques.

Évaluations automatiséesRevue par des expertsTests de red-teamSignaux de production
Exactitude des réponsesMéthode principaleMéthode principaleRarement utilisé iciEn soutien ou échantillonné
Ancrage et citationsMéthode principaleEn soutien ou échantillonnéRarement utilisé iciEn soutien ou échantillonné
Limites de permissionsEn soutien ou échantillonnéMéthode principaleMéthode principaleEn soutien ou échantillonné
Injection de promptEn soutien ou échantillonnéEn soutien ou échantillonnéMéthode principaleEn soutien ou échantillonné
Refus et solutions de repliMéthode principaleEn soutien ou échantillonnéEn soutien ou échantillonnéMéthode principale
  • Méthode principale
  • En soutien ou échantillonné
  • Rarement utilisé ici

Tester les fonctionnalités d'IA est un travail différent

Un chatbot peut réussir tous les tests fonctionnels et donner quand même une réponse erronée avec assurance, révéler des données qu'il ne devrait pas, ou suivre des instructions cachées dans un fichier téléversé. Les fonctionnalités d'IA ont besoin de leur propre évaluation : jeux de données de cas réels et difficiles, vérifications de la qualité des réponses et de l'ancrage, permissions d'outils et de données, exposition à l'injection de prompt, gestion des défaillances, et vérifications de régression chaque fois qu'un modèle ou un prompt change. C'est différent du test d'une application ordinaire que l'IA a aidé à construire, ce que couvre l'Assurance qualité et les tests logiciels.

L'IA aide à noter à grande échelle ; les experts fixent la barre

Comment l'IA assiste

  • Génère des variations de vraies questions d'utilisateurs que vous approuvez, y compris des paraphrases, des cas limites et des entrées adverses.
  • Note de grands lots de réponses avec une notation basée sur un modèle, calibrée par rapport à des réponses étiquetées par des experts.
  • Regroupe les défaillances par cause, comme un contexte manquant, un mauvais appel d'outil ou une instruction ignorée.
  • Compare les exécutions au fil des changements de modèle, de prompt ou de récupération et signale où le comportement s'est dégradé.

Ce dont nos experts sont responsables

  • Les experts définissent ce qu'est une réponse correcte, sûre et utile, avec vos spécialistes du domaine.
  • Les notes basées sur un modèle sont vérifiées par sondage par des personnes, et un correcteur qui est en désaccord avec les experts est corrigé ou abandonné.
  • Les personnes décident quels outils et données un agent peut utiliser, et où un humain doit approuver ou prendre le relais.
  • Les critères de publication et la décision go/no-go restent entre les mains de votre équipe et de la nôtre, pas d'un score seul.

Ce que vous recevez

Une évaluation que vous pouvez réexécuter à chaque changement

  • Jeu de données d'évaluation

    Cas réels et synthétiques étiquetés avec le comportement attendu : questions courantes, cas limites, demandes hors périmètre et échecs passés.

  • Qualité des réponses et ancrage

    Exactitude, pertinence et ton, et si les réponses s'appuient sur vos sources, avec vérification des citations et signalement des hallucinations.

  • Tests des permissions sur les outils et les données

    Ce qu'un agent peut lire, modifier ou déclencher, testé par rapport au moindre privilège, aux points d'approbation et aux chemins de reprise par un humain.

  • Exposition à l'injection de prompt

    Injection directe et indirecte via les messages, les fichiers téléversés, les pages web et les documents récupérés, évaluée selon ce qu'un attaquant pourrait atteindre.

  • Gestion des échecs et solutions de repli

    Comportement lorsque le modèle expire, qu'un fournisseur est hors service, que la récupération ne trouve rien ou que la confiance est faible : solutions de repli, messages clairs, transfert vers des personnes.

  • Contrôles de régression et critères de mise en production

    Évaluations automatisées relancées lorsque les modèles, les prompts ou les données changent, avec des critères convenus qui déterminent si un changement est livré.

Comment se déroule une évaluation d'IA

  1. 01

    Définir le bon comportement

    Convenir des cas d'usage, des risques, des critères de qualité et des permissions avec votre équipe et vos experts métier, et recueillir des exemples réels que vous nous autorisez à utiliser.

  2. 02

    Constituer le jeu de données

    Assembler et étiqueter les cas d'évaluation, y compris les cas difficiles et adverses, et définir les critères de mise en production que chaque changement doit respecter.

  3. 03

    Évaluer et sonder

    Lancer des évaluations automatisées avec examen d'experts, permissions de red-team et injection de prompt, et remonter les échecs jusqu'aux prompts, à la récupération, aux outils ou au modèle.

  4. 04

    Contrôler et surveiller

    Ajouter les évaluations à votre processus de mise en production, rapporter les résultats avec les correctifs recommandés, et maintenir le jeu de données à jour à mesure que le produit évolue.

Deux façons de travailler avec les outils d'IA

L'IA aide à rédiger des tests et à investiguer les défauts. Choisissez où elle peut traiter votre code et vos données de test.

Vous hésitez ? Nous vous en recommanderons un lors du cadrage. Comparer les options de livraison avec IA

Demandes d'évaluation typiques

Scénarios types que nous cadrons, et non des études de cas clients.

  • Assistant de centre d'aide avant le lancement public

    Une équipe veut un assistant qui répond à partir de ses articles d'aide. Nous transformons de vraies questions de support en un ensemble étiqueté, notons les réponses et les citations, ajoutons des cas hors périmètre et adverses, et convenons des critères de mise en production avant le lancement.

  • Faire passer une fonctionnalité à un modèle moins coûteux

    Un responsable produit veut faire passer une fonctionnalité à un modèle ou un fournisseur moins cher. Nous lançons le même ensemble d'évaluation sur les deux, montrons où les réponses s'améliorent ou se dégradent et comment la latence évolue, et laissons la décision entre ses mains.

  • Un agent qui peut modifier des dossiers

    Une entreprise laisse un agent interne mettre à jour des commandes. Nous menons un red-team sur ses permissions d'outils et ses points d'approbation, plantons des instructions dans les documents qu'il lit pour tester l'injection indirecte, et recommandons les endroits où une personne doit approuver avant qu'il n'agisse.

Où s'arrête l'évaluation d'IA

  • Modifier les prompts, la récupération ou le modèle lui-même ne fait pas partie de l'évaluation ; nous recommandons des correctifs, et votre équipe les réalise ou nous les cadrons dans le cadre de l'intégration LLM.
  • Les attaques sur les serveurs, les API et le compte cloud derrière la fonctionnalité relèvent des tests d'intrusion ; ici, nous sondons les instructions, les outils et l'accès aux données du modèle.
  • La latence, les limites de débit et les coûts des modèles au pic de trafic sont mesurés dans les tests de performance.
  • La validation juridique ou réglementaire de votre usage de l'IA n'est pas incluse ; les résultats sont des preuves pour votre propre revue de risque et de conformité.

Comment l'évaluation d'IA se relie à la conception, à la QA et aux opérations

  • Conception : une supervision utilisable par les personnes

    Les concepteurs façonnent la manière dont les utilisateurs voient les sources, l'incertitude et les erreurs, et dont votre personnel examine, corrige ou prend le relais d'un agent.

  • QA : le reste du produit aussi

    La QA logicielle couvre l'application autour de l'IA, comme la connexion, les paiements, les rôles et les intégrations, testés par rapport aux exigences comme toute mise en production.

  • Opérations : la qualité en production

    Les journaux de production, les retours des utilisateurs, la latence et le coût alimentent la surveillance et de nouveaux cas d'évaluation, avec des alertes lorsque la qualité commence à dériver.

  • En continu : réévaluer chaque changement

    Les mises à niveau de modèles, les modifications de prompts et les nouvelles sources de données sont évaluées avant la mise en production, dans le cadre des opérations d'IA convenues avec vous.

FAQ

Questions fréquemment posées

En quoi est-ce différent de tester une application que l'IA a aidé à construire ?

Une application écrite avec des outils de codage par IA se comporte toujours comme un logiciel ordinaire, donc la QA et les tests logiciels la couvrent. L'évaluation d'IA concerne les produits où un modèle génère des réponses ou effectue des actions à l'exécution. Les sorties varient, nous mesurons donc la qualité sur de nombreux cas, testons les permissions et planifions pour l'échec. De nombreux produits ont besoin des deux, et nous les cadrons ensemble.

Quels modèles et quelles piles d'IA pouvez-vous évaluer ?

Des fonctionnalités reposant sur des modèles hébergés comme OpenAI ou Claude, des modèles à poids ouverts comme Llama ou Mistral, des pipelines de récupération et des frameworks d'agents. La méthode ne dépend pas du fournisseur, vous pouvez donc aussi l'utiliser pour comparer des modèles ou des fournisseurs sur vos propres cas.

L'évaluation peut-elle empêcher l'IA de jamais se tromper ?

Non. Les modèles peuvent toujours commettre des erreurs. L'évaluation montre où et comment ils échouent, afin que vous puissiez définir des critères de mise en production, ajouter des garde-fous et des solutions de repli, concevoir une revue humaine là où les erreurs coûtent cher, et remarquer rapidement les changements de qualité.

Où sont traités nos prompts, nos journaux et nos données d'évaluation ?

Les appels de modèle propres à votre fonctionnalité vont au fournisseur que vous utilisez déjà. Les outils d'IA que nous utilisons dans le travail, comme la notation basée sur un modèle, s'exécutent dans la limite que vous choisissez : Ingénierie IA privée / locale sur une infrastructure que vous contrôlez, ou Ingénierie Claude Code / OpenAI Codex selon des conditions de traitement des données convenues. Les données personnelles dans les journaux sont masquées avant utilisation, comme convenu avec vous.

Lectures associées

Voyez comment votre IA se comporte avant de la livrer

Dites-nous ce que fait votre fonctionnalité d'IA, quel modèle elle utilise et ce qui vous préoccupe. Nous proposerons un plan d'évaluation et des critères de mise en production.