Intelligence artificielleCanvasDevs TeamMis à jour

Réduire les réponses non étayées dans les applications RAG

Comment la qualité de la récupération, les permissions de documents, les preuves et l'évaluation peuvent réduire les réponses non étayées — et où un assistant de connaissances a toujours besoin de limites.

Réduire les réponses non étayées dans les applications RAG

La récupération aide ; elle ne garantit pas une réponse correcte

La génération augmentée par récupération (RAG) fournit des documents sélectionnés à un modèle de langage avant qu'il ne réponde. Elle peut rendre une réponse plus pertinente par rapport aux informations d'une entreprise, mais le système peut toujours récupérer le mauvais passage, manquer une exception ou générer une affirmation que la source n'étaye pas.

Commencez par une tâche définie : par exemple, aider le personnel d'assistance à trouver une politique de retour à jour. Décidez quelles sources font autorité, qui les maintient et quand une réponse nécessite une révision humaine. Une instruction générale consistant à « utiliser nos documents » n'est pas un critère d'acceptation.

Préparez et récupérez des preuves exploitables

Conservez les titres, l'identité du document, la version et les liens source lorsque vous divisez les documents en passages. Gardez les exceptions avec la règle qu'elles précisent. Comparez la récupération par mots-clés, vectorielle et combinée sur des questions représentatives au lieu de supposer qu'une méthode ou une taille de fragment fixe est toujours la meilleure. Testez si la preuve requise apparaît dans les résultats récupérés séparément de la question de savoir si la réponse finale l'utilise correctement. Consultez la présentation de l'architecture RAG de Microsoft.

Appliquez les permissions avant que le texte n'atteigne le modèle

Restreignez la récupération en utilisant le locataire de l'utilisateur authentifié et les permissions de documents. Une invite demandant au modèle de masquer du contenu confidentiel n'est pas une limite d'autorisation. Les liens source, les résumés générés, l'historique des conversations et les réponses mises en cache nécessitent également des contrôles d'accès. Les modifications de permissions et la suppression de documents doivent se propager à l'index et à tout stockage dérivé.

Pour un exemple d'implémentation, Azure AI Search documente le filtrage des permissions au moment de la requête. Ses capacités spécifiques à la plateforme et ses limitations en préversion doivent être vérifiées pour le déploiement prévu.

Faites des questions non étayées un résultat explicite

Montrez le passage à l'origine d'une affirmation importante et laissez l'utilisateur l'examiner. Une citation n'est utile que lorsqu'elle étaye réellement la réponse. Si les sources sont manquantes, contradictoires ou obsolètes, indiquez ce qui n'a pas pu être établi et proposez un résultat de recherche pertinent ou un transfert. Ne transformez pas un faible score de récupération en un pourcentage de confiance inventé.

Exemple : une politique indique que les articles non ouverts peuvent être retournés dans un délai de 30 jours mais ne dit rien des frais de port de retour à l'international. Pour « Rembourserez-vous mes frais de port à l'étranger ? », une réponse appropriée identifie cette information manquante et renvoie à la politique ou à l'équipe d'assistance. Répéter la règle des 30 jours ne répond pas à la question.

Évaluez le comportement complet

  • Incluez des questions auxquelles on peut répondre, ambiguës, obsolètes et délibérément non étayées.
  • Pour chaque cas, consignez la preuve attendue, le rôle d'utilisateur autorisé et la réponse ou l'abstention acceptable.
  • Vérifiez séparément la couverture de la récupération, la justification de chaque affirmation, l'exactitude des citations, les fuites de permissions, la latence et le coût.
  • Répétez la série après avoir modifié les documents, les paramètres de récupération, les invites ou les modèles. Ajoutez les véritables échecs après avoir supprimé les données personnelles superflues.

Il s'agit d'une approche d'évaluation proposée, et non d'une affirmation sur un jeu de données client historique. Aucun ensemble de tests fini ne prouve que les réponses futures seront toujours correctes. Les actions à fort impact nécessitent des contrôles supplémentaires, une approbation ou une revue humaine adaptés au flux de travail.

Explorer l'intégration de LLM pour une fonctionnalité d'IA au sein d'une application, ou l'automatisation des flux de travail lorsque la tâche traverse plusieurs systèmes. L'environnement de l'outil de développement et le flux de données du produit déployé sont des décisions distinctes.