La recuperación ayuda; no garantiza una respuesta correcta
La generación aumentada por recuperación (RAG) suministra documentos seleccionados a un modelo de lenguaje antes de que responda. Puede hacer que una respuesta sea más relevante para la información de una empresa, pero el sistema aún puede recuperar el pasaje equivocado, pasar por alto una excepción o generar una afirmación que la fuente no respalda.
Comienza con una tarea definida: por ejemplo, ayudar al personal de soporte a encontrar una política de devoluciones vigente. Decide qué fuentes son autorizadas, quién las mantiene y cuándo una respuesta necesita revisión humana. Una instrucción general de “usar nuestros documentos” no es un criterio de aceptación.
Prepara y recupera evidencia utilizable
Conserva los encabezados, la identidad del documento, la versión y los enlaces de origen al dividir los documentos en pasajes. Mantén las excepciones junto con la regla que matizan. Compara la recuperación por palabras clave, por vectores y combinada frente a preguntas representativas en lugar de suponer que un método o un tamaño de fragmento fijo siempre es el mejor. Prueba si la evidencia requerida aparece en los resultados recuperados de forma independiente de si la respuesta final la usa con precisión. Consulta la descripción general de la arquitectura RAG de Microsoft.
Aplica los permisos antes de que el texto llegue al modelo
Restringe la recuperación usando el inquilino y los permisos de documentos del usuario autenticado. Un prompt que indica al modelo que oculte material confidencial no es un límite de autorización. Los enlaces de origen, los resúmenes generados, el historial de conversación y las respuestas en caché también necesitan comprobaciones de acceso. Los cambios de permisos y la eliminación de documentos deben propagarse al índice y a cualquier almacenamiento derivado.
Para ver un ejemplo de implementación, Azure AI Search documenta el filtrado de permisos en el momento de la consulta. Sus capacidades específicas de la plataforma y las limitaciones de la versión preliminar deben verificarse para la implementación prevista.
Haz que las preguntas sin respaldo sean un resultado explícito
Muestra el pasaje que respalda una afirmación relevante y permite que el usuario lo inspeccione. Una cita es útil solo cuando realmente respalda la respuesta. Si las fuentes faltan, se contradicen o están desactualizadas, indica qué no se pudo establecer y ofrece un resultado de búsqueda relevante o una derivación. No conviertas una puntuación de recuperación débil en un porcentaje de confianza inventado.
Ejemplo: una política dice que los artículos sin abrir se pueden devolver dentro de los 30 días, pero no dice nada sobre el franqueo de devolución internacional. Para “¿Me reembolsarán el franqueo del extranjero?”, una respuesta adecuada identifica esa información faltante y remite a la política o al equipo de soporte. Repetir la regla de los 30 días no responde a la pregunta.
Evalúa el comportamiento completo
- Incluye preguntas con respuesta, ambiguas, desactualizadas y deliberadamente sin respaldo.
- Para cada caso, registra la evidencia esperada, el rol de usuario permitido y la respuesta o abstención aceptable.
- Verifique por separado la cobertura de recuperación, el respaldo de afirmaciones individuales, la exactitud de las citas, la fuga de permisos, la latencia y el costo.
- Repita el conjunto tras cambiar documentos, ajustes de recuperación, prompts o modelos. Agregue fallos reales después de eliminar datos personales innecesarios.
Este es un enfoque de evaluación propuesto, no una afirmación sobre un conjunto de datos histórico de un cliente. Ningún conjunto de pruebas finito demuestra que las respuestas futuras siempre serán correctas. Las acciones de alto impacto necesitan controles adicionales, aprobación o revisión humana apropiada para el flujo de trabajo.
Explorar Integración de LLM para una función de IA dentro de una aplicación, o automatización de flujos de trabajo cuando la tarea atraviesa varios sistemas. El entorno de la herramienta de desarrollo y el flujo de datos del producto desplegado son decisiones separadas.


