Inteligência ArtificialCanvasDevs TeamAtualizado

Reduzindo Respostas Sem Suporte em Aplicações RAG

Como a qualidade da recuperação, as permissões de documentos, as evidências e a avaliação podem reduzir respostas sem suporte—e onde um assistente de conhecimento ainda precisa de limites.

Reduzindo Respostas Sem Suporte em Aplicações RAG

A recuperação ajuda; ela não garante uma resposta correta

A geração aumentada por recuperação (RAG) fornece documentos selecionados a um modelo de linguagem antes que ele responda. Isso pode tornar uma resposta mais relevante para as informações de uma empresa, mas o sistema ainda pode recuperar a passagem errada, deixar passar uma exceção ou gerar uma afirmação que a fonte não sustenta.

Comece com uma tarefa definida: por exemplo, ajudar a equipe de suporte a encontrar uma política de devoluções atual. Decida quais fontes são autoritativas, quem as mantém e quando uma resposta precisa de revisão humana. Uma instrução genérica para “usar nossos documentos” não é um critério de aceitação.

Prepare e recupere evidências utilizáveis

Preserve os cabeçalhos, a identidade do documento, a versão e os links de origem ao dividir documentos em passagens. Mantenha as exceções junto com a regra que elas qualificam. Compare a recuperação por palavra-chave, vetorial e combinada em relação a perguntas representativas, em vez de supor que um método ou um tamanho fixo de chunk seja sempre o melhor. Teste se a evidência necessária aparece nos resultados recuperados separadamente de se a resposta final a utiliza com precisão. Veja a visão geral da arquitetura RAG da Microsoft.

Aplique permissões antes que o texto chegue ao modelo

Restrinja a recuperação usando o tenant e as permissões de documento do usuário autenticado. Um prompt instruindo o modelo a ocultar material confidencial não é um limite de autorização. Links de origem, resumos gerados, histórico de conversas e respostas em cache também precisam de verificações de acesso. Alterações de permissão e exclusão de documentos devem se propagar para o índice e para qualquer armazenamento derivado.

Para um exemplo de implementação, o Azure AI Search documenta a filtragem de permissões em tempo de consulta. Seus recursos específicos da plataforma e as limitações de versão prévia precisam ser verificados para a implantação pretendida.

Torne perguntas sem suporte um resultado explícito

Mostre a passagem por trás de uma afirmação material e deixe o usuário inspecioná-la. Uma citação só é útil quando realmente sustenta a resposta. Se as fontes estiverem ausentes, contraditórias ou desatualizadas, diga o que não pôde ser estabelecido e ofereça um resultado de busca relevante ou um encaminhamento. Não transforme uma pontuação de recuperação fraca em uma porcentagem de confiança inventada.

Exemplo: uma política diz que itens não abertos podem ser devolvidos em até 30 dias, mas não diz nada sobre a postagem de devolução internacional. Para “Vocês reembolsarão minha postagem no exterior?”, uma resposta adequada identifica essa informação ausente e aponta para a política ou a equipe de suporte. Repetir a regra dos 30 dias não responde à pergunta.

Avalie o comportamento completo

  • Inclua perguntas respondíveis, ambíguas, desatualizadas e deliberadamente sem suporte.
  • Para cada caso, registre a evidência esperada, o papel de usuário permitido e a resposta ou abstenção aceitável.
  • Verifique a cobertura de recuperação, o suporte a afirmações individuais, a precisão das citações, o vazamento de permissões, a latência e o custo separadamente.
  • Repita o conjunto após alterar documentos, configurações de recuperação, prompts ou modelos. Adicione falhas reais depois de remover dados pessoais desnecessários.

Esta é uma abordagem de avaliação proposta, não uma afirmação sobre um conjunto de dados histórico de cliente. Nenhum conjunto de testes finito prova que respostas futuras serão sempre corretas. Ações de alto impacto precisam de controles adicionais, aprovação ou revisão humana adequados ao fluxo de trabalho.

Explorar Integração de LLM para um recurso de IA dentro de uma aplicação, ou automação de fluxo de trabalho quando a tarefa atravessa vários sistemas. O ambiente da ferramenta de desenvolvimento e o fluxo de dados do produto implantado são decisões separadas.