QA e Garantia de Lançamento
Avaliação e Teste de IA
Teste a IA dentro do seu produto, não apenas o app ao redor dele. Avaliamos a qualidade das respostas, o embasamento, as permissões e o tratamento de falhas em agentes, chatbots e recursos de LLM, e definimos critérios claros de lançamento.

Quem precisa de avaliação de IA
Seu recurso de IA parece bom em uma demonstração, mas ninguém ainda consegue dizer como ele se comporta diante de perguntas reais, entradas hostis e dados ausentes, ou se a próxima mudança de modelo ou prompt o torna pior.
- Equipes prestes a colocar um chatbot ou assistente diante dos clientes
- Donos de produto que mudam de modelo, provedor ou prompts e precisam de uma comparação antes e depois
- Empresas que permitem que um agente leia registros internos ou acione ações em outros sistemas
Como cada comportamento é avaliado
Plano ilustrativo para um assistente voltado ao cliente; os métodos mudam conforme seu caso de uso e riscos.
| Avaliações automatizadas | Revisão por especialistas | Teste de red team | Sinais de produção | |
|---|---|---|---|---|
| Precisão das respostas | Método principal | Método principal | Raramente usado aqui | De apoio ou amostrado |
| Fundamentação e citações | Método principal | De apoio ou amostrado | Raramente usado aqui | De apoio ou amostrado |
| Limites de permissão | De apoio ou amostrado | Método principal | Método principal | De apoio ou amostrado |
| Injeção de prompt | De apoio ou amostrado | De apoio ou amostrado | Método principal | De apoio ou amostrado |
| Recusas e planos alternativos | Método principal | De apoio ou amostrado | De apoio ou amostrado | Método principal |
- Método principal
- De apoio ou amostrado
- Raramente usado aqui
Testar recursos de IA é um trabalho diferente
Um chatbot pode passar em todos os testes funcionais e ainda assim dar uma resposta errada com confiança, revelar dados que não deveria ou seguir instruções escondidas em um arquivo enviado. Recursos de IA precisam da própria avaliação: conjuntos de dados de casos reais e difíceis, verificações de qualidade e embasamento das respostas, permissões de ferramentas e dados, exposição a injeção de prompt, tratamento de falhas e verificações de regressão sempre que um modelo ou prompt muda. Isso é diferente de testar um app comum que a IA ajudou a construir, o que o Software QA & Testing cobre.
A IA ajuda a avaliar em escala; os especialistas definem o padrão
Como a IA auxilia
- Gera variações de perguntas reais de usuários que você aprova, incluindo paráfrases, casos extremos e entradas adversárias.
- Avalia grandes lotes de respostas com pontuação baseada em modelo, calibrada em relação a respostas rotuladas por especialistas.
- Agrupa falhas por causa, como contexto ausente, uma chamada de ferramenta errada ou uma instrução ignorada.
- Compara execuções entre mudanças de modelo, prompt ou recuperação e sinaliza onde o comportamento piorou.
O que os nossos especialistas assumem
- Especialistas definem o que é uma resposta correta, segura e útil, junto com os especialistas do seu domínio.
- As avaliações baseadas em modelo são verificadas por amostragem por pessoas, e um avaliador que discorda dos especialistas é corrigido ou descartado.
- As pessoas decidem quais ferramentas e dados um agente pode usar, e onde um humano deve aprovar ou assumir.
- Os critérios de lançamento e a decisão de prosseguir ou não ficam com a sua equipe e a nossa, não apenas com uma pontuação.
O que você recebe
Avaliação que você pode executar novamente a cada mudança
Conjunto de dados de avaliação
Casos reais e sintéticos rotulados com o comportamento esperado: perguntas comuns, casos extremos, solicitações fora do escopo e falhas passadas.
Qualidade e embasamento das respostas
Precisão, relevância e tom, e se as respostas são sustentadas pelas suas fontes, com citações verificadas e alucinações sinalizadas.
Testes de permissão de ferramentas e dados
O que um agente pode ler, alterar ou acionar, testado em relação ao menor privilégio, pontos de aprovação e os caminhos para que um humano assuma.
Exposição a injeção de prompt
Injeção direta e indireta por meio de mensagens, arquivos enviados, páginas da web e documentos recuperados, avaliada pelo que um atacante poderia alcançar.
Tratamento de falhas e alternativas
Comportamento quando o modelo expira, um provedor fica fora do ar, a recuperação não encontra nada ou a confiança é baixa: alternativas, mensagens claras, transferência para pessoas.
Verificações de regressão e critérios de lançamento
Avaliações automatizadas que são executadas novamente quando modelos, prompts ou dados mudam, com critérios acordados que decidem se uma mudança vai para produção.
Como funciona uma avaliação de IA
- 01
Definir o bom comportamento
Combine casos de uso, riscos, critérios de qualidade e permissões com sua equipe e especialistas do domínio, e colete exemplos reais que você nos permite usar.
- 02
Construir o conjunto de dados
Reúna e rotule os casos de avaliação, incluindo os difíceis e adversários, e defina os critérios de lançamento que cada mudança deve atender.
- 03
Avaliar e sondar
Execute avaliações automatizadas com revisão de especialistas, permissões de red team e injeção de prompt, e rastreie as falhas até prompts, recuperação, ferramentas ou o modelo.
- 04
Controlar e monitorar
Adicione avaliações ao seu processo de lançamento, reporte os resultados com correções recomendadas e mantenha o conjunto de dados atualizado conforme o produto muda.
Duas formas de trabalhar com ferramentas de IA
A IA ajuda a redigir testes e investigar defeitos. Escolha onde ela pode processar seu código e dados de teste.
- Engenharia de IA Privada / Local
Modelos hospedados de forma privada dentro de uma infraestrutura que você controla ou de um ambiente isolado acordado.
Discutir com este pacote - Engenharia com Claude Code / OpenAI Codex
Claude Code e/ou OpenAI Codex com configurações de nuvem aprovadas pela sua organização.
Discutir com este pacote
Não tem certeza? Recomendaremos um durante a definição de escopo. Compare as opções de entrega com IA
Solicitações típicas de avaliação
Cenários típicos que definimos em escopo, não estudos de caso de clientes.
Assistente de central de ajuda antes do lançamento público
Uma equipe quer um assistente que responda com base em seus artigos de ajuda. Transformamos perguntas reais de suporte em um conjunto rotulado, avaliamos respostas e citações, adicionamos casos fora de escopo e adversariais, e combinamos critérios de lançamento antes de lançar.
Migração de um recurso para um modelo de menor custo
Um dono de produto quer trocar um recurso para um modelo ou provedor mais barato. Executamos o mesmo conjunto de avaliação em ambos, mostramos onde as respostas melhoram ou pioram e como a latência muda, e deixamos a decisão com ele.
Um agente que pode alterar registros
Uma empresa permite que um agente interno atualize pedidos. Fazemos red team de suas permissões de ferramentas e pontos de aprovação, plantamos instruções em documentos que ele lê para testar injeção indireta, e recomendamos onde uma pessoa deve aprovar antes de ele agir.
Onde a avaliação de IA para
- Alterar prompts, recuperação ou o próprio modelo não faz parte da avaliação; recomendamos correções, e sua equipe as faz ou nós as escopamos sob Integração de LLM.
- Ataques aos servidores, APIs e conta de nuvem por trás do recurso pertencem ao Teste de Penetração; aqui sondamos as instruções, ferramentas e acesso a dados do modelo.
- Latência, limites de taxa e custos de modelo em tráfego de pico são medidos em Teste de Desempenho.
- A aprovação jurídica ou regulatória do seu uso de IA não está incluída; os resultados são evidências para sua própria revisão de risco e conformidade.
Como a avaliação de IA se conecta a design, QA e operações
Design: supervisão que as pessoas conseguem usar
Os designers moldam como os usuários veem as fontes, a incerteza e os erros, e como sua equipe revisa, corrige ou assume o controle de um agente.
QA: o restante do produto também
O QA de Software cobre o app ao redor da IA, como login, pagamentos, perfis de acesso e integrações, testados em relação aos requisitos como qualquer lançamento.
Operações: qualidade em produção
Logs de produção, feedback dos usuários, latência e custo alimentam o monitoramento e novos casos de avaliação, com alertas quando a qualidade começa a desviar.
Contínuo: reavaliar a cada mudança
Atualizações de modelo, edições de prompt e novas fontes de dados são avaliadas antes do lançamento, como parte das operações de IA acordadas com você.
FAQ
Perguntas frequentes
Em que isso difere de testar um app que a IA ajudou a construir?
Um app escrito com ferramentas de codificação de IA ainda se comporta como software comum, então o Software QA & Testing o cobre. A Avaliação de IA é para produtos em que um modelo gera respostas ou executa ações em tempo de execução. As saídas variam, então medimos a qualidade em muitos casos, testamos permissões e planejamos para falhas. Muitos produtos precisam de ambos, e nós os dimensionamos juntos.
Quais modelos e stacks de IA vocês conseguem avaliar?
Recursos construídos sobre modelos hospedados como OpenAI ou Claude, modelos de pesos abertos como Llama ou Mistral, pipelines de recuperação e frameworks de agentes. O método não depende do provedor, então você também pode usá-lo para comparar modelos ou provedores nos seus próprios casos.
A avaliação pode impedir que a IA erre algum dia?
Não. Os modelos ainda podem cometer erros. A avaliação mostra onde e como eles falham, para que você possa definir critérios de lançamento, adicionar salvaguardas e alternativas, projetar a revisão humana onde os erros são caros e perceber rapidamente quando a qualidade muda.
Onde são processados nossos prompts, logs e dados de avaliação?
As chamadas de modelo do próprio recurso vão para o provedor que você já usa. As ferramentas de IA que usamos no trabalho, como a avaliação baseada em modelo, são executadas dentro do limite que você escolher: Engenharia de IA Privada / Local em infraestrutura que você controla, ou Engenharia com Claude Code / OpenAI Codex sob termos de tratamento de dados acordados. Os dados pessoais nos logs são mascarados antes do uso, conforme acordado com você.
Leitura relacionada
- Reduzindo Respostas Sem Suporte em Aplicações RAG
Como a qualidade da recuperação, as permissões de documentos, as evidências e a avaliação podem reduzir respostas sem suporte—e onde um assistente de conhecimento ainda precisa de limites.
Veja como sua IA se comporta antes de colocá-la em produção
Conte-nos o que seu recurso de IA faz, qual modelo ele usa e o que preocupa você. Sugeriremos um plano de avaliação e critérios de lançamento.


