QA 与发布保障

AI 评估与测试

测试你产品内部的 AI,而不仅仅是围绕它的应用。我们评估智能体、聊天机器人和 LLM 功能中的答案质量、依据支撑、权限和故障处理,并设定清晰的发布标准。

谁需要 AI 评估

你的 AI 功能在演示中表现不错,但还没有人能说清它在面对真实问题、恶意输入和缺失数据时如何表现,也说不清下一个模型或提示词的改动是否会让它变差。

  • 即将把聊天机器人或助手交到客户面前的团队
  • 正在更换模型、服务商或提示词、需要前后对比的产品负责人
  • 让智能体读取内部记录或触发其他系统中操作的公司

每种行为是如何被评估的

面向客户的助手的示例方案;方法会随你的用例和风险而变化。

自动化评估专家审查红队测试生产环境信号
答案准确性主要方法主要方法在此很少使用辅助或抽样
依据与引用主要方法辅助或抽样在此很少使用辅助或抽样
权限边界辅助或抽样主要方法主要方法辅助或抽样
提示注入辅助或抽样辅助或抽样主要方法辅助或抽样
拒答与回退主要方法辅助或抽样辅助或抽样主要方法
  • 主要方法
  • 辅助或抽样
  • 在此很少使用

测试 AI 功能是一项不同的工作

一个聊天机器人可以通过每一项功能测试,却仍然给出自信的错误答案、泄露不该泄露的数据,或遵从藏在上传文件里的指令。AI 功能需要自己的评估:真实而困难案例的数据集、对答案质量和依据支撑的检查、工具和数据权限、提示注入暴露面、故障处理,以及每当模型或提示变更时的回归检查。这不同于测试一个由 AI 协助构建的普通应用,后者由软件 QA 与测试涵盖。

AI 协助大规模评分;专家设定标准

AI 如何协助

  • 生成你所认可的真实用户问题的各种变体,包括改述、边缘情况和对抗性输入。
  • 用基于模型的评分对大批量答案进行评分,并以专家标注的答案进行校准。
  • 按原因对失败进行聚类,例如缺失上下文、错误的工具调用或被忽略的指令。
  • 在模型、提示或检索变更之间比较各次运行,并标记出行为变差的地方。

我们的专家负责什么

  • 专家与你的领域专家一道,定义什么是正确、安全且有用的答案。
  • 基于模型的评分会由人进行抽查,与专家意见不符的评分器会被修复或弃用。
  • 由人决定一个智能体可以使用哪些工具和数据,以及在哪里必须由人类批准或接管。
  • 发布标准和放行/不放行的决定仍掌握在你的团队和我们手中,而非仅凭一个分数。

您将获得什么

每次变更都可重新运行的评估

  • 评估数据集

    标注了预期行为的真实与合成案例:常见问题、边缘情况、超出范围的请求和过往失败。

  • 答案质量与依据支撑

    准确性、相关性和语气,以及答案是否得到你来源的支撑,核查引用并标记幻觉。

  • 工具与数据权限测试

    一个智能体可以读取、更改或触发什么,依据最小权限原则、审批节点和人类接管路径进行测试。

  • 提示注入暴露面

    通过消息、上传文件、网页和检索到的文档进行的直接与间接注入,按攻击者可触及的范围进行评级。

  • 故障处理与回退

    当模型超时、提供商宕机、检索一无所获或置信度偏低时的行为:回退、清晰的提示信息、移交给人。

  • 回归检查与发布标准

    在模型、提示或数据变更时重新运行的自动化评估,并带有约定好的标准来决定某次变更是否发布。

一次 AI 评估如何进行

  1. 01

    定义良好行为

    与你的团队和领域专家商定用例、风险、质量标准和权限,并收集你允许我们使用的真实示例。

  2. 02

    构建数据集

    组装并标注评估案例,包括困难和对抗性的案例,并设定每次变更必须满足的发布标准。

  3. 03

    评估与探测

    运行带有专家审阅的自动化评估、红队权限测试和提示注入,并将失败追溯到提示、检索、工具或模型。

  4. 04

    设卡与监控

    将评估加入你的发布流程,报告结果并附上推荐的修复方案,并随着产品变化保持数据集的时效性。

使用 AI 工具的两种方式

AI 协助起草测试并调查缺陷。选择它可以在何处处理您的代码和测试数据。

不确定?我们会在界定范围时为您推荐一个。 比较 AI 交付选项

典型的评估需求

我们所界定范围的典型场景,而非客户案例研究。

  • 公开上线前的帮助中心助手

    一个团队想要一个能从其帮助文章中作答的助手。我们把真实的支持问题整理成带标注的数据集,对答案和引用进行评分,加入超出范围和对抗性的用例,并在上线前商定发布标准。

  • 将某项功能迁移到成本更低的模型

    一位产品负责人想把某项功能切换到更便宜的模型或服务商。我们在两者上运行相同的评估集,展示答案在哪些地方变好或变差以及延迟如何变化,并把决定权留给他们。

  • 能够修改记录的智能体

    一家公司让内部智能体更新订单。我们对其工具权限和审批节点进行红队测试,在它读取的文档中植入指令以测试间接注入,并建议在哪些地方必须由人工审批后它才能行动。

AI 评估的边界在哪里

  • 更改提示词、检索或模型本身不属于评估范畴;我们建议修复方案,由你的团队实施,或由我们在 LLM Integration 下进行范围界定。
  • 针对功能背后的服务器、API 和云账户的攻击属于 Penetration Testing;在这里我们探测的是模型的指令、工具和数据访问。
  • 高峰流量下的延迟、速率限制和模型成本在 Performance Testing 中衡量。
  • 对你 AI 使用的法律或监管层面的审批不包含在内;结果可作为你自己风险与合规审查的证据。

AI 评估如何与设计、QA 和运营相衔接

  • 设计:人可以使用的监督

    设计师塑造用户如何看到来源、不确定性和错误,以及你的员工如何审阅、纠正或从智能体手中接管。

  • QA:也包括产品的其余部分

    软件 QA 涵盖围绕 AI 的应用,例如登录、支付、角色和集成,像任何一次发布一样依据需求进行测试。

  • 运营:生产环境中的质量

    生产日志、用户反馈、延迟和成本会为监控和新的评估案例提供输入,并在质量开始漂移时发出告警。

  • 持续进行:对每次变更重新评估

    模型升级、提示修改和新数据源会在发布前进行评估,作为与你约定的 AI 运营的一部分。

常见问题

常见问题解答

这与测试一个由 AI 协助构建的应用有何不同?

用 AI 编码工具编写的应用,其行为仍然像普通软件,因此由软件 QA 与测试涵盖。AI 评估针对的是那些由模型在运行时生成答案或采取行动的产品。输出各不相同,因此我们在众多案例上衡量质量、测试权限并为故障做好计划。许多产品两者都需要,我们会把它们一起纳入范围。

你们可以评估哪些模型和 AI 技术栈?

基于托管模型(如 OpenAI 或 Claude)、开放权重模型(如 Llama 或 Mistral)、检索流水线和智能体框架构建的功能。该方法不依赖于提供商,因此你也可以用它在自己的案例上比较不同的模型或提供商。

评估能让 AI 永远不出错吗?

不能。模型仍然会犯错。评估会显示它们在何处以及如何失败,从而让你能够设定发布标准、添加防护栏和回退、在错误代价高昂处设计人工审阅,并在质量发生变化时迅速察觉。

我们的提示、日志和评估数据在哪里处理?

你功能自身的模型调用会发往你已经在使用的提供商。我们在工作中使用的 AI 工具(例如基于模型的评分)运行在你所选择的边界之内:由你控制的基础设施上的私有/本地 AI 工程,或在约定的数据处理条款下的 Claude Code / OpenAI Codex 工程。日志中的个人数据会在使用前按与你的约定进行脱敏。

相关阅读

  • 人工智能

    减少 RAG 应用中的无依据回答

    检索质量、文档权限、证据和评估如何能减少无依据的回答——以及一个知识助手在哪些方面仍然需要设定限制。

在发布之前看看你的 AI 如何表现

告诉我们你的 AI 功能做什么、使用哪个模型以及你担心什么。我们会建议一份评估计划和发布标准。