谁需要 AI 评估
你的 AI 功能在演示中表现不错,但还没有人能说清它在面对真实问题、恶意输入和缺失数据时如何表现,也说不清下一个模型或提示词的改动是否会让它变差。
- 即将把聊天机器人或助手交到客户面前的团队
- 正在更换模型、服务商或提示词、需要前后对比的产品负责人
- 让智能体读取内部记录或触发其他系统中操作的公司
每种行为是如何被评估的
面向客户的助手的示例方案;方法会随你的用例和风险而变化。
| 自动化评估 | 专家审查 | 红队测试 | 生产环境信号 | |
|---|---|---|---|---|
| 答案准确性 | 主要方法 | 主要方法 | 在此很少使用 | 辅助或抽样 |
| 依据与引用 | 主要方法 | 辅助或抽样 | 在此很少使用 | 辅助或抽样 |
| 权限边界 | 辅助或抽样 | 主要方法 | 主要方法 | 辅助或抽样 |
| 提示注入 | 辅助或抽样 | 辅助或抽样 | 主要方法 | 辅助或抽样 |
| 拒答与回退 | 主要方法 | 辅助或抽样 | 辅助或抽样 | 主要方法 |
- 主要方法
- 辅助或抽样
- 在此很少使用
测试 AI 功能是一项不同的工作
一个聊天机器人可以通过每一项功能测试,却仍然给出自信的错误答案、泄露不该泄露的数据,或遵从藏在上传文件里的指令。AI 功能需要自己的评估:真实而困难案例的数据集、对答案质量和依据支撑的检查、工具和数据权限、提示注入暴露面、故障处理,以及每当模型或提示变更时的回归检查。这不同于测试一个由 AI 协助构建的普通应用,后者由软件 QA 与测试涵盖。
AI 协助大规模评分;专家设定标准
AI 如何协助
- 生成你所认可的真实用户问题的各种变体,包括改述、边缘情况和对抗性输入。
- 用基于模型的评分对大批量答案进行评分,并以专家标注的答案进行校准。
- 按原因对失败进行聚类,例如缺失上下文、错误的工具调用或被忽略的指令。
- 在模型、提示或检索变更之间比较各次运行,并标记出行为变差的地方。
我们的专家负责什么
- 专家与你的领域专家一道,定义什么是正确、安全且有用的答案。
- 基于模型的评分会由人进行抽查,与专家意见不符的评分器会被修复或弃用。
- 由人决定一个智能体可以使用哪些工具和数据,以及在哪里必须由人类批准或接管。
- 发布标准和放行/不放行的决定仍掌握在你的团队和我们手中,而非仅凭一个分数。
您将获得什么
每次变更都可重新运行的评估
评估数据集
标注了预期行为的真实与合成案例:常见问题、边缘情况、超出范围的请求和过往失败。
答案质量与依据支撑
准确性、相关性和语气,以及答案是否得到你来源的支撑,核查引用并标记幻觉。
工具与数据权限测试
一个智能体可以读取、更改或触发什么,依据最小权限原则、审批节点和人类接管路径进行测试。
提示注入暴露面
通过消息、上传文件、网页和检索到的文档进行的直接与间接注入,按攻击者可触及的范围进行评级。
故障处理与回退
当模型超时、提供商宕机、检索一无所获或置信度偏低时的行为:回退、清晰的提示信息、移交给人。
回归检查与发布标准
在模型、提示或数据变更时重新运行的自动化评估,并带有约定好的标准来决定某次变更是否发布。
一次 AI 评估如何进行
- 01
定义良好行为
与你的团队和领域专家商定用例、风险、质量标准和权限,并收集你允许我们使用的真实示例。
- 02
构建数据集
组装并标注评估案例,包括困难和对抗性的案例,并设定每次变更必须满足的发布标准。
- 03
评估与探测
运行带有专家审阅的自动化评估、红队权限测试和提示注入,并将失败追溯到提示、检索、工具或模型。
- 04
设卡与监控
将评估加入你的发布流程,报告结果并附上推荐的修复方案,并随着产品变化保持数据集的时效性。
典型的评估需求
我们所界定范围的典型场景,而非客户案例研究。
公开上线前的帮助中心助手
一个团队想要一个能从其帮助文章中作答的助手。我们把真实的支持问题整理成带标注的数据集,对答案和引用进行评分,加入超出范围和对抗性的用例,并在上线前商定发布标准。
将某项功能迁移到成本更低的模型
一位产品负责人想把某项功能切换到更便宜的模型或服务商。我们在两者上运行相同的评估集,展示答案在哪些地方变好或变差以及延迟如何变化,并把决定权留给他们。
能够修改记录的智能体
一家公司让内部智能体更新订单。我们对其工具权限和审批节点进行红队测试,在它读取的文档中植入指令以测试间接注入,并建议在哪些地方必须由人工审批后它才能行动。
AI 评估的边界在哪里
- 更改提示词、检索或模型本身不属于评估范畴;我们建议修复方案,由你的团队实施,或由我们在 LLM Integration 下进行范围界定。
- 针对功能背后的服务器、API 和云账户的攻击属于 Penetration Testing;在这里我们探测的是模型的指令、工具和数据访问。
- 高峰流量下的延迟、速率限制和模型成本在 Performance Testing 中衡量。
- 对你 AI 使用的法律或监管层面的审批不包含在内;结果可作为你自己风险与合规审查的证据。
AI 评估如何与设计、QA 和运营相衔接
设计:人可以使用的监督
设计师塑造用户如何看到来源、不确定性和错误,以及你的员工如何审阅、纠正或从智能体手中接管。
QA:也包括产品的其余部分
软件 QA 涵盖围绕 AI 的应用,例如登录、支付、角色和集成,像任何一次发布一样依据需求进行测试。
运营:生产环境中的质量
生产日志、用户反馈、延迟和成本会为监控和新的评估案例提供输入,并在质量开始漂移时发出告警。
持续进行:对每次变更重新评估
模型升级、提示修改和新数据源会在发布前进行评估,作为与你约定的 AI 运营的一部分。
常见问题
常见问题解答
这与测试一个由 AI 协助构建的应用有何不同?
用 AI 编码工具编写的应用,其行为仍然像普通软件,因此由软件 QA 与测试涵盖。AI 评估针对的是那些由模型在运行时生成答案或采取行动的产品。输出各不相同,因此我们在众多案例上衡量质量、测试权限并为故障做好计划。许多产品两者都需要,我们会把它们一起纳入范围。
你们可以评估哪些模型和 AI 技术栈?
基于托管模型(如 OpenAI 或 Claude)、开放权重模型(如 Llama 或 Mistral)、检索流水线和智能体框架构建的功能。该方法不依赖于提供商,因此你也可以用它在自己的案例上比较不同的模型或提供商。
评估能让 AI 永远不出错吗?
不能。模型仍然会犯错。评估会显示它们在何处以及如何失败,从而让你能够设定发布标准、添加防护栏和回退、在错误代价高昂处设计人工审阅,并在质量发生变化时迅速察觉。
我们的提示、日志和评估数据在哪里处理?
你功能自身的模型调用会发往你已经在使用的提供商。我们在工作中使用的 AI 工具(例如基于模型的评分)运行在你所选择的边界之内:由你控制的基础设施上的私有/本地 AI 工程,或在约定的数据处理条款下的 Claude Code / OpenAI Codex 工程。日志中的个人数据会在使用前按与你的约定进行脱敏。
相关阅读
- 减少 RAG 应用中的无依据回答
检索质量、文档权限、证据和评估如何能减少无依据的回答——以及一个知识助手在哪些方面仍然需要设定限制。



