
为生产环境打造的 LLM 功能
调用模型 API 是容易的部分。让它的回答在你的产品中做到准确、安全且经济实惠才是真正的工作。我们将 OpenAI 的 GPT 模型、Claude、Gemini、Llama 或 Mistral 等模型集成到你的软件中,从单个功能到基于你知识库的检索增强生成(RAG)。面向产品与工程团队,我们负责模型选择、检索、提示词、评估、安全护栏与成本控制,并设计用户如何看到来源以及标记错误答案。
AI 辅助、专家主导的 LLM 工程
AI 如何协助
- 编码智能体起草集成代码、检索管道和测试框架,供工程师审阅。
- AI 从你的文档中提出测试问题;由你的专家批准那些定义质量标准的问题。
- AI 比较候选模型和提示词的输出,并标记可能的回归问题以供审阅。
- AI 汇总生产日志和用户反馈,揭示反复出现的故障模式。
我们的专家负责什么
- 基于评估结果、成本和你的数据规则进行模型与供应商选择
- 模型可以访问的内容:数据源、用户权限和保留设置
- 任何发布之前答案必须达到的质量标准
- 当检索失败、供应商宕机或模型不确定时的回退行为
如何生成一个有依据的答案
示意性的检索增强请求;来源规则、检查和回退措辞均为您的产品量身设计。
提出的问题
已登录的用户提出问题;其身份和角色随请求一同传递。
获准的检索
搜索根据与问题的相关性对您已索引来源中的段落进行排名。
检查点: 仅此用户可查看的段落
带来源的提示
问题、检索到的段落,以及关于格式和拒答的版本化指令被组合成一个提示。
模型响应
所选模型返回一个结构化答案,并引用其所依据的段落。
依据检查
自动检查确认每个引用都指向一个检索到的段落,并标记超出这些段落范围的声明。
检查点: 无依据的答案会被扣留
答案或回退
用户看到带有来源链接的答案,或看到一条表明没有任何获准内容涵盖此问题的简明消息。
当出现故障时: 如果检索未找到任何内容、检查失败或服务提供商宕机,该功能会如实说明而不会猜测,并记录该情况以供审查。
谁会需要 LLM 功能
你希望有一个模型根据你自有的数据作答,但快速原型却陈述了你的文档不支持的内容,忽视了谁可以看到什么,而且运行成本无人能够预测。
- 为现有 SaaS 应用添加搜索、摘要或起草功能的产品团队
- 员工难以在内部政策和手册中找到答案的组织
- 首次将 LLM 原型投入生产环境的工程团队
您将获得什么
一个 LLM 功能在生产环境中需要什么
模型选择与集成
从你的后端连接到 OpenAI、Claude、Gemini 或开放权重模型,具备速率限制、重试、供应商回退和用量跟踪。
基于你知识库的 RAG
通过向量数据库从你的文档和数据中检索,附带来源引用和访问规则,使答案尊重每个用户的权限。
提示词与结构化输出
带版本管理的提示词、少样本示例和你的代码可以校验的结构化输出,而不是需要代码去猜测的自由文本。
评估套件
基于你真实问题构建的测试集,按准确性、来源依据和格式进行评分,并在每次提示词、模型或数据变更之前重新运行。
安全护栏与回退
输入过滤、输出审核、提示注入防御,以及当模型不确定或供应商不可用时的既定回退机制。
在有帮助时进行微调
在你的数据上针对领域语言、语气或格式进行微调,当评估显示提示词和检索还不够用时采用。
范围、准备工作与支持
从明确定义的范围开始
在应用程序内定义一个 AI 功能:用户问什么、有哪些证据可用,以及当证据不足时系统必须做什么。将检索、权限、评估和回退行为一同界定范围。
你需要提供什么
准备具有代表性的问题、经批准的源文档、数据访问规则和预期使用情况。指派一位负责人来更正过时内容并批准评估标准。我们会在实施前确认服务提供商账户和数据处理约束。
交付后的支持
为源刷新、模型或服务提供商变更、评估重跑和成本监控做好规划。支持服务可在约定的计划下涵盖这些内容;添加 AI 功能并不要求选择 AI 辅助开发工具。
LLM 集成之外
- 更改记录或在其他系统中触发操作的多步骤工作属于自动化代理;此处的 LLM 功能是在您的产品内进行回答、起草或提取。
- 您网站或 WhatsApp 上的客户服务助手,并可转交给支持人员,这由 AI 聊天机器人涵盖。
- 我们不会撰写或更正您的源文档:当检索呈现过时或冲突的内容时,我们会将其标记出来,交由其所有者修复。
- 在您自己的服务器或云账户上运行开放权重模型,这被单独界定为私有 AI 基础设施,通常与集成一同进行。
典型的 LLM 请求
我们所界定范围的典型场景,而非客户案例研究。
来自内部政策文档的答案
员工在共享驱动器中搜索,常常找到过时的政策副本。我们只会索引当前版本,应用每个团队的访问规则,为每个答案引用其背后的段落,并在没有任何获准来源涵盖该问题时拒绝作答。
多租户 SaaS 产品内的摘要
某 SaaS 应用希望有一个按钮来总结某账户的近期活动。我们会在构建提示之前按租户和角色过滤检索,并添加试图拉取其他客户数据的测试用例。
从浏览器调用模型的原型
一个可运行的原型使用共享 API 密钥直接从浏览器发送提示。我们会将调用移至您的后端,添加按用户的限额、日志记录和版本化提示,并在首次发布前构建评估集。
我们如何交付 LLM 集成
- 01
用例与可行性
我们在你的真实数据和问题上尝试该用例,比较候选模型,并在你承诺完整构建之前估算运行成本。
- 02
架构与数据规则
集成模式、检索设计、访问规则、供应商条款和回退行为将与你的团队商定并记录在案。
- 03
构建与评估
工程师构建集成和面向用户的功能,QA 根据评估集对其评分,直到达到你批准的质量标准。
- 04
发布与监控
在受控的上线过程中进行监控、成本限制和反馈采集,随后随着模型、提示词和数据的变化持续评估。
设计、QA 与运维如何支持你的 LLM 功能
为信任与纠错而设计
设计师规划答案、来源和不确定性如何呈现,用户如何编辑或标记错误答案,以及你的团队如何审查这些标记,使该功能对自身的局限性保持诚实。
超越理想路径的 QA
QA 维护评估集,测试答案质量、数据权限和提示注入风险,并在模型、提示词或数据变更后重新运行回归检查。
运维与成本控制
DevOps 运行该集成,配备日志、用量和成本仪表盘、缓存和模型路由,并在数据规则要求时在私有基础设施上运行开放权重模型。
模型与提示词更新
供应商会更改和淘汰模型。我们在切换之前针对你的评估集测试替代方案,并随着用量增长持续调优提示词、检索和成本。
常见问题
常见问题解答
什么是 RAG,我们需要它吗?
检索增强生成(RAG)让模型能够根据你自有的文档和数据作答,而不仅仅依靠其通用训练。当答案必须反映私有的、专业的或频繁变化的信息时,你就需要它。我们添加来源引用以便答案可被核查,并添加访问规则,使用户只检索他们有权查看的内容。
我们应该微调模型还是使用 RAG?
大多数功能应从良好的提示词和检索开始,因为它们更改起来更快、也更易于审计。当你需要提示词无法稳定保持的一致格式、语气或领域词汇时,微调会有帮助,有时还能让更小、更便宜的模型胜任这项工作。我们依据你数据上的评估结果来决定,而不是默认采用某种方式。
我们可以使用私有或开源模型吗?
可以。Llama 或 Mistral 等开放权重模型可以在你控制的基础设施上运行,或者我们可以在商定的账户和数据保留设置下使用 OpenAI 或 Claude 等托管供应商。我们自己的开发工作遵循你选择的套餐:私有 / 本地 AI 工程 或 Claude Code / OpenAI Codex 工程。
构建和运行一个 LLM 功能的成本是多少?
构建成本取决于范围:数据源、集成、界面工作和评估深度。运行成本取决于用量和模型选择。我们在可行性阶段对两者进行估算,然后通过模型路由、缓存、令牌限制和你可以看到的用量仪表盘来管理运行成本。
相关阅读
- 减少 RAG 应用中的无依据回答
检索质量、文档权限、证据和评估如何能减少无依据的回答——以及一个知识助手在哪些方面仍然需要设定限制。


