AI 代理与自动化

LLM 集成

为你的产品添加大语言模型,支持基于你自有数据的检索、在真实问题上的评估、安全护栏、成本控制,以及在模型不确定时清晰的回退机制。

为生产环境打造的 LLM 功能

调用模型 API 是容易的部分。让它的回答在你的产品中做到准确、安全且经济实惠才是真正的工作。我们将 OpenAI 的 GPT 模型、Claude、Gemini、Llama 或 Mistral 等模型集成到你的软件中,从单个功能到基于你知识库的检索增强生成(RAG)。面向产品与工程团队,我们负责模型选择、检索、提示词、评估、安全护栏与成本控制,并设计用户如何看到来源以及标记错误答案。

AI 辅助、专家主导的 LLM 工程

AI 如何协助

  • 编码智能体起草集成代码、检索管道和测试框架,供工程师审阅。
  • AI 从你的文档中提出测试问题;由你的专家批准那些定义质量标准的问题。
  • AI 比较候选模型和提示词的输出,并标记可能的回归问题以供审阅。
  • AI 汇总生产日志和用户反馈,揭示反复出现的故障模式。

我们的专家负责什么

  • 基于评估结果、成本和你的数据规则进行模型与供应商选择
  • 模型可以访问的内容:数据源、用户权限和保留设置
  • 任何发布之前答案必须达到的质量标准
  • 当检索失败、供应商宕机或模型不确定时的回退行为

如何生成一个有依据的答案

示意性的检索增强请求;来源规则、检查和回退措辞均为您的产品量身设计。

  1. 提出的问题

    已登录的用户提出问题;其身份和角色随请求一同传递。

  2. 获准的检索

    搜索根据与问题的相关性对您已索引来源中的段落进行排名。

    检查点: 仅此用户可查看的段落

  3. 带来源的提示

    问题、检索到的段落,以及关于格式和拒答的版本化指令被组合成一个提示。

  4. 模型响应

    所选模型返回一个结构化答案,并引用其所依据的段落。

  5. 依据检查

    自动检查确认每个引用都指向一个检索到的段落,并标记超出这些段落范围的声明。

    检查点: 无依据的答案会被扣留

  6. 答案或回退

    用户看到带有来源链接的答案,或看到一条表明没有任何获准内容涵盖此问题的简明消息。

当出现故障时: 如果检索未找到任何内容、检查失败或服务提供商宕机,该功能会如实说明而不会猜测,并记录该情况以供审查。

谁会需要 LLM 功能

你希望有一个模型根据你自有的数据作答,但快速原型却陈述了你的文档不支持的内容,忽视了谁可以看到什么,而且运行成本无人能够预测。

  • 为现有 SaaS 应用添加搜索、摘要或起草功能的产品团队
  • 员工难以在内部政策和手册中找到答案的组织
  • 首次将 LLM 原型投入生产环境的工程团队

您将获得什么

一个 LLM 功能在生产环境中需要什么

  • 模型选择与集成

    从你的后端连接到 OpenAI、Claude、Gemini 或开放权重模型,具备速率限制、重试、供应商回退和用量跟踪。

  • 基于你知识库的 RAG

    通过向量数据库从你的文档和数据中检索,附带来源引用和访问规则,使答案尊重每个用户的权限。

  • 提示词与结构化输出

    带版本管理的提示词、少样本示例和你的代码可以校验的结构化输出,而不是需要代码去猜测的自由文本。

  • 评估套件

    基于你真实问题构建的测试集,按准确性、来源依据和格式进行评分,并在每次提示词、模型或数据变更之前重新运行。

  • 安全护栏与回退

    输入过滤、输出审核、提示注入防御,以及当模型不确定或供应商不可用时的既定回退机制。

  • 在有帮助时进行微调

    在你的数据上针对领域语言、语气或格式进行微调,当评估显示提示词和检索还不够用时采用。

LLM 集成之外

  • 更改记录或在其他系统中触发操作的多步骤工作属于自动化代理;此处的 LLM 功能是在您的产品内进行回答、起草或提取。
  • 您网站或 WhatsApp 上的客户服务助手,并可转交给支持人员,这由 AI 聊天机器人涵盖。
  • 我们不会撰写或更正您的源文档:当检索呈现过时或冲突的内容时,我们会将其标记出来,交由其所有者修复。
  • 在您自己的服务器或云账户上运行开放权重模型,这被单独界定为私有 AI 基础设施,通常与集成一同进行。

典型的 LLM 请求

我们所界定范围的典型场景,而非客户案例研究。

  • 来自内部政策文档的答案

    员工在共享驱动器中搜索,常常找到过时的政策副本。我们只会索引当前版本,应用每个团队的访问规则,为每个答案引用其背后的段落,并在没有任何获准来源涵盖该问题时拒绝作答。

  • 多租户 SaaS 产品内的摘要

    某 SaaS 应用希望有一个按钮来总结某账户的近期活动。我们会在构建提示之前按租户和角色过滤检索,并添加试图拉取其他客户数据的测试用例。

  • 从浏览器调用模型的原型

    一个可运行的原型使用共享 API 密钥直接从浏览器发送提示。我们会将调用移至您的后端,添加按用户的限额、日志记录和版本化提示,并在首次发布前构建评估集。

我们如何交付 LLM 集成

  1. 01

    用例与可行性

    我们在你的真实数据和问题上尝试该用例,比较候选模型,并在你承诺完整构建之前估算运行成本。

  2. 02

    架构与数据规则

    集成模式、检索设计、访问规则、供应商条款和回退行为将与你的团队商定并记录在案。

  3. 03

    构建与评估

    工程师构建集成和面向用户的功能,QA 根据评估集对其评分,直到达到你批准的质量标准。

  4. 04

    发布与监控

    在受控的上线过程中进行监控、成本限制和反馈采集,随后随着模型、提示词和数据的变化持续评估。

使用 AI 工具的两种方式

选择在我们构建期间 AI 编码代理可以在何处处理您的代码。无论哪种方式,工程标准都是一致的。

不确定?我们会在界定范围时为您推荐一个。 比较 AI 交付选项

设计、QA 与运维如何支持你的 LLM 功能

  • 为信任与纠错而设计

    设计师规划答案、来源和不确定性如何呈现,用户如何编辑或标记错误答案,以及你的团队如何审查这些标记,使该功能对自身的局限性保持诚实。

  • 超越理想路径的 QA

    QA 维护评估集,测试答案质量、数据权限和提示注入风险,并在模型、提示词或数据变更后重新运行回归检查。

  • 运维与成本控制

    DevOps 运行该集成,配备日志、用量和成本仪表盘、缓存和模型路由,并在数据规则要求时在私有基础设施上运行开放权重模型。

  • 模型与提示词更新

    供应商会更改和淘汰模型。我们在切换之前针对你的评估集测试替代方案,并随着用量增长持续调优提示词、检索和成本。

常见问题

常见问题解答

什么是 RAG,我们需要它吗?

检索增强生成(RAG)让模型能够根据你自有的文档和数据作答,而不仅仅依靠其通用训练。当答案必须反映私有的、专业的或频繁变化的信息时,你就需要它。我们添加来源引用以便答案可被核查,并添加访问规则,使用户只检索他们有权查看的内容。

我们应该微调模型还是使用 RAG?

大多数功能应从良好的提示词和检索开始,因为它们更改起来更快、也更易于审计。当你需要提示词无法稳定保持的一致格式、语气或领域词汇时,微调会有帮助,有时还能让更小、更便宜的模型胜任这项工作。我们依据你数据上的评估结果来决定,而不是默认采用某种方式。

我们可以使用私有或开源模型吗?

可以。Llama 或 Mistral 等开放权重模型可以在你控制的基础设施上运行,或者我们可以在商定的账户和数据保留设置下使用 OpenAI 或 Claude 等托管供应商。我们自己的开发工作遵循你选择的套餐:私有 / 本地 AI 工程 或 Claude Code / OpenAI Codex 工程。

构建和运行一个 LLM 功能的成本是多少?

构建成本取决于范围:数据源、集成、界面工作和评估深度。运行成本取决于用量和模型选择。我们在可行性阶段对两者进行估算,然后通过模型路由、缓存、令牌限制和你可以看到的用量仪表盘来管理运行成本。

相关阅读

  • 人工智能

    减少 RAG 应用中的无依据回答

    检索质量、文档权限、证据和评估如何能减少无依据的回答——以及一个知识助手在哪些方面仍然需要设定限制。

将一个 LLM 功能投入生产

带上一个用例和示例数据。在你做出承诺之前,我们会测试可行性、比较模型,并概述评估、安全护栏和运行成本。