DevOps 与云基础设施

私有 AI 基础设施

在您控制数据的地方托管您产品的 AI 模型和代理。我们将它们部署在您的基础设施或约定的隔离环境中,然后对它们进行评估、规格调整、加固、监控和更新。

您产品的 AI 实际在哪里运行

许多 AI 功能会把提示、文档和输出发送到第三方模型 API。出于数据政策、客户合同或锁定模型版本的需要,有些产品需要在它们所控制的边界内进行这种处理。我们会在您的云账户、本地或约定的隔离环境中为您的产品托管模型和代理,并长期运营它们。这关乎的是您的成品。我们在构建您软件时所使用的 AI 工具是另一个独立的决定。

AI 辅助、专家主导的 AI 基础设施

AI 如何协助

  • 针对您的评估集对候选模型进行打分,配以工程师抽查的自动化检查和模型评分检查。
  • 起草服务、自动扩缩和基础设施配置,供工程师审查。
  • 分析负载测试和使用数据,以建议计算规格,包括是否根本需要 GPU。
  • 审查模型和代理日志,以暴露故障、异常的工具调用和回答质量的下降。

我们的专家负责什么

  • 模型选择,针对您的用例权衡回答质量、许可、规模和运行成本。
  • 计算规格:只有在实测工作负载需要时才使用 GPU。
  • 网络边界、访问控制,以及什么被记录、保留或允许离开环境。
  • 在回归评估之后,对模型、提示和代理权限变更的发布审批。

哪些内容保留在您的边界之内

这是一个内部文档助手的示意边界;真实的界线会在部署任何内容之前与您约定。

  • 在您的边界之内

    • 提示词、上传的文档和模型输出
    • 模型权重以及运行推理的服务器
    • 由您的文件构建的搜索索引和嵌入
    • 日志和评估数据,仅在您的政策允许的范围内保留
    • 智能体对内部系统的工具调用,每个都带有限定范围的权限
  • 仅在批准后才跨越边界

    • 新模型版本,在通过许可证和评估检查后引入
    • 用于外部仪表盘的汇总使用量和延迟指标
    • 为解决某个问题而与软件供应商共享的经脱敏处理的示例
    • 在您允许的情况下,对外部模型 API 的回退调用
  • 保留在边界之外

    • 第三方模型 API 以及运营它们的提供商
    • 会记录提示词文本的托管式分析或错误跟踪
    • 来自服务软件的供应商遥测数据,尽可能关闭

我们搭建和运行的内容

为您的 AI 提供托管、评估和运维

  • 模型选择与评估

    在您自己的示例上比较 Llama、Mistral 或 Qwen 等开放权重模型的回答质量、速度、许可和运行成本。

  • 服务与扩缩

    诸如 vLLM 之类的推理服务器置于内部 API 之后,配以请求排队、批处理和按真实需求调整规格的自动扩缩。

  • 规格适配的计算资源

    根据负载测试确定 CPU、GPU 或混合容量规模。较小的或量化的模型通常就能胜任;只有在工作负载需要时才添加 GPU。

  • 访问与网络边界

    私有网络、经过身份验证的端点、基于角色的访问控制以及受控的出站连接,使提示词和输出都保持在约定的边界之内。

  • 日志记录与监控

    跟踪延迟、错误、吞吐量、资源使用情况以及答案质量信号,日志记录则围绕可存储的内容进行设计。

  • 模型、提示词与智能体更新

    更新仅在通过回归评估后才发布,此外还包括已部署智能体的运营:工具权限、审批节点、运行日志和人工接管。

谁需要私有托管的 AI

您产品的 AI 不能再将提示词和文档发送给外部的模型 API,而团队中又没有人曾在生产环境中运行过模型。

  • 其企业买家不允许数据触及外部模型 API 的软件供应商
  • 必须将文档和模型日志保留在自有基础设施上的受监管团队
  • 围绕机密文件(例如合同或人力资源记录)构建内部助手的团队

典型的私有 AI 需求

我们所界定范围的典型场景,而非客户案例研究。

  • 将可用的功能从模型 API 迁移出来

    一款文档摘要工具使用了商业 API,而某大客户的合同如今禁止这样做。我们会在它的真实输入上测试开放权重模型,在您的云账户中托管一个符合您质量标准的模型,并在同一内部接口背后进行切换。

  • 无互联网连接的服务器

    某部署场所不允许任何出站互联网连接,因此模型必须在本地服务器上运行。我们会将模型、服务软件和依赖项打包以供离线安装,并约定在携带进入之前如何检查每个新版本。

  • 在不存储提示词的情况下进行调试

    政策规定提示词可能包含个人数据且不得存储,但故障仍需调查。我们会默认记录元数据和质量信号,仅在您批准后才在有限期限内捕获经脱敏处理的样本。

从需求到运行中的模型

  1. 01

    界定边界

    我们约定使用场景、哪些数据可被处理、边界所在位置、预期负载,以及您的评估集将测试的质量标准。

  2. 02

    评估与确定规模

    在您的示例上测试候选模型,然后根据负载测试确定算力规模。只有当结果表明确实需要时,我们才会推荐 GPU。

  3. 03

    部署与加固

    以代码形式部署服务、访问控制、网络规则、日志记录和监控,然后在真实流量进入前进行负载测试和故障测试。

  4. 04

    运营与改进

    监控、容量与访问审查,以及仅在通过回归评估后才发布的模型或提示词更新。

使用 AI 工具的两种方式

AI 协助处理基础设施代码和诊断。选择它可以在何处处理您的配置和日志。

不确定?我们会在界定范围时为您推荐一个。 比较 AI 交付选项

私有 AI 托管不包含的内容

  • 设计和构建 AI 功能或智能体本身属于 LLM Integration 或 Automation Agents;本服务托管、保护并运营其背后的模型。
  • 训练自定义模型属于 Machine Learning Models,微调语言模型则归入 LLM Integration 的范围;我们负责托管和运营其成果。
  • 运行您应用的其余部分(例如 Web 服务器、数据库和常规发布)属于 Managed DevOps & Operations;本服务涵盖模型和智能体。
  • 我们会对照您的预期用途检查模型许可证,但关于许可证和数据协议的法律签署仍由您自己的法律顾问负责。

工程、QA 与运维如何衔接

  • 融入您产品的 AI 工程

    我们的 AI 工程师将托管模型接入您的产品:检索、工具调用、智能体工作流,以及供人们审核、纠正或接管的界面。

  • 作为 QA 的评估

    QA 为答案质量、工具权限和故障处理维护评估数据集与回归检查,并在每次模型或提示词变更前运行它们。

  • 面向 AI 行为的设计

    设计师塑造 AI 输出的呈现方式:加载与回退状态、来源,以及人们用来纠正或覆盖结果的控件。

  • 上线后的运营

    托管模型与运行一个普通应用不同。我们会持续审查容量、访问、更新和评估,支持时长则在支持计划中约定。

常见问题

常见问题解答

这与 私有 / 本地 AI 工程 套餐有何不同?

Private AI Infrastructure 是您成品产品的 AI 运行之处:您的用户或员工使用的模型和智能体。私有 / 本地 AI 工程 是一个开发套餐:它让我们在构建您软件时所使用的 AI 工具在约定边界内的模型上运行。另一个套餐 Claude Code / OpenAI Codex 工程 则使用商业化的编码智能体。任一套餐都可以与本服务结合使用。

我们需要 GPU 才能运行私有模型吗?

并非总是如此。较小的或量化的模型可以在 CPU 上运行,用于分类、抽取或低量的内部工具等任务。较大的模型、较长的输入以及大量同时在线的用户通常需要 GPU。我们会根据您真实使用场景的负载测试来确定算力规模,并推荐能满足您质量和速度需求的最小配置。

你们能托管哪些模型?

诸如 Llama、Mistral、Qwen 或 Gemma 等开放权重语言模型,用于搜索的嵌入和重排序模型,以及您团队训练的特定任务模型。我们会在您自己的示例上比较候选模型,并在推荐之前检查每个许可证是否适用于您的预期用途。

自托管比使用模型 API 更便宜吗?

有时如此。在低量或不均衡的使用量下,在合适条款下的托管 API 往往更便宜也更简单。当数据必须保持在您的边界之内、当您需要控制模型版本,或当稳定的使用量使专用容量变得经济时,私有托管才有意义。在您做出决定之前,我们会针对您的预期使用量对两者进行比较。

让您产品的 AI 保持在您的边界之内

告诉我们您的 AI 功能做什么,以及数据必须保留在何处。我们将推荐与之匹配的模型、托管方式和运营计划。