DevOps 与云基础设施
私有 AI 基础设施
在您控制数据的地方托管您产品的 AI 模型和代理。我们将它们部署在您的基础设施或约定的隔离环境中,然后对它们进行评估、规格调整、加固、监控和更新。

您产品的 AI 实际在哪里运行
许多 AI 功能会把提示、文档和输出发送到第三方模型 API。出于数据政策、客户合同或锁定模型版本的需要,有些产品需要在它们所控制的边界内进行这种处理。我们会在您的云账户、本地或约定的隔离环境中为您的产品托管模型和代理,并长期运营它们。这关乎的是您的成品。我们在构建您软件时所使用的 AI 工具是另一个独立的决定。
AI 辅助、专家主导的 AI 基础设施
AI 如何协助
- 针对您的评估集对候选模型进行打分,配以工程师抽查的自动化检查和模型评分检查。
- 起草服务、自动扩缩和基础设施配置,供工程师审查。
- 分析负载测试和使用数据,以建议计算规格,包括是否根本需要 GPU。
- 审查模型和代理日志,以暴露故障、异常的工具调用和回答质量的下降。
我们的专家负责什么
- 模型选择,针对您的用例权衡回答质量、许可、规模和运行成本。
- 计算规格:只有在实测工作负载需要时才使用 GPU。
- 网络边界、访问控制,以及什么被记录、保留或允许离开环境。
- 在回归评估之后,对模型、提示和代理权限变更的发布审批。
哪些内容保留在您的边界之内
这是一个内部文档助手的示意边界;真实的界线会在部署任何内容之前与您约定。
在您的边界之内
- 提示词、上传的文档和模型输出
- 模型权重以及运行推理的服务器
- 由您的文件构建的搜索索引和嵌入
- 日志和评估数据,仅在您的政策允许的范围内保留
- 智能体对内部系统的工具调用,每个都带有限定范围的权限
仅在批准后才跨越边界
- 新模型版本,在通过许可证和评估检查后引入
- 用于外部仪表盘的汇总使用量和延迟指标
- 为解决某个问题而与软件供应商共享的经脱敏处理的示例
- 在您允许的情况下,对外部模型 API 的回退调用
保留在边界之外
- 第三方模型 API 以及运营它们的提供商
- 会记录提示词文本的托管式分析或错误跟踪
- 来自服务软件的供应商遥测数据,尽可能关闭
我们搭建和运行的内容
为您的 AI 提供托管、评估和运维
模型选择与评估
在您自己的示例上比较 Llama、Mistral 或 Qwen 等开放权重模型的回答质量、速度、许可和运行成本。
服务与扩缩
诸如 vLLM 之类的推理服务器置于内部 API 之后,配以请求排队、批处理和按真实需求调整规格的自动扩缩。
规格适配的计算资源
根据负载测试确定 CPU、GPU 或混合容量规模。较小的或量化的模型通常就能胜任;只有在工作负载需要时才添加 GPU。
访问与网络边界
私有网络、经过身份验证的端点、基于角色的访问控制以及受控的出站连接,使提示词和输出都保持在约定的边界之内。
日志记录与监控
跟踪延迟、错误、吞吐量、资源使用情况以及答案质量信号,日志记录则围绕可存储的内容进行设计。
模型、提示词与智能体更新
更新仅在通过回归评估后才发布,此外还包括已部署智能体的运营:工具权限、审批节点、运行日志和人工接管。
谁需要私有托管的 AI
您产品的 AI 不能再将提示词和文档发送给外部的模型 API,而团队中又没有人曾在生产环境中运行过模型。
- 其企业买家不允许数据触及外部模型 API 的软件供应商
- 必须将文档和模型日志保留在自有基础设施上的受监管团队
- 围绕机密文件(例如合同或人力资源记录)构建内部助手的团队
典型的私有 AI 需求
我们所界定范围的典型场景,而非客户案例研究。
将可用的功能从模型 API 迁移出来
一款文档摘要工具使用了商业 API,而某大客户的合同如今禁止这样做。我们会在它的真实输入上测试开放权重模型,在您的云账户中托管一个符合您质量标准的模型,并在同一内部接口背后进行切换。
无互联网连接的服务器
某部署场所不允许任何出站互联网连接,因此模型必须在本地服务器上运行。我们会将模型、服务软件和依赖项打包以供离线安装,并约定在携带进入之前如何检查每个新版本。
在不存储提示词的情况下进行调试
政策规定提示词可能包含个人数据且不得存储,但故障仍需调查。我们会默认记录元数据和质量信号,仅在您批准后才在有限期限内捕获经脱敏处理的样本。
从需求到运行中的模型
- 01
界定边界
我们约定使用场景、哪些数据可被处理、边界所在位置、预期负载,以及您的评估集将测试的质量标准。
- 02
评估与确定规模
在您的示例上测试候选模型,然后根据负载测试确定算力规模。只有当结果表明确实需要时,我们才会推荐 GPU。
- 03
部署与加固
以代码形式部署服务、访问控制、网络规则、日志记录和监控,然后在真实流量进入前进行负载测试和故障测试。
- 04
运营与改进
监控、容量与访问审查,以及仅在通过回归评估后才发布的模型或提示词更新。
私有 AI 托管不包含的内容
- 设计和构建 AI 功能或智能体本身属于 LLM Integration 或 Automation Agents;本服务托管、保护并运营其背后的模型。
- 训练自定义模型属于 Machine Learning Models,微调语言模型则归入 LLM Integration 的范围;我们负责托管和运营其成果。
- 运行您应用的其余部分(例如 Web 服务器、数据库和常规发布)属于 Managed DevOps & Operations;本服务涵盖模型和智能体。
- 我们会对照您的预期用途检查模型许可证,但关于许可证和数据协议的法律签署仍由您自己的法律顾问负责。
工程、QA 与运维如何衔接
融入您产品的 AI 工程
我们的 AI 工程师将托管模型接入您的产品:检索、工具调用、智能体工作流,以及供人们审核、纠正或接管的界面。
作为 QA 的评估
QA 为答案质量、工具权限和故障处理维护评估数据集与回归检查,并在每次模型或提示词变更前运行它们。
面向 AI 行为的设计
设计师塑造 AI 输出的呈现方式:加载与回退状态、来源,以及人们用来纠正或覆盖结果的控件。
上线后的运营
托管模型与运行一个普通应用不同。我们会持续审查容量、访问、更新和评估,支持时长则在支持计划中约定。
常见问题
常见问题解答
这与 私有 / 本地 AI 工程 套餐有何不同?
Private AI Infrastructure 是您成品产品的 AI 运行之处:您的用户或员工使用的模型和智能体。私有 / 本地 AI 工程 是一个开发套餐:它让我们在构建您软件时所使用的 AI 工具在约定边界内的模型上运行。另一个套餐 Claude Code / OpenAI Codex 工程 则使用商业化的编码智能体。任一套餐都可以与本服务结合使用。
我们需要 GPU 才能运行私有模型吗?
并非总是如此。较小的或量化的模型可以在 CPU 上运行,用于分类、抽取或低量的内部工具等任务。较大的模型、较长的输入以及大量同时在线的用户通常需要 GPU。我们会根据您真实使用场景的负载测试来确定算力规模,并推荐能满足您质量和速度需求的最小配置。
你们能托管哪些模型?
诸如 Llama、Mistral、Qwen 或 Gemma 等开放权重语言模型,用于搜索的嵌入和重排序模型,以及您团队训练的特定任务模型。我们会在您自己的示例上比较候选模型,并在推荐之前检查每个许可证是否适用于您的预期用途。
自托管比使用模型 API 更便宜吗?
有时如此。在低量或不均衡的使用量下,在合适条款下的托管 API 往往更便宜也更简单。当数据必须保持在您的边界之内、当您需要控制模型版本,或当稳定的使用量使专用容量变得经济时,私有托管才有意义。在您做出决定之前,我们会针对您的预期使用量对两者进行比较。


