DevOps 与云基础设施

云基础设施

基础设施按你的产品当前所需进行规模化,并留有增长空间。我们从一开始就设计它、以代码形式定义它,并规划安全、备份和运行成本。

规模恰当的云,以代码定义

云环境常常靠人手逐步堆积:没人能说清楚的资源、过宽的权限、未经测试的备份,以及一张不断上涨的账单。我们在 AWS、Google Cloud、Azure、Vercel 或 DigitalOcean 上设计契合你工作负载的基础设施,以代码形式定义它,并记录它如何运行。对一个产品而言,这意味着一个托管平台;对另一个产品而言,则是私有网络和若干服务。AI 帮助我们盘点资源并起草配置。工程师掌管架构、安全模型和每一次线上变更。

AI 辅助、专家主导的云工程

AI 如何协助

  • 通过你提供的只读访问或导出内容,盘点现有资源、依赖项和支出。
  • 起草 Terraform 或 Pulumi 模块以及环境配置,供工程师评审。
  • 检查配置中的高风险设置,例如公开存储、开放端口或过宽的角色。
  • 对比架构方案,并根据你的预期用量起草成本估算。

我们的专家负责什么

  • 架构选择:服务商、区域、托管服务,以及在何处采用更简单的方案就足够了。
  • 安全模型:网络边界、身份与访问、加密和密钥。
  • 备份和恢复目标,与你共同商定,并通过恢复测试加以验证。
  • 对线上环境的每一次变更都需要批准。代理不会获得不受限制的访问权限。

一个典型环境,逐层解析

针对某个 Web 产品的示意性布局;服务和服务商取决于你的工作负载、团队和预算。

  • 网络与访问

    • 为生产、预发和共享工具分设的账户或项目
    • 为数据和服务设置私有子网;只有负载均衡器面向互联网
    • 单点登录和最小权限角色,不设共享管理员登录
    • 密钥存放在托管保险库中,不进入代码和镜像
  • 计算与数据

    • 托管平台或容器服务;只有在合理必要时才用 Kubernetes
    • 具备静态加密和时间点恢复的托管数据库
    • 用于文件的私有对象存储,配有生命周期和保留规则
    • 在公开页面和静态资源前端部署 CDN 和缓存
  • 可观测性与恢复

    • 集中式日志和指标,告警发送给指定负责人
    • 每个账户中控制台和 API 变更的审计轨迹
    • 定期将恢复测试执行到隔离环境中
    • 按环境和服务设置的预算和支出告警

您将获得什么

你能够理解并重建的基础设施

  • 架构与环境

    针对 AWS、Google Cloud、Azure 或某个托管平台上的计算、数据、网络和环境,记录在案的决策,并写明其中的取舍。

  • 基础设施即代码

    将 Terraform 或 Pulumi 置于版本控制中,使预演环境与生产环境一致,且每次变更都经过评审、规划且可追溯。

  • 安全与访问基线

    私有网络、最小权限角色、传输中和静态加密,以及托管密钥,从一开始就设置好,而不是事后再添加。

  • 伸缩与性能

    基于预期和实测负载的自动伸缩、负载均衡、缓存和 CDN 设置,并在合适处采用无服务器方案。

  • 备份与灾难恢复

    自动化备份、记录在案的恢复步骤和恢复测试,恢复目标与你共同商定,而不是凭空假设。

  • 成本可见性

    资源标记、预算和支出告警,加上定期评审,以调整资源规模并移除你不再使用的部分。

谁会把云工作交给我们

产品已经超出了最初的配置:一个共享账户、生产资源与测试资源混在一起,而且没人确定在必要时环境能否被重建。

  • 应用已经超出单台服务器或基础托管方案承载能力的团队
  • 需要就网络、访问和备份回答客户安全问卷的 SaaS 团队
  • 继承了由前团队手工搭建的云账户的 CTO

典型的云需求

我们所界定范围的典型场景,而非客户案例研究。

  • 必须留在所在区域内的客户数据

    一份新的客户合同要求其数据必须留在特定区域。我们会梳理每一个存储或复制该数据的服务,包括日志和备份,并从同一套基础设施代码搭建一个区域化环境。

  • 用生产凭据就能触及的备份

    备份与生产位于同一账户,因此一个泄露的管理员密钥就可能将两者都删除。我们会将它们复制到一个单独的、锁定的账户中,并启用删除保护,然后从该副本测试一次恢复。

  • 一次性涌来的发布

    一次预定的公告将带来突发的流量浪潮。我们会审查自动扩缩设置、服务商配额和数据库连接上限,提高任何会耗尽的额度,并商定一个兜底方案,例如等候页面。

一次云工程合作如何进行

  1. 01

    评估

    我们梳理当前的资源、流量、数据、合规要求和成本,并商定基础设施现在和未来必须支持什么。

  2. 02

    设计架构

    图表、服务选择、安全模型、恢复目标和成本估算,在任何东西构建之前先与你一起评审。

  3. 03

    构建与迁移

    基础设施即代码先应用到预演环境,经过负载和恢复测试,然后按规划分阶段迁移到生产环境,并备有回滚路径。

  4. 04

    运维与优化

    附带文档和培训的交接,或在托管运维计划下进行持续监控、补丁更新和成本评审。

使用 AI 工具的两种方式

AI 协助处理基础设施代码和诊断。选择它可以在何处处理您的配置和日志。

不确定?我们会在界定范围时为您推荐一个。 比较 AI 交付选项

云工作不涵盖的内容

  • 构建、测试和发布流水线归类为 DevOps 和 CI/CD;本服务设计并构建这些流水线部署进去的环境。
  • 为你产品的 AI 功能托管语言模型,包括任何 GPU 容量,属于私有 AI 基础设施,其规模依据负载测试确定而非凭假设。
  • 在真实规模下进行负载测试属于性能测试;我们配置容量和扩缩能力,而该服务衡量它们的承受表现。
  • 我们搭建并记录你的合规要求所需的控制措施;正式审计由你指定的独立审计方执行。

工程、QA 与运维如何衔接

  • 与你的开发者一起构建

    环境、预览部署和配置与你的应用构建和发布方式相匹配,这样基础设施就不会拖慢团队。

  • 在上线前经过测试

    QA 针对一个用与生产环境相同代码构建的预演环境运行负载和恢复测试,从而及早检验容量和故障转移。

  • 通过流水线进行变更

    基础设施变更遵循与代码相同的路径:经过评审、在预演环境中测试,并以记录在案的计划应用,而不是在生产环境中手动修改。

  • 上线后托管

    我们可以在托管运维计划下持续进行监控、补丁更新、恢复测试和成本评审,支持时长和响应承诺与你共同商定。

常见问题

常见问题解答

我们应该选择哪家云服务商?

这取决于你的产品、团队和现有合同。AWS、Google Cloud 和 Azure 适合使用众多托管服务的复杂工作负载。Vercel 或 Netlify 适合以前端为主的 Web 应用。DigitalOcean 及类似服务商让更简单的产品易于运行。我们会对照你的需求比较各种方案,推荐一个,并写明其中的取舍。

我们的云基础设施要花多少钱?

这取决于流量、数据量、冗余以及你选择的服务。我们在架构设计期间估算运行成本,设置预算和告警,并定期评审支出,这样你就能看到钱花在哪里、以及什么值得调整。

你们能把我们从另一家服务商或我们自己的服务器迁移过来吗?

可以。我们盘点当前运行的内容,在目标环境中以代码形式重建它,通过验证检查迁移数据,并分阶段切换流量。在新环境于生产环境中得到验证之前,旧环境会作为回滚路径保持可用。

AI 工具会访问我们的云账户吗?

不会有不受限制的访问权限。AI 工具基于只读导出或你批准的范围化访问来工作,工程师则通过经过审查的代码应用实时变更。如果配置和上下文必须留在你的边界内,私有 / 本地 AI 工程会在你控制的基础设施上使用模型。Claude Code / OpenAI Codex 工程则在约定的账户和数据保留设置下使用商用代理。

相关阅读

构建契合你需求的云基础设施

告诉我们你运行着什么以及痛点在哪里。我们可以作为独立项目、在开发合作中,或作为持续的托管运维来开展工作。