AI 代理与自动化

机器学习模型

定制机器学习模型将您的数据转化为预测、评分和推荐,根据清晰的基准进行验证,并在投入生产后受到监控。

与您所做决策紧密相关的模型

当更好的预测能改变一项决策时——该备什么货、审查哪些交易、哪些客户需要关注、推荐什么——机器学习就值得构建。我们使用 scikit-learn、PyTorch 或 TensorFlow 开发定制模型,从数据准备到生产环境,并将其与简单的基准进行对比测试,让您了解该模型带来了什么增益。您将获得一个在您系统内运行、能解释其预测,并随着您数据变化而受到监控的模型。

AI 辅助、专家主导的 ML 工程

AI 如何协助

  • AI 协助数据剖析、起草清洗脚本并建议特征,由数据科学家进行验证。
  • 编码代理起草训练管道、评估代码和服务 API,供工程师审查。
  • AI 按细分汇总实验结果和错误模式,供工程师审查。

我们的专家负责什么

  • 问题构建、成功指标,以及模型必须超越的基准
  • 特征选择、泄漏检查和验证设计
  • 公平性审查,以及哪些预测在采取行动前需要有人工审查
  • 将每个模型版本提升至生产环境

模型从数据到生产的路径

预测模型的典型生命周期;关卡和阈值会按项目与你的团队商定。

  1. 数据审计

    剖析模型将从中学习的记录:覆盖范围、标签质量,以及会泄漏结果的字段。

  2. 基线

    设定需要超越的简单方法,例如上一周期的数据或你当前的规则。

  3. 训练

    在较早的历史数据上训练候选模型,保留最近的一段时间用于测试它们。

  4. 离线评估

    候选模型在留出数据上与基线进行评分,既看整体,也看每个重要细分群体。

    检查点: 仅在超越基线时才继续推进

  5. 影子或有限度上线

    模型在后台对实时案例进行评分,或先针对一小部分群体,同时当前的决策照常进行。

    检查点: 你批准更大范围的使用

  6. 漂移监控

    输入漂移和预测质量会对照商定的阈值进行跟踪,并在应考虑再训练时发出警报。

当出现故障时: 如果某个候选模型未能超越基线,或影子结果与离线测试不同,它就不会被提升上线,当前的方法继续运行。

谁会带着预测问题来找我们

规划和审查决策仍然依赖电子表格和固定规则,而本可以让这些决策更精准的销售、交易或传感器历史数据却闲置在你的数据库中。

  • 根据过往销售预测需求的采购和规划团队
  • 决定优先审查哪些交易或理赔的风险和欺诈分析师
  • 拥有传感器数据、可借此提前标记故障设备的维护团队

您将获得什么

从原始数据到受监控的模型

  • 预测和预报模型

    销售预测、需求预测和风险评分,使用诸如梯度提升、Prophet 或 LSTM 网络等方法,根据在您数据上的结果进行选择。

  • 分类和异常检测

    客户细分、欺诈和垃圾信息检测,以及对交易、传感器数据或用户行为中的离群值检测,并为被标记的案例配备审查队列。

  • 推荐引擎

    针对产品和内容的协同、基于内容或混合式推荐,在发布前与简单的基准进行对比测试。

  • 评估报告和模型卡

    留出集和回测结果、按细分的错误、使用 SHAP 或特征重要性的解释,以及一张说明已知局限的模型卡。

  • 生产 API 或批处理作业

    模型以 REST API 或计划批处理作业的形式提供,与您的系统集成,并具备日志记录和版本化发布。

  • MLOps 和漂移监控

    漂移和性能监控、重训练管道、模型版本管理和 A/B 测试,以便在您数据变化时跟踪质量。

模型工作不包括什么

  • 文本、文档和图像由自然语言处理和计算机视觉处理;本服务对订单、交易和传感器读数等结构化记录进行建模。
  • 生成式文本,例如从文档中得出的摘要或答案,属于 LLM Integration;此处的模型根据你的历史数据预测数字、分数或类别。
  • 不包括全公司范围的数据仓库建设:我们准备模型所需的数据,而如果历史数据从未被记录,那么收集数据是第一步。
  • 用于信贷、保险或健康决策的模型的监管批准仍由你的合规团队负责;我们提供模型卡和评估证据供他们审查。

典型的建模需求

我们所界定范围的典型场景,而非客户案例研究。

  • 由电子表格设定的库存订单

    采购人员根据去年的数据加上判断来设定订货量。我们会针对每个产品组,用一个预测模型与该方法进行对比测试,并在他们的规划工具中展示建议数量,由采购人员接受、调整或拒绝。

  • 被标记的交易多于分析师能够核查的数量

    固定的欺诈规则标记出的交易多于团队能够审查的数量。我们会基于过往审查决策训练一个评分模型,按风险对队列进行排序,并把每个案例的最终判断权留给分析师。

  • 一个质量未知的继承而来的模型

    一位前员工留下的流失预测模型仍在运行,但近来无人衡量它。我们会在近期数据上重建对它的评估,将其与一个简单基线进行比较,并加入漂移监控,以便你决定是重新训练它还是让它退役。

我们如何开发 ML 模型

  1. 01

    问题定义

    明确模型所支持的决策、成功衡量标准、需要超越的基线,以及机器学习是否根本就是合适的工具。

  2. 02

    数据准备

    审计、清洗和标注数据,构建特征,并检查数据泄漏和偏差。数据缺口会在训练开始前报告。

  3. 03

    训练与验证

    训练并比较候选模型,在留出数据上并按细分群体验证它们,并将结果和局限记录在模型卡中。

  4. 04

    部署与监控

    以 API 或批处理作业形式部署,将其与你的系统集成,并监控漂移和性能,按商定的计划进行再训练。

使用 AI 工具的两种方式

选择在我们构建期间 AI 编码代理可以在何处处理您的代码。无论哪种方式,工程标准都是一致的。

不确定?我们会在界定范围时为您推荐一个。 比较 AI 交付选项

设计、QA 和运维如何支持您的模型

  • 人们可以据以行动的预测

    设计师塑造评分、置信度和原因在您工具中的呈现方式,以及员工如何覆盖某个预测,从而让模型支持决策而非隐藏决策。

  • 整个管道的 QA

    QA 检查数据验证、边缘情况、按细分的错误和公平性,并在重训练后的模型被提升之前运行回归测试。

  • 按模型规模配置的基础设施

    DevOps 负责运行服务、计划作业、监控和回滚。许多模型在标准基础设施上运行良好;只有在训练或推理需要时才会添加 GPU。

  • 有监督的重训练

    我们监控漂移,在新数据上重训练,并在每个新版本替换当前版本之前将二者进行对比,提升时须经您批准。

常见问题

常见问题解答

我们需要多少数据?

这取决于问题本身、你的数据有多嘈杂,以及你要预测多少种结果。我们会在问题定义阶段评估你的数据,并告诉你数据是否足够、增加标注是否有帮助,或者更简单的基于规则的方法是否更适合你。

你们如何检查模型的偏差和公平性?

我们审计训练数据,比较相关细分群体之间的错误率,并在模型卡中记录已知的局限。像 SHAP 这样的可解释性工具会展示哪些因素驱动了预测。在决策对人有重大影响的场景,我们会为人工审查而非自动执行进行设计。

当我们的数据发生变化时会怎样?

监控会跟踪输入漂移和预测质量。当性能低于你批准的阈值时,再训练流水线会产出一个新版本,在任何人将其提升上线之前,会将它与当前模型进行比较。

我们的训练数据可以留在我们自己的环境中吗?

可以。训练和服务可以在你的云账户中或在你所控制的基础设施上运行,因此数据可以留在其中。对于我们的开发工作,私有 / 本地 AI 工程 会在商定的边界内运行 AI 编码模型,而 Claude Code / OpenAI Codex 工程 则在商定的账户条款下使用商用编码代理。

把你的数据变成一个可用的模型

带上你想改进的决策和一份数据样本。我们会评估可行性、需要超越的基线,以及在生产中运行所需的条件。