AI 代理与自动化

计算机视觉

能够从图像和视频中检查、检测、计数和读取的视觉系统,在您的真实条件下进行测试,并部署到云端、您的服务器,或边缘和移动设备上。

在您实际条件下运行的视觉系统

在演示中表现良好的视觉模型,在不同的光照、相机或角度下可能会失效。我们使用 OpenCV、PyTorch 和 TensorFlow 构建用于检查、目标检测、OCR 和视频分析的计算机视觉系统,并在来自您实际环境的图像上进行训练和测试。结果会附带置信度分数,不确定的情况会交由人工确认,模型则在合理的地方运行:云端、您的服务器,或边缘和移动设备上。

AI 辅助、专家验证的视觉工程

AI 如何协助

  • AI 对图像和视频帧进行预标注;在使用之前,由标注人员审核并修正这些标签。
  • 编码代理起草训练、增强和部署代码,供工程师审核。
  • AI 对误检和疑难案例进行聚类,使工程师能够有针对性地收集新数据。

我们的专家负责什么

  • 标注准则以及每个类别或缺陷的定义
  • 反映您真实相机、光照和条件的测试集
  • 置信度阈值、警报规则,以及何时必须由人工确认结果
  • 在精确率、召回率和边缘案例审核之后做出发布决策

从相机画面到确认结果

示意性的检测流程;阈值、审查规则以及每一步在何处运行,都会针对您的现场进行设定。

  1. 采集

    由固定相机、手机或扫描仪拍摄图像,并记录时间和来源。

  2. 预处理

    对画面进行裁剪、调整尺寸和光照校正;模糊或无法使用的图像会被标记,而不会参与评分。

  3. 模型推理

    模型在设备、服务器或云端检测对象、对图像分类或读取文本。

  4. 置信度阈值

    每个结果都带有一个分数;清晰的结果通过,临界的结果则保留待审查。

    检查点: 阈值与您的团队商定

  5. 人工审核

    操作人员看到带有模型标记的图像,并确认、更正或驳回该结果。

    检查点: 操作人员裁定临界情况

  6. 结果已记录

    最终结果、图像引用以及任何更正都会被存储,更正内容会被保留用于重新训练。

当出现故障时: 如果相机画面中断或图像变得无法使用,系统会发出警报并停止输出结果,而不是进行猜测。

谁会带着图像和视频来找我们

依赖人工查看的检查工作,例如发现缺陷、清点库存或读取标签,既缓慢又令人疲惫,而且结果会因人员或班次不同而有所差异。

  • 在生产线上检查产品可见缺陷的质量团队
  • 希望从现有相机获取计数或安全警报的运营经理
  • 为文档或产品添加设备端扫描的移动团队

您将获得什么

从数据到部署的视觉系统

  • 检查与分类

    按内容、质量或缺陷类型对图像进行分类的模型,在您的产品上训练,并在您的真实光照和相机条件下进行测试。

  • 目标检测与计数

    面向库存、安全和制造场景,在图像和视频中进行检测与计数,并带有您可以调整的置信度阈值。

  • OCR 与文档 AI

    从扫描文档、证件和收据中提取文本和字段,附带置信度分数,并为不明确的字段设置审核队列。

  • 视频分析与警报

    在相机流中进行事件和异常检测,将警报发送给人工确认,而不是对不确定的事件自动采取行动。

  • 边缘与移动端部署

    在边缘设备或手机上使用 TensorFlow Lite 或 Core ML 运行压缩、量化后的模型,以实现低延迟或让图像保留在现场。

  • 标注与审核工具

    带有由人工检查的 AI 预标注的标注工作流,再加上一个审核界面,员工在其中确认或修正模型结果。

视觉项目不包含什么

  • 不包含提供或安装相机、照明和边缘硬件;我们会明确模型对它们的要求,并在您所安装的设备上进行测试。
  • 警报会发送给您自己的操作人员;我们不会代您监看相机画面或响应事件。
  • 一旦 OCR 读取了文本,对其内容进行分类或总结属于自然语言处理工作,如您两者都需要,可一并纳入范围。
  • 基于传感器读数、交易或其他非图像数据的预测,是在 Machine Learning Models 之下构建的。

典型的视觉需求

我们所界定范围的典型场景,而非客户案例研究。

  • 生产线上的视觉检测

    检查员用肉眼检查零件,而何为缺陷在不同班次之间各不相同。我们会与您的质量负责人一起编写缺陷指南,从生产线自身的相机采集图像,并将临界零件转交检查员处理。

  • 来自已安装相机的计数

    某仓库团队希望从其现有相机获取托盘计数。在全面开发之前,我们会在一天中不同时段的影像上测试检测器,并报告相机位置或光照在何处会限制可靠计数的能力。

  • 移动应用中的收据采集

    某报销应用背后的团队希望在手机上读取收据。在准确度允许的情况下,我们会在设备上运行识别,提取商家、日期和总额并附带置信度分数,并请用户确认不清晰的字段。

计算机视觉项目如何推进

  1. 01

    用例与数据审查

    定义系统必须检测或判定的内容,审查来自真实条件的样本图像或视频,并商定质量目标和审核路径。

  2. 02

    数据与标注

    收集并标注图像,采用由人工检查的 AI 预标注,加入增强处理,并保留一个模型从不参与训练的测试集。

  3. 03

    训练与优化

    训练检测、分类或分割模型,衡量精确率、召回率和 mAP,并针对您的目标硬件和延迟进行优化。

  4. 04

    部署与监控

    部署到云端、边缘或移动端,配有监控、版本管理,以及由操作人员修正所驱动的再训练循环。

使用 AI 工具的两种方式

选择在我们构建期间 AI 编码代理可以在何处处理您的代码。无论哪种方式,工程标准都是一致的。

不确定?我们会在界定范围时为您推荐一个。 比较 AI 交付选项

设计、QA 和运营如何支撑您的视觉系统

  • 面向操作人员的界面

    设计师规划检测结果、置信度和警报如何呈现给操作人员,以及他们如何在不离开工作流程的情况下确认、修正或忽略某个结果。

  • 真实条件下的 QA

    QA 根据您的相机、光照、角度和边缘案例构建测试集,按类别检查精确率和召回率,并在每次模型更新之前重新运行它们。

  • 适配您硬件的部署

    DevOps 将系统部署到云端 API、现场服务器或设备上,并配有监控和回滚。GPU 会在吞吐量需要时使用,而非默认使用。

  • 从真实案例进行再训练

    我们收集疑难案例和操作人员的修正,将它们加入训练集和测试集,并在回归检查之后发布改进的模型。

常见问题

常见问题解答

我们训练需要多少张图像?

这取决于您图像的多样程度以及您需要多少个类别。我们会先审查您的样本,然后建议需要收集和标注多少张。预训练模型和增强处理能减少所需的数量,而一个留出的测试集会显示您的数据是否足够。

模型能在移动端或边缘设备上运行吗?

可以。我们使用 TensorFlow Lite、Core ML 等工具,为手机、相机和嵌入式硬件压缩并量化模型,支持 iOS 和 Android。设备端处理可降低延迟并将图像保留在本地,但在模型大小和准确度上会有一定取舍,我们会在您的目标设备上进行测量。

你们会开发人脸识别或医学影像工具吗?

会,例如用于基于同意的身份验证等用途,并配备额外的保护措施。生物识别和医学影像在许多司法辖区都属于敏感且受监管的数据,因此在开发之前,我们会先确定同意、留存、设备端选项以及您的法律或临床审查事宜。医学影像工具用于辅助合格的临床医生:结果是为供其判断而呈现的,而非作为诊断。

我们的图像和视频在哪里处理?

由您决定:在设备上、在您自己的服务器上,或在您的云账户中。托管式视觉 API 仅在征得您同意的情况下使用。对于我们的开发工作,私有 / 本地 AI 工程 会在约定的边界内运行 AI 编码模型;Claude Code / OpenAI Codex 工程 则在约定的账户条款下使用商用编码代理。

让您的图像和视频发挥作用

请分享来自真实环境的样本图像或影像。在任何开发开始之前,我们会评估可行性、数据需求和部署选项。