在您实际条件下运行的视觉系统
在演示中表现良好的视觉模型,在不同的光照、相机或角度下可能会失效。我们使用 OpenCV、PyTorch 和 TensorFlow 构建用于检查、目标检测、OCR 和视频分析的计算机视觉系统,并在来自您实际环境的图像上进行训练和测试。结果会附带置信度分数,不确定的情况会交由人工确认,模型则在合理的地方运行:云端、您的服务器,或边缘和移动设备上。
AI 辅助、专家验证的视觉工程
AI 如何协助
- AI 对图像和视频帧进行预标注;在使用之前,由标注人员审核并修正这些标签。
- 编码代理起草训练、增强和部署代码,供工程师审核。
- AI 对误检和疑难案例进行聚类,使工程师能够有针对性地收集新数据。
我们的专家负责什么
- 标注准则以及每个类别或缺陷的定义
- 反映您真实相机、光照和条件的测试集
- 置信度阈值、警报规则,以及何时必须由人工确认结果
- 在精确率、召回率和边缘案例审核之后做出发布决策
从相机画面到确认结果
示意性的检测流程;阈值、审查规则以及每一步在何处运行,都会针对您的现场进行设定。
采集
由固定相机、手机或扫描仪拍摄图像,并记录时间和来源。
预处理
对画面进行裁剪、调整尺寸和光照校正;模糊或无法使用的图像会被标记,而不会参与评分。
模型推理
模型在设备、服务器或云端检测对象、对图像分类或读取文本。
置信度阈值
每个结果都带有一个分数;清晰的结果通过,临界的结果则保留待审查。
检查点: 阈值与您的团队商定
人工审核
操作人员看到带有模型标记的图像,并确认、更正或驳回该结果。
检查点: 操作人员裁定临界情况
结果已记录
最终结果、图像引用以及任何更正都会被存储,更正内容会被保留用于重新训练。
当出现故障时: 如果相机画面中断或图像变得无法使用,系统会发出警报并停止输出结果,而不是进行猜测。
谁会带着图像和视频来找我们
依赖人工查看的检查工作,例如发现缺陷、清点库存或读取标签,既缓慢又令人疲惫,而且结果会因人员或班次不同而有所差异。
- 在生产线上检查产品可见缺陷的质量团队
- 希望从现有相机获取计数或安全警报的运营经理
- 为文档或产品添加设备端扫描的移动团队
您将获得什么
从数据到部署的视觉系统
检查与分类
按内容、质量或缺陷类型对图像进行分类的模型,在您的产品上训练,并在您的真实光照和相机条件下进行测试。
目标检测与计数
面向库存、安全和制造场景,在图像和视频中进行检测与计数,并带有您可以调整的置信度阈值。
OCR 与文档 AI
从扫描文档、证件和收据中提取文本和字段,附带置信度分数,并为不明确的字段设置审核队列。
视频分析与警报
在相机流中进行事件和异常检测,将警报发送给人工确认,而不是对不确定的事件自动采取行动。
边缘与移动端部署
在边缘设备或手机上使用 TensorFlow Lite 或 Core ML 运行压缩、量化后的模型,以实现低延迟或让图像保留在现场。
标注与审核工具
带有由人工检查的 AI 预标注的标注工作流,再加上一个审核界面,员工在其中确认或修正模型结果。
视觉项目不包含什么
- 不包含提供或安装相机、照明和边缘硬件;我们会明确模型对它们的要求,并在您所安装的设备上进行测试。
- 警报会发送给您自己的操作人员;我们不会代您监看相机画面或响应事件。
- 一旦 OCR 读取了文本,对其内容进行分类或总结属于自然语言处理工作,如您两者都需要,可一并纳入范围。
- 基于传感器读数、交易或其他非图像数据的预测,是在 Machine Learning Models 之下构建的。
典型的视觉需求
我们所界定范围的典型场景,而非客户案例研究。
生产线上的视觉检测
检查员用肉眼检查零件,而何为缺陷在不同班次之间各不相同。我们会与您的质量负责人一起编写缺陷指南,从生产线自身的相机采集图像,并将临界零件转交检查员处理。
来自已安装相机的计数
某仓库团队希望从其现有相机获取托盘计数。在全面开发之前,我们会在一天中不同时段的影像上测试检测器,并报告相机位置或光照在何处会限制可靠计数的能力。
移动应用中的收据采集
某报销应用背后的团队希望在手机上读取收据。在准确度允许的情况下,我们会在设备上运行识别,提取商家、日期和总额并附带置信度分数,并请用户确认不清晰的字段。
计算机视觉项目如何推进
- 01
用例与数据审查
定义系统必须检测或判定的内容,审查来自真实条件的样本图像或视频,并商定质量目标和审核路径。
- 02
数据与标注
收集并标注图像,采用由人工检查的 AI 预标注,加入增强处理,并保留一个模型从不参与训练的测试集。
- 03
训练与优化
训练检测、分类或分割模型,衡量精确率、召回率和 mAP,并针对您的目标硬件和延迟进行优化。
- 04
部署与监控
部署到云端、边缘或移动端,配有监控、版本管理,以及由操作人员修正所驱动的再训练循环。
设计、QA 和运营如何支撑您的视觉系统
面向操作人员的界面
设计师规划检测结果、置信度和警报如何呈现给操作人员,以及他们如何在不离开工作流程的情况下确认、修正或忽略某个结果。
真实条件下的 QA
QA 根据您的相机、光照、角度和边缘案例构建测试集,按类别检查精确率和召回率,并在每次模型更新之前重新运行它们。
适配您硬件的部署
DevOps 将系统部署到云端 API、现场服务器或设备上,并配有监控和回滚。GPU 会在吞吐量需要时使用,而非默认使用。
从真实案例进行再训练
我们收集疑难案例和操作人员的修正,将它们加入训练集和测试集,并在回归检查之后发布改进的模型。
常见问题
常见问题解答
我们训练需要多少张图像?
这取决于您图像的多样程度以及您需要多少个类别。我们会先审查您的样本,然后建议需要收集和标注多少张。预训练模型和增强处理能减少所需的数量,而一个留出的测试集会显示您的数据是否足够。
模型能在移动端或边缘设备上运行吗?
可以。我们使用 TensorFlow Lite、Core ML 等工具,为手机、相机和嵌入式硬件压缩并量化模型,支持 iOS 和 Android。设备端处理可降低延迟并将图像保留在本地,但在模型大小和准确度上会有一定取舍,我们会在您的目标设备上进行测量。
你们会开发人脸识别或医学影像工具吗?
会,例如用于基于同意的身份验证等用途,并配备额外的保护措施。生物识别和医学影像在许多司法辖区都属于敏感且受监管的数据,因此在开发之前,我们会先确定同意、留存、设备端选项以及您的法律或临床审查事宜。医学影像工具用于辅助合格的临床医生:结果是为供其判断而呈现的,而非作为诊断。
我们的图像和视频在哪里处理?
由您决定:在设备上、在您自己的服务器上,或在您的云账户中。托管式视觉 API 仅在征得您同意的情况下使用。对于我们的开发工作,私有 / 本地 AI 工程 会在约定的边界内运行 AI 编码模型;Claude Code / OpenAI Codex 工程 则在约定的账户条款下使用商用编码代理。



