AIエージェント&自動化

コンピュータビジョン

画像や動画から検査、検出、カウント、読み取りを行うビジョンシステム。貴社の実際の条件下でテストし、クラウド、貴社のサーバー、またはエッジ・モバイルデバイスへ展開します。

貴社の条件下で機能するビジョンシステム

デモでは良好に動作するビジョンモデルも、照明、カメラ、角度が異なると失敗することがあります。私たちは、OpenCV、PyTorch、TensorFlowを用いて、検査、物体検出、OCR、動画解析のためのコンピュータビジョンシステムを構築し、貴社の実環境の画像で学習・テストします。結果には確信度スコアが付き、不確かなケースは人が確認し、モデルは理にかなった場所、すなわちクラウド、貴社のサーバー、またはエッジ・モバイルデバイスで動作します。

AI支援、専門家検証のビジョンエンジニアリング

AIがどのように支援するか

  • AIが画像や動画フレームに事前ラベルを付け、アノテーターが使用前にラベルをレビューして修正します。
  • コーディングエージェントが学習、拡張、展開のコードを作成し、エンジニアがレビューします。
  • AIが誤検出や難しいケースをクラスタリングするため、エンジニアは新しいデータ収集を的確に狙えます。

当社の専門家が担うこと

  • アノテーションのガイドラインと、各クラスまたは欠陥の定義
  • 貴社の実際のカメラ、照明、条件を反映したテストセット
  • 確信度のしきい値、アラートルール、そして人が結果を確認すべきタイミング
  • 適合率、再現率、エッジケースのレビューを経てのリリース判断

カメラのフレームから確定結果まで

例示的な検査フローです。しきい値、レビュールール、各ステップの実行場所は、お客様のサイト向けに設定されます。

  1. キャプチャ

    固定カメラ、電話機、またはスキャナーが画像を撮影し、時刻とソースが記録されます。

  2. 前処理

    フレームはクロップ、リサイズされ、照明が補正されます。ぼやけた画像や使用できない画像はフラグが立てられ、スコア付けされません。

  3. モデル推論

    モデルがオブジェクトを検出し、画像を分類し、またはテキストを読み取ります。デバイス、サーバー、またはクラウド上で実行されます。

  4. 信頼度しきい値

    各結果にはスコアが付きます。明確な結果は通過し、判断が難しいものはレビューのために保留されます。

    チェックポイント: お客様のチームと合意したしきい値

  5. 人によるレビュー

    オペレーターはモデルのマーキング付きの画像を確認し、結果を承認、修正、または却下します。

    チェックポイント: オペレーターが判断が難しいケースを決定する

  6. 結果の記録

    最終結果、画像の参照、修正はすべて保存され、修正は再学習のために保持されます。

何かが失敗したとき: カメラ映像が途切れたり、画像が使用できなくなったりした場合、システムは推測するのではなく、アラートを発し、結果の発行を停止します。

画像や動画を持ち込むのはどのような方々か

欠陥の発見、在庫のカウント、ラベルの読み取りなど、人の目に頼るチェックは、遅く疲れを伴い、人やシフトごとに結果がばらつきます。

  • 生産ラインで製品の目に見える欠陥を検査する品質チーム
  • 既存のカメラからカウントや安全アラートを得たいオペレーションマネージャー
  • ドキュメントや製品のオンデバイススキャンを追加するモバイルチーム

お客様が受け取るもの

データから展開までのビジョンシステム

  • 検査と分類

    画像を内容、品質、または欠陥の種類で仕分けるモデル。貴社の製品で学習し、貴社の実際の照明・カメラ条件下でテストします。

  • 物体検出とカウント

    在庫、安全、製造のための画像・動画での検出とカウント。確信度のしきい値は調整可能です。

  • OCRとドキュメントAI

    スキャンされた文書、身分証、領収書からのテキストおよびフィールド抽出。確信度スコアと、不明確なフィールドのためのレビューキューを備えています。

  • 動画解析とアラート

    カメラストリームでのイベントおよび異常検出。不確かなイベントに対する自動アクションではなく、人が確認するためのアラートを送ります。

  • エッジ・モバイルへの展開

    TensorFlow LiteまたはCore MLを用いて、エッジデバイスやスマートフォン上で圧縮・量子化したモデルを動作させます。低遅延や、現場に留めるべき画像に対応します。

  • アノテーションとレビューのツール

    AIによる事前ラベルを人がチェックするラベル付けワークフローに加え、スタッフがモデルの結果を確認または修正するレビュー画面を備えています。

ビジョンプロジェクトに含まれないもの

  • カメラ、照明、エッジハードウェアの供給や設置は含まれません。当社はモデルがそれらに求める要件を指定し、お客様が設置したもので検証します。
  • アラートはお客様自身のオペレーターに送られます。当社がお客様に代わってカメラ映像を監視したり、イベントに対応したりすることはありません。
  • OCR がテキストを読み取った後、その内容を分類したり要約したりすることは自然言語処理の作業であり、両方が必要な場合は併せてスコープを設定します。
  • センサーの読み取り値、取引、その他の非画像データからの予測は、Machine Learning Models のもとで構築されます。

典型的なビジョンの要望

クライアントのケーススタディではなく、当社がスコープを定める典型的なシナリオです。

  • 生産ラインでの外観検査

    検査員が部品を目視で確認しますが、何を欠陥とみなすかはシフト間で異なります。当社はお客様の品質責任者とともに欠陥ガイドを作成し、ライン自体のカメラから画像を収集し、判断が難しい部品を検査員に回します。

  • すでに設置済みのカメラからのカウント

    倉庫チームが既存のカメラからパレット数を得たいと考えています。本格的なビルドの前に、当社は異なる時間帯の映像で検出器をテストし、カメラの位置や照明が確実にカウントできる範囲をどこで制限するかを報告します。

  • モバイルアプリでのレシート取り込み

    経費アプリを開発するチームが、電話機上でレシートを読み取らせたいと考えています。当社は精度が許す範囲でデバイス上で認識を実行し、加盟店、日付、合計を信頼度スコア付きで抽出し、不明瞭なフィールドについてはユーザーに確認を求めます。

コンピュータビジョンプロジェクトの進め方

  1. 01

    ユースケースとデータの監査

    システムが何を検出または判断すべきかを定義し、実際の条件のサンプル画像や動画をレビューし、品質目標とレビュー経路について合意します。

  2. 02

    データとアノテーション

    AIによる事前ラベルを人がチェックしながら画像を収集・アノテーションし、拡張を加え、モデルが決して学習しないテストセットを確保します。

  3. 03

    学習と最適化

    検出、分類、またはセグメンテーションのモデルを学習し、適合率、再現率、mAPを測定し、貴社の対象ハードウェアと遅延に合わせて最適化します。

  4. 04

    展開と監視

    クラウド、エッジ、またはモバイルへ、監視、バージョン管理、そしてオペレーターの修正で駆動される再学習ループとともに展開します。

AIツールを使う2つの方法

私たちが構築する間、AIコーディングエージェントがお客様のコードを処理してよい場所を選択してください。エンジニアリング基準はどちらでも同じです。

お決まりでないですか?スコープ設定の際に一つをおすすめします。 AIデリバリーのオプションを比較する

デザイン、QA、運用が貴社のビジョンシステムをどう支えるか

  • オペレーター向けのインターフェース

    デザイナーは、検出、確信度、アラートがオペレーターにどう表示されるか、そしてオペレーターがワークフローを離れることなく結果を確認、修正、または却下する方法を設計します。

  • 実際の条件下でのQA

    QAは貴社のカメラ、照明、角度、エッジケースからテストセットを作成し、クラスごとに適合率と再現率をチェックし、モデルの更新ごとに再実行します。

  • 貴社のハードウェアに合った展開

    DevOpsはクラウドAPI、オンサイトサーバー、またはデバイスへ、監視とロールバックを備えて展開します。GPUはスループットが必要な箇所で使用し、既定では使用しません。

  • 実際のケースからの再学習

    私たちは難しいケースとオペレーターの修正を収集し、学習セットとテストセットに追加し、回帰チェックを経て改善されたモデルをリリースします。

FAQ

よくあるご質問

学習には何枚の画像が必要ですか?

それは画像のばらつきの程度と、必要なクラス数によって異なります。まず貴社のサンプルをレビューし、その上で収集・ラベル付けすべき枚数を推奨します。事前学習済みモデルと拡張により必要な量は減り、確保したテストセットが十分かどうかを示してくれます。

モデルはモバイルやエッジデバイスで動作しますか?

はい。TensorFlow Lite や Core ML などのツールを用いて、iOS および Android 向けに、スマートフォン、カメラ、組み込みハードウェア向けにモデルを圧縮・量子化します。オンデバイス処理はレイテンシを低減し、画像をローカルに保ちますが、モデルサイズと精度に一定のトレードオフが生じるため、お客様の対象デバイスで測定します。

顔認識や医用画像ツールを構築していますか?

はい、同意に基づく本人確認などの用途について、追加の保護措置を講じて対応します。生体情報や医用画像は機微であり、多くの法域で規制されているため、同意、保持、オンデバイスの選択肢、そしてお客様の法務または臨床上のレビューを、構築前に確定します。医用画像ツールは資格を持つ臨床医を支援するものです。結果は診断としてではなく、臨床医の判断のために提示されます。

当社の画像や動画はどこで処理されますか?

お客様が決定する場所で処理します。デバイス上、お客様自身のサーバー上、またはお客様のクラウドアカウント内です。ホスト型のビジョン API は、お客様の合意がある場合にのみ使用します。当社の開発作業については、プライベート/ローカルAIエンジニアリング が合意された境界内で AI コーディングモデルを実行し、Claude Code/OpenAI Codex エンジニアリング が合意されたアカウント条件のもとで商用コーディングエージェントを使用します。

画像と動画を活用しましょう

実際の条件で撮影したサンプル画像や映像を共有してください。ビルドを開始する前に、実現可能性、データ要件、デプロイの選択肢を評価します。