DevOps & クラウドインフラ

プライベートAIインフラ

プロダクトのAIモデルとエージェントを、お客様がデータを管理できる場所でホスティングします。お客様のインフラまたは合意された隔離環境にデプロイし、評価、サイジング、セキュリティ確保、監視、更新を行います。

プロダクトのAIが実際に稼働する場所

多くのAI機能は、プロンプト、ドキュメント、出力をサードパーティのモデルAPIに送信します。データポリシー、顧客との契約、またはモデルバージョンを固定する必要性から、その処理を自ら管理する境界内で行う必要があるプロダクトもあります。私たちはお客様のプロダクトのモデルとエージェントを、お客様のクラウドアカウント、オンプレミス、または合意された隔離環境でホスティングし、継続的に運用します。これはお客様の完成したプロダクトに関することです。ソフトウェアを構築する際に私たちが使用するAIツールは、別の決定事項です。

AI支援・専門家主導のAIインフラ

AIがどのように支援するか

  • 候補モデルをお客様の評価セットに照らしてスコアリングし、自動化されたチェックとモデルによる採点をエンジニアが抜き取り確認します。
  • サービング、オートスケーリング、インフラ構成をエンジニアのレビュー向けにドラフトします。
  • 負荷テストと利用データを分析し、そもそもGPUが必要かどうかを含めてコンピュートのサイジングを提案します。
  • モデルとエージェントのログをレビューし、障害、異常なツール呼び出し、回答品質の低下を浮かび上がらせます。

当社の専門家が担うこと

  • モデルの選択。回答品質、ライセンス、サイズ、稼働コストをお客様のユースケースに照らして比較検討します。
  • コンピュートのサイジング。測定されたワークロードが必要とする場合にのみGPUを使用します。
  • ネットワーク境界、アクセス制御、そして何がログに記録され、保持され、環境外への流出を許可されるか。
  • モデル、プロンプト、エージェント権限の変更に対する、回帰評価後のリリース承認。

境界の内側にとどまるもの

社内ドキュメントアシスタントの例示的な境界です。実際の線引きは、何かがデプロイされる前にあなたと合意します。

  • あなたの境界の内側

    • プロンプト、アップロードされたドキュメント、およびモデルの出力
    • モデルの重みと、推論を実行するサーバー
    • あなたのファイルから構築された検索インデックスと埋め込み
    • ログと評価データ。あなたのポリシーが許す範囲でのみ保持されます
    • 社内システムへのエージェントのツール呼び出し。それぞれにスコープ付きの権限が設定されます
  • 承認があった場合にのみ越える

    • 新しいモデルのバージョン。ライセンスと評価のチェックを経て持ち込まれます
    • 外部ダッシュボード向けの集計された使用状況とレイテンシのメトリクス
    • 問題を解決するためにソフトウェアベンダーと共有される、機密情報を伏せた例
    • 外部モデルAPIへのフォールバック呼び出し。あなたが許可する場合
  • 外側にとどまるもの

    • サードパーティのモデルAPIと、それらを運用するプロバイダー
    • プロンプトのテキストを記録することになる、ホストされた分析やエラートラッキング
    • サービングソフトウェアからのベンダーテレメトリ。可能な場合はオフにします

私たちがセットアップし、運用するもの

お客様のAIのためのホスティング、評価、運用

  • モデルの選択と評価

    Llama、Mistral、Qwen などのオープンウェイトモデルを、回答品質、速度、ライセンス、稼働コストについてお客様自身の例で比較します。

  • サービングとスケーリング

    内部APIの背後にある vLLM などの推論サーバーを、リクエストのキューイング、バッチ処理、実需要に合わせたオートスケーリングとともに提供します。

  • 適正サイズのコンピュート

    負荷テストに基づいてサイジングした、CPU、GPU、または混在のキャパシティ。多くの場合、より小型または量子化されたモデルで用が足ります。GPUは、ワークロードが必要とする場合にのみ追加されます。

  • アクセスとネットワークの境界

    プライベートネットワーク、認証済みエンドポイント、ロールベースのアクセス、および制御されたアウトバウンド接続により、プロンプトと出力は合意された境界の内側にとどまります。

  • ロギングとモニタリング

    レイテンシ、エラー、スループット、リソース使用状況、および回答品質のシグナルを追跡し、何を保存してよいかを軸にロギングを設計します。

  • モデル、プロンプト、エージェントの更新

    更新はリグレッション評価を経た後にのみリリースされます。加えて、デプロイ済みエージェントの運用として、ツールの権限、承認ポイント、実行ログ、人間による引き継ぎを行います。

プライベートホストのAIを必要とするのは誰か

あなたのプロダクトのAIが、プロンプトやドキュメントを外部のモデルAPIに送信できなくなり、チームの誰もモデルを本番環境で稼働させた経験がない。

  • エンタープライズの購買者が自社のデータを外部のモデルAPIに到達させることを許可しない、ソフトウェアベンダー
  • ドキュメントとモデルログを自社のインフラ上に保持しなければならない、規制対象のチーム
  • 契約書や人事記録といった機密ファイルの上に社内アシスタントを構築しているチーム

典型的なプライベートAIのご依頼

クライアントのケーススタディではなく、当社がスコープを定める典型的なシナリオです。

  • 稼働中の機能をモデルAPIから移行する

    あるドキュメント要約ツールが商用APIを使用していて、大口顧客の契約がそれを今や禁じている。当社はその実際の入力でオープンウェイトモデルをテストし、あなたの品質基準を満たすものをあなたのクラウドアカウントでホストし、同じ内部インターフェースの背後で切り替えます。

  • インターネット接続のないサーバー

    あるデプロイ先ではアウトバウンドのインターネットが一切許可されていないため、モデルはローカルサーバーで稼働しなければなりません。当社はモデル、サービングソフトウェア、依存関係をオフラインインストール用にパッケージ化し、新しいバージョンが持ち込まれる前にそれぞれをどう確認するかを合意します。

  • プロンプトを保存せずにデバッグする

    ポリシーでは、プロンプトに個人データが含まれる可能性があり、保存してはならないとされていますが、それでも障害は調査される必要があります。当社はデフォルトでメタデータと品質シグナルをログに記録し、あなたが承認した場合にのみ、限られた期間、機密情報を伏せたサンプルをキャプチャします。

要件から稼働するモデルまで

  1. 01

    境界を定義する

    ユースケース、どのデータを処理してよいか、境界がどこに位置するか、想定される負荷、そしてあなたの評価セットがテストする品質基準について合意します。

  2. 02

    評価してサイジングする

    候補モデルをあなたの例でテストし、その後、負荷テストに基づいてコンピュートをサイジングします。結果から必要だと示された場合にのみ、GPUをおすすめします。

  3. 03

    デプロイして堅牢化する

    サービング、アクセス制御、ネットワークルール、ロギング、モニタリングをコードとしてデプロイし、実トラフィックの前に負荷テストと障害テストを行います。

  4. 04

    運用して改善する

    モニタリング、キャパシティとアクセスのレビュー、そしてリグレッション評価に合格した後にのみリリースされるモデルやプロンプトの更新。

AIツールを使う2つの方法

AIはインフラコードと診断を支援します。設定とログを処理してよい場所を選択してください。

お決まりでないですか?スコープ設定の際に一つをおすすめします。 AIデリバリーのオプションを比較する

プライベートAIホスティングが対象としないもの

  • AI機能やエージェント自体の設計と構築はLLM IntegrationまたはAutomation Agentsです。このサービスはその背後にあるモデルをホストし、セキュア化し、運用します。
  • カスタムモデルのトレーニングはMachine Learning Modelsであり、言語モデルのファインチューニングはLLM Integrationの範囲に含まれます。当社はその結果をホストし、運用します。
  • Webサーバー、データベース、通常のリリースといった、アプリケーションの残りの部分を稼働させることはManaged DevOps & Operationsです。このサービスはモデルとエージェントを対象とします。
  • 当社は意図された用途に照らしてモデルライセンスを確認しますが、ライセンスおよびデータ契約に関する法的承認はあなた自身の法律顧問に委ねられます。

エンジニアリング、QA、運用がどうつながるか

  • あなたのプロダクトにおけるAIエンジニアリング

    当社のAIエンジニアは、ホストされたモデルをあなたのプロダクトに接続します。検索、ツール呼び出し、エージェントのワークフロー、そして人々がレビュー、修正、または引き継ぎを行う画面です。

  • QAとしての評価

    QAは、回答品質、ツールの権限、および障害処理に関する評価データセットとリグレッションチェックを維持し、モデルやプロンプトの変更ごとにそれらを実行します。

  • AIの振る舞いのためのデザイン

    デザイナーは、AIの出力がどのように表示されるかを形作ります。ローディングやフォールバックの状態、出典、そして人々が結果を修正またはオーバーライドするために使用するコントロールです。

  • ローンチ後の運用

    モデルのホスティングは、通常のアプリの運用とは異なります。当社はキャパシティ、アクセス、更新、評価を継続的にレビューし、サポート時間はサポートプランで合意します。

FAQ

よくあるご質問

これはプライベート/ローカルAIエンジニアリングパッケージと何が違うのですか?

Private AI Infrastructureは、完成したプロダクトのAIが稼働する場所です。ユーザーやスタッフが扱うモデルとエージェントです。プライベート/ローカルAIエンジニアリングは開発パッケージであり、あなたのソフトウェアを構築する際に当社が使用するAIツールを、合意された境界の内側のモデル上にとどめます。もう一つのパッケージであるClaude Code/OpenAI Codex エンジニアリングは、商用のコーディングエージェントを使用します。いずれのパッケージも、このサービスと組み合わせることができます。

プライベートモデルを稼働させるにはGPUが必要ですか?

必ずしも必要ではありません。より小型または量子化されたモデルは、分類、抽出、低ボリュームの社内ツールといったタスクにはCPUで稼働できます。より大きなモデル、長い入力、そして多数の同時ユーザーには通常GPUが必要です。当社はあなたの実際のユースケースでの負荷テストに基づいてコンピュートをサイジングし、品質と速度のニーズを満たす最小構成をおすすめします。

どのようなモデルをホストできますか?

Llama、Mistral、Qwen、Gemmaといったオープンウェイトの言語モデル、検索のための埋め込みおよびリランキングのモデル、そしてあなたのチームがトレーニングしたタスク特化型のモデルです。候補はあなた自身の例で比較し、おすすめする前に、意図された用途について各ライセンスを確認します。

セルフホスティングはモデルAPIよりも安価ですか?

場合によります。低ボリュームまたは不均一なボリュームでは、適切な条件のもとでホストされたAPIのほうが安価かつシンプルなことが多いです。プライベートホスティングは、データが境界の内側にとどまらなければならない場合、モデルのバージョンを制御する必要がある場合、または安定したボリュームによって専用キャパシティが経済的になる場合に理にかなっています。あなたがコミットする前に、両方を想定使用量と比較します。

あなたのプロダクトのAIを境界の内側にとどめる

あなたのAI機能が何を行い、データがどこにとどまらなければならないかをお聞かせください。それに合わせたモデル、ホスティング、運用計画をおすすめします。