DevOps & クラウドインフラ

マネージドDevOpsおよび運用

ローンチ後のソフトウェアのための、単なる引き渡しではなく責任を持つチーム。私たちはあなたと合意したサポートプランのもとで、リリース、監視、インシデント、パッチ適用、バックアップテスト、レポート作成を運用します。

ローンチは運用の始まり

稼働中のソフトウェアには継続的なケアが必要です。依存関係は古くなり、証明書は期限切れになり、トラフィックは変化し、バックアップは復元できて初めて意味を持ちます。マネージドDevOps & 運用は、その作業に責任を持つオーナーを与えます。私たちは管理されたリリースを実行し、監視とアラートを見守り、合意された時間内にインシデントに対応し、パッチを適用し、復旧をテストし、アクセスをレビューし、パフォーマンスとコストについて報告します。私たちが構築したソフトウェアにも、私たちが構築していないアプリケーションにも適しており、AIツールで構築されたアプリも含みます。すべてのエンゲージメントはオンボーディングレビューから始まります。

AI支援の運用、人が承認する変更

AIがどのように支援するか

  • エンジニアが調査する間、アラート、ログ、最近のデプロイを相関させて、考えられる原因を提案します。
  • パッチレベル、依存関係、証明書の期限、バックアップ結果、構成ドリフトに関する定期チェック。
  • 依存関係のリリースノートを要約し、更新がスケジュールされる前に破壊的変更を指摘します。
  • 監視データからインシデントのタイムライン、変更メモ、定期レポートを下書きします。

当社の専門家が担うこと

  • インシデントの判断:重大度、ロールバックか修正か、そしてあなたのチームとユーザーに何を伝えるか。
  • すべての本番変更の承認。エージェントは本番環境への無制限なアクセスを得ることはありません。
  • 復旧テスト:エンジニアが復元を実行し、データとサービスが実際に戻ることを確認します。
  • サポートプラン:対象時間、対応のコミットメント、除外事項を、事前にあなたと合意します。

アラートが発報されたときに起こること

対象時間内における典型的なインシデントの流れ。重大度レベル、連絡先、応答コミットメントはお客様のサポートプランに基づきます。

  1. アラート

    監視が、エラー、ページの遅延、ジョブの失敗など、ユーザーが気づくような症状を検知します。

  2. トリアージ

    エンジニアが、何がどの範囲で影響を受けているかを確認し、AIが直近の変更や関連するエラーを要約します。

    チェックポイント: エンジニアが重大度を設定します

  3. 緩和

    まず被害を止めます。原因が判明する前に、ロールバック、機能フラグの無効化、またはキャパシティの追加を行います。

    チェックポイント: エンジニアがすべての本番作業を承認します

  4. コミュニケーション

    指名されたご担当者に、影響、現在の対応、次の更新がいつかについてお知らせします。

    チェックポイント: ユーザー向けの文言はお客様と合意します

  5. 修正

    根本原因をコードまたは構成で修正し、ステージングでテストし、パイプラインを通じてリリースします。

  6. インシデント後レビュー

    原因、タイムライン、監視が見逃した点について、責任追及を伴わない記録を作成します。フォローアップは改善リストに加わります。

    チェックポイント: フォローアップの優先順位はお客様と合意します

何かが失敗したとき: 緩和策が持続しない場合や、原因がサードパーティ側にある場合は、お客様のサポートプランの定めに従ってエスカレーションし、更新を継続します。

私たちが管理するもの

継続的な責任であり、一度きりの引き渡しではありません

  • 管理されたリリース

    レビュー済みパイプラインを通じた計画的なデプロイ。リリースノート、適する場合は段階的ロールアウト、そして各リリース前に確認されるロールバックパスを伴います。

  • 監視とアラート

    可用性、エラー、パフォーマンス、リソースの継続的な自動監視。アラートはサポートプランに記載された担当者にルーティングされます。

  • インシデント対応

    対象時間内のトリアージ、修正またはロールバック、明確な最新情報の共有。その後、原因とフォローアップ作業についての書面レビューを行います。

  • パッチ適用と依存関係の更新

    オペレーティングシステム、ランタイム、ライブラリ、証明書の更新をスケジュールに従って行い、本番前にテストし、緊急のセキュリティ修正を優先します。

  • バックアップと復旧テスト

    バックアップを定期的に検証し、復元をリハーサルします。これにより、必要になる前に復旧手順が実際に証明されます。

  • レビューと定期レポート

    アクセスレビュー、パフォーマンスとコストの可視化、そしてインシデント、変更、リスク、推奨される次のステップに関する定期レポート。

運用を任せてくださるのは

運用は常に機能開発に後回しにされます。アラートは読まれず、更新は暇な週を待ち、障害が起きると今もアクセス権を持つ人を探す羽目になります。

  • ローンチを手がけた代理店や当初の開発者がすでに離れてしまった創業者の方々
  • DevOpsの専門家がおらず、開発者自身が障害に対応しているプロダクトチーム
  • 収益に不可欠でありながら誰も能動的に保守していないWebアプリに依存している企業

よくある運用のご依頼

クライアントのケーススタディではなく、当社がスコープを定める典型的なシナリオです。

  • 唯一のアクセス権を持つ契約者が去る

    サーバーを運用していた契約者が去ろうとしており、引き継ぎは一度の通話だけ。私たちは彼らが保有するすべてのログインとキーを洗い出し、ローテーションし、バックアップが復元できることを確認し、どこで何が稼働しているかを彼らが去る前に書き留めます。

  • サポート終了を迎えるランタイム

    プロダクトが、まもなくセキュリティ更新を受けられなくなる言語ランタイム上で稼働しています。私たちはアップグレードを段階的に計画し、各段階をステージングでお客様の主要なワークフローに照らしてテストし、合意されたメンテナンスウィンドウ中にリリースします。

  • 誰もが無視するようになったアラート

    チームにアラートが多すぎて、本当の問題がノイズに埋もれてしまいます。私たちはどのアラートが対応につながったかを確認し、残りを統合または廃止し、残ったものを重大度に応じてサポートプランで指名された人にルーティングします。

マネージド運用の始め方

  1. 01

    オンボーディングレビュー

    私たちが構築していないソフトウェアも含め、コード、インフラ、アクセス、バックアップ、監視、既知のリスクをレビューし、最初に何を修正するかを合意します。

  2. 02

    サポートプランの合意

    対象システム、サポート時間、対応のコミットメント、エスカレーション連絡先、双方の責任、除外事項を書面にします。

  3. 03

    基盤の安定化

    欠けている監視、バックアップ、アクセス制御、ランブックを整備し、日常運用が始まる前に緊急のリスクを修正します。

  4. 04

    運用とレポート

    リリース、監視、パッチ適用、復旧テスト、レビューをスケジュールに従って実行し、定期レポートと合意された改善リストを伴います。

AIツールを使う2つの方法

AIはインフラコードと診断を支援します。設定とログを処理してよい場所を選択してください。

お決まりでないですか?スコープ設定の際に一つをおすすめします。 AIデリバリーのオプションを比較する

マネージド運用プランの対象外

  • サポートプランに含まれる改善作業を超える新機能は、開発プロジェクトとして別途スコープを定めます。
  • ベンダーのプラットフォームや未レビューのサーバーなど、私たちがオンボーディングしていないシステムは、レビューして追加されるまでプランの対象外です。
  • セキュリティ侵害のフォレンジック調査は含まれません。プラン内では、私たちはインシデントを封じ込め、ログを保全し、調査を行う担当者を支援します。
  • 決済、メール、モデルAPIプロバイダーなどのサードパーティサービスでの障害は私たちの制御外です。私たちはそれらを監視し、設計上可能な範囲で回避策を講じます。

開発、QA、AI運用がどうつながるか

  • 同じチームからの修正

    監視やインシデントがコードの問題を示した場合、私たちのエンジニアはエンゲージメント内で修正するか、明確な診断をあなたの開発者に引き渡すことができます。

  • QAリグレッションカバレッジ

    パッチ、依存関係の更新、修正はリリース前にリグレッションテストを通過するため、日常的なメンテナンスがあなたの重要なワークフローに対してチェックされます。

  • AIエージェントとモデルの運用

    あなたの製品がAI機能やエージェントを使用している場合、私たちは評価、プロンプトとモデルの更新、権限レビューを追加します。プライベートモデルのホスティングはPrivate AI Infrastructureでカバーされます。

  • 継続的な改善

    レポートは、パフォーマンス、コスト、セキュリティ、ロードマップの作業を優先順位付けしたリストになり、文書に残されるのではなく、あなたと一緒にスケジュールされます。

FAQ

よくあるご質問

営業時間外に何かが壊れたらどうなりますか?

監視とアラートは継続的に稼働します。営業時間外に誰がどれだけ速く対応するかは、サポートプランで定めます。対象時間、重大度別の応答コミットメント、エスカレーション連絡先、除外事項です。重要なシステムに営業時間外の対応が必要な場合は、想定で済ませず、明示的にスコープを定めて合意します。

自分たちが構築していないアプリケーションを管理してもらえますか?

はい、AIツールで構築されたアプリケーションも含みます。まずコード、インフラ、アクセス、バックアップ、監視のオンボーディングレビューから始め、最も緊急性の高いリスクを修正してから日常運用を引き継ぎます。現状のままでは安全に稼働できないものがあれば、その旨をお伝えし、変更を提案します。

サポートプランには何が含まれますか?

対象となるシステム、サポート時間、重大度別の応答コミットメント、エスカレーション連絡先、メンテナンスウィンドウ、報告スケジュール、双方の責任範囲、そして除外事項です。改善作業がどの程度含まれるかも定めます。オンボーディングレビューの後に合意するため、実際に稼働させる必要があるものを反映します。

AIツールは当社のログや本番データを見るのですか?

許可されたものだけです。アクセスは最小権限の原則に従い、AIツールは合意されたログ、メトリクス、構成に基づいて動作し、シークレットは対象外に保たれます。それらの情報がお客様の境界内に留まる必要がある場合、プライベート/ローカルAIエンジニアリング はお客様が管理するインフラまたは合意された隔離環境上のモデルを使用します。Claude Code/OpenAI Codex エンジニアリング は、合意されたアカウントおよびデータ保持設定のもとで商用エージェントを使用します。

関連する読み物

稼働中のソフトウェアに、責任を持つチームを

何が稼働していて、何が気がかりかをお聞かせください。オンボーディングレビューから始め、適したサポートプランをご提案します。