2026.09.25 | テクノロジー

Amazon CloudWatch Omniとは?AIエージェントの監視と評価を解説

エラーが出ていなくても、AIエージェントの回答が正しいとは限りません。Amazonが発表した「Amazon CloudWatch Omni」は、処理の過程を可視化し、回答の評価や改善まで支援するサービスです。従来の監視では捉えにくい品質の変化をどう把握するのか、主な機能と開発・運用をつなぐ仕組みを紹介します。

AIの動きを見える化するトレース機能

AIエージェントは、与えられた目的に沿ってツールを使い、必要な処理を進める仕組みです。質問に答えるまでに、ツールの選択や指示文の組み立て、複数の処理の呼び出しを行います。同じ入力でも動作や結果が変わることがあり、プロンプトを変更しただけで回答の品質が低下する場合もあります。通常の監視でエラーが見つからなくても、期待した回答が得られるとは限りません。
原因を調べるには、最終的な回答だけでなく、そこに至る過程を確認する必要があります。しかし、記録が複数のシステムに分散していると、手作業で照合する負担が増え、何が変わったのかを突き止めにくくなります。
CloudWatch Omniは、オブザーバビリティ、つまりシステムが出力するデータから内部の状態や動作を把握するための機能を提供します。

エージェントの各処理を記録し、想定と異なる動作がどこで生じたのかを調べられる仕組みです。
中心となるのが、処理の流れを記録した「トレース」を確認するTrace Explorerです。大規模言語モデル(LLM)への問い合わせやツールの実行などを、処理の親子関係が分かる時系列で表示します。個々の処理単位である「スパン」を開けば、入力と出力、処理時間、AIが文章を扱う際の単位であるトークンの使用量まで確認できます。
Compare modeでは、2つのトレースを並べ、プロンプトや設定による動作の違いを確認できます。また、Ask Assistantでは、AIがトレースを分析してパターンや異常を見つけ、「なぜ同じツールを2回呼び出したのか」といった質問に回答します。
会話履歴全体を調べるSession Explorerや、処理の一部を担うサブエージェントとツールの接続関係を可視化するAgent Topologyも備えており、複数のやり取りやシステム全体の構成からも調査できます。ただし、動作の経緯が分かるだけでは、回答が正確で役立つかまでは判断できません。そこで必要になるのが、回答そのものの評価です。

回答の品質を高める評価・比較・検証

CloudWatch Omniには、回答の一貫性や有用性、参照情報への忠実性、処理の振り分けの正確性などを測る17種類の評価機能が標準搭載されています。対象のトレースと評価機能を選んで実行すると、事例ごとのスコアと全体の集計結果を取得でき、独自の評価の仕組みを一から構築せずに、複数の観点から回答を確認できます。
評価を踏まえて変更を試す場が、Playgroundです。モデルやシステムプロンプトの異なる構成を並べ、出力をリアルタイムで比較できます。指示の内容や使用するモデルによって回答がどう変わるかを、変更を確定する前に確かめられます。
複数の事例で検証したい場合には、Experimentsを利用します。

同じデータセットを使って、構成の異なる2つのエージェントを実行し、評価スコア、処理時間、トークン使用量を並べて比較する機能です。データセットとは、検証に使う質問などをまとめたもので、条件をそろえて回答の品質や応答にかかる時間、文章の処理量を確認できます。
検証用のデータには、本番環境で実際に処理したリクエストの記録も活用できます。記録を選別・整理し、評価の基準となる「ゴールデンデータセット」を作成すると、プロンプトや処理の仕組みを変更した際に、同じ事例で繰り返し検証できます。実験結果は自動的に採点され、回帰テストの基準になります。回帰テストとは、変更によって、以前は問題のなかった動作や回答の品質が損なわれていないかを確認するテストです。
さらに、Prompt Managementでは、プロンプト設定をバージョンごとに管理し、変更履歴を追跡できます。新しい設定で性能が下がった場合は、以前のバージョンに戻すことも可能です。こうした評価・比較・履歴管理を通じて、変更の影響を確かめながら改善を進められます。その検証を支える本番環境の記録は、開発者と運用担当者が共通して利用できます。

開発から本番運用まで同じ記録を共有できる利用環境

CloudWatch Omniには、開発ツール内で使う拡張機能と、ブラウザからアクセスする独立したWeb環境があります。開発者が不具合の調査に使うトレースを運用担当者も確認でき、それぞれの作業環境で同じデータをもとに調査を進められます。
拡張機能は、コードの作成や実行などを行うIDE(統合開発環境)のVS Code、Cursor、Kiroに対応しています。Kiro、Claude Code、CodexなどのAIコーディングアシスタントと連携し、開発サーバーの設定や、必要なソフトウェアの導入、動作データを収集する仕組みの設定を任せることもできます。
開発中はAWSに接続せず、手元の環境だけで利用でき、データは初期設定ではローカルに保存されます。

Cloud LoginでAWSアカウントに接続すると、動作状況を示すテレメトリデータをAmazon CloudWatchへ送信して継続的に保存・共有できるほか、本番環境のダッシュボードにもアクセスできます。
Web環境はAWSマネジメントコンソールから独立しており、IDEを使わずにブラウザからアクセスできます。認証には、1回の認証で複数のサービスを利用できるSSO(シングルサインオン)を採用しており、ログイン後はアプリケーションの監視や分析、エージェントの調査をチームで行えます。
既存の開発環境にも対応しており、エージェント開発の共通の仕組みを提供するLangChainやLangGraphなどのフレームワークをサポートしています。開発言語はPythonとTypeScriptに対応しています。Amazon Bedrock AgentCoreで構築したエージェントの動作を確認できるほか、同サービスの評価機能もOmni内で利用できます。データ収集にはオープン標準を採用しており、AWS以外のクラウドで動くエージェントも、実行環境を移行せずに監視できます。
CloudWatch Omniは一般提供されており、クラウドでの提供リージョンは米国東部(バージニア北部)、米国西部(オレゴン)、欧州(アイルランド)です。IDE拡張機能は無料で、ローカルでの利用開始にAWSアカウントは必須ではありません。ただし、Amazon Bedrockのモデルを利用する場合はAWS認証情報、他社のモデルを利用する場合は各社のAPIキーが必要です。手元での開発から始め、必要に応じてクラウドへ接続することで、チームでの共有や本番運用へと利用を広げられます。

まとめ

いかがだったでしょうか?
Amazon CloudWatch Omniは、AIエージェントの処理の可視化から、回答の評価、変更を試す実験までを一つの環境で支援します。
回答に至る過程を調べ、同じ条件で変更前後を比較することで、動作と品質の両面から改善を進められます。
開発時の検証と本番運用での監視をつなぎ、継続的に品質を確かめるための仕組みです。