AWSは、アプリケーション監視とAIエージェントを統合し、アプリケーションとその関係に関するログ、メトリクス、トレース、アラートのデータを個別のシグナルとしてではなく整理して表示する統合体験、Amazon CloudWatch Omniの提供を発表した。このサービスは、組織専用のアドレスと企業向けログインを通じてエンジニアが利用できる共有スペースを提供し、AWS Management Consoleへのアクセスを必要としない。
CloudWatch OmniはOpenTelemetryを基盤としているため、組織がCloudWatchに送信している計測データは再設定なしで新しい体験内に表示される。また、OpenTelemetryで構成されたほかのワークロードは、OpenTelemetry Protocol(OTLP)エンドポイントにデータを送信できる。
サービスが提供するもの
Omniは、計測データとAWS Configによるリソース検出に基づいてサービスを自動的に検出し、それらの間の依存関係マップを構築する。継続的な保守が必要な固定ダッシュボードに依存する代わりに、チームは可用性目標、レイテンシー予算、エラー率のしきい値など、重要とみなす対象を定義できる。これにより、アプリケーションの変化や新しいサービスの追加に合わせて監視画面が適応する。
このサービスは、AWSがSpace(スペース)と呼ぶ、各チームが所有するアプリケーションと関連データを含む領域をチームごとに提供する。このスペースは、既存のCloudWatchデータを追加のデータ移動なしで参照する。また、ユーザーはアプリケーションについて自然言語で質問し、計測データを分析し、システムの状態に関連する指標を表示できる。
DevOps Agentとの共同調査
Amazon DevOps Agentは、チームが確認するものと同じ計測データに基づき、エンジニアとともに調査セッションに参加する。AWSによると、このエージェントはサービス間のイベントを関連付け、依存関係グラフを通じて根本原因への経路を追跡し、次の手順を提案する。また、後のインシデントレビューで利用できるよう、調査記録を保持する。
AWSが示すシナリオでは、決済サービスのエラー率上昇によって、アプリケーションのトポロジー、最近のデプロイ、外部決済インターフェースのレイテンシー上昇、エージェントによる初期分析を含むセッションが開始される。決済チームのエンジニアは同じセッションに参加し、蓄積されたコンテキストを確認したうえで、根本原因を特定し、変更をロールバックできる。
実際に何が変わるのか
基本的な変更は、既存のCloudWatchツールを置き換えることではなく、アプリケーションを中心としたインターフェースと、調査中の協働機能を追加することにある。既存のアラート、ダッシュボード、API、コンソール操作は変更されずに引き続き利用できる。また、IAM Identity Centerを通じて企業向けログインを設定した後は、Omniの利用にAWSコンソールの権限は必要ない。IAM Identity CenterはOkta、Azure AD、その他のSAML 2.0プロバイダーをサポートする。
既存のCloudWatch利用者は、CloudWatchコンソールの「Try CloudWatch Omni」オプションから開始し、その後、IDプロバイダーを設定してチームと環境用のスペースを作成できる。AWSは、ほかの環境から計測データを同じスペースと調査セッションに取り込むためのコネクターを提供する。記事によると、DevOps AgentはOmni内のすべての調査セッションでデフォルトで有効になる。
提供状況と制限
CloudWatch Omniは利用可能になった。AWSは料金の詳細をAmazon CloudWatchの料金ページに案内している。記事では、料金の具体的な金額や地域別の提供状況一覧については触れていない。また、調査が利用可能な計測データと企業向けID設定に依存するため、この体験の価値は各組織における設定の品質とテレメトリーのカバレッジに左右される。そのため、利用を拡大する前にチームが評価すべき点となる。