AWSは、2026年9月28日に終了した週に、複数のAIサービスとインフラストラクチャツールを自社エコシステムに追加した。これは、あらゆるケースで利用可能な最大のモデルを使うのではなく、知能、コスト、応答時間に基づき、各タスクに適したモデルを選択する方向性に重点を置いている。
Amazon Bedrockで新モデルを提供
Amazon Bedrockで、OpenAIのGPT-6 SolとGPT-6 Lunaが利用可能になった。GPT-6 Solは開発作業や反復的で複雑なオペレーションを対象とし、GPT-6 Lunaは、大規模に実行する際の限定的で反復可能なタスクに重点を置いている。AWSによると、両モデルは前世代のGPT-5.6より明確に低い価格で提供される。
また、AnthropicのClaude Opus 5.5もBedrockで利用可能になった。これはClaude 5.5ファミリー初のモデルである。Claude Opus 5と比較して、より少ないトークン数でより多くのタスクを実行することが想定されており、エージェント型プログラミングと長時間稼働するタスク向けに調整されている。
アプリケーションとエージェントを単一の環境で監視
AWSは、単一の共同作業環境でアプリケーションとAIエージェントを監視するサービス、Amazon CloudWatch Omniを開始した。このサービスはOpenTelemetryを基盤としており、再設定なしで現在の計測データを表示できる。また、単一のアドレスからアクセスでき、統合された企業向けシングルサインオンに対応し、コンソールへの直接的なログイン権限を必要としない。
CloudWatch Omniはサービスを自動的に認識して依存関係を関連付けるほか、AWS DevOps Agentを調査セッションに統合し、シグナルを関連付けて障害の根本原因を追跡できる。
推論とイベント駆動型アーキテクチャにおける実務的な変更
AWSはさらに、Amazon SageMaker HyperPod Inference Gatewayを発表した。これはKubernetes向けのネイティブなルーティング層であり、アプリケーションを変更せず、Amazon EKS向けの単一のマネージドアドオンとしてデプロイされる。従来のラウンドロビン方式による負荷分散ではなく、KV cacheのメモリ使用量、キューの長さ、prefix cacheのヒット成功率、予測応答時間などのリアルタイムシグナルに基づいてリクエストをルーティングする。AWSによると、多様なハードウェアと断続的なワークロードを含むシナリオで、最初のトークンまでのレイテンシーが最大82%短縮された。この層は、vLLMやSGLangを含むOpenAI互換のモデルサーバーをサポートする。
Amazon EventBridgeでは、AWS RAMを通じて、組織内のアカウント間で共有する中央イベントバスを作成できるようになった。イベントの順序付け、コンテンツに基づく重複排除、AWS Lambdaなどのターゲットの同期呼び出しのオプションも利用できる。新しいSubscriberリソースは、フィルタリングポリシー、ターゲット、再試行をまとめる。一方、ingress/egressの料金モデルにより、複数のバスを使用するアーキテクチャでアカウント間に蓄積されていたルーティング料金が置き換えられる。既存のバスは引き続き「classic」バスとして動作する。
実務上、何が変わるのか
これらの発表は、モデルの選択肢の拡大と、それを取り巻く運用レイヤーの改善を組み合わせている。実務上の価値は追加モデルが利用できることだけにとどまらない。モデルの選択はタスクのコストと所要時間により強く結び付くようになり、CloudWatch OmniとInference Gatewayは、システムとエージェントの挙動を理解すること、そして異種ワークロード下での推論遅延を減らすことという、2つの直接的な運用上の課題を対象としている。
AWSはまた、AWS MCP Serverを通じて、Amazon SESとAWS End User MessagingにおけるAIエージェント向けのスキルを開始した。これにより、送信元の本人確認、プロダクションメールの送信、カードとボタンを備えたRCSエージェントの構築などのタスクで、プログラミングエージェントを誘導できる。これらのスキルはClaude Code、Codex、Cursor、Kiroで動作する。
Strands AgentsチームはStrands harnessも発表した。これはローカルで実行することも、任意の場所にデプロイすることもできる汎用エージェントフレームワークで、Apache 2.0のライセンスで提供される。Amazon Bedrock、Anthropic、OpenAI、Google、Ollamaのモデルをサポートし、コンテキストのキャッシュ管理、ツールの結果の圧縮、実行間でのメモリ保持の設定を備える。チームによると、同じモデル上で精度を維持しながら、同種のフレームワークよりコストを約28%削減できるという。ただし、この結果はチームによる主張であり、独立した検証が必要である。