在截至 2026 年 9 月 28 日的一周内,AWS 向其生态系统加入了一系列人工智能服务和基础设施工具,重点是根据智能水平、成本和响应时间,为每项任务选择合适的模型,而不是在所有情况下都使用可用的最大模型。
通过 Amazon Bedrock 提供新模型
Amazon Bedrock 提供了 OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 两个模型。GPT-6 Sol 面向开发工作以及重复性和复杂的运维任务,而 GPT-6 Luna 则侧重于在大规模运行时执行明确且可重复的任务。AWS 表示,这两个模型的价格都明显低于其前代模型 GPT-5.6。
Anthropic 的 Claude Opus 5.5 也已通过 Bedrock 提供,这是 Claude 5.5 系列的首个模型。与 Claude Opus 5 相比,它预计能够使用更少的令牌执行更多任务,同时针对代理驱动的编程和长时间运行的任务进行了调整。
在同一空间监控应用和代理
AWS 推出了 Amazon CloudWatch Omni,用于在统一的协作体验中监控应用和人工智能代理。该服务基于 OpenTelemetry,因此无需重新配置即可显示现有测量数据;它还支持通过单一地址访问,并提供统一的企业登录,无需直接拥有控制台的访问权限。
CloudWatch Omni 会自动识别服务并关联其依赖关系,同时将 AWS DevOps Agent 集成到调查会话中,以关联信号并追踪故障的根本原因。
推理和事件驱动架构的实际变化
AWS 还推出了 Amazon SageMaker HyperPod Inference Gateway。这是一层原生 Kubernetes 路由层,以 Amazon EKS 的单一托管附加组件形式部署,无需修改应用。它会根据 KV cache 使用率、队列长度、prefix cache 命中成功率和预计响应时间等实时信号路由请求,而不是采用传统的 round-robin 负载均衡。AWS 表示,在包含多种硬件和突发负载的场景中,这使首个令牌的延迟降低了最高 82%。该路由层支持与 OpenAI 兼容的模型服务器,包括 vLLM 和 SGLang。
在 Amazon EventBridge 中,现在可以通过 AWS RAM 在企业账户之间创建共享的中央事件总线,并提供事件排序、基于内容去重以及同步调用 AWS Lambda 等目标的选项。新的 Subscriber 资源还会整合筛选策略、目标和重试设置;而 ingress/egress 定价模式则取代了多总线架构中账户之间累积的路由费用。现有总线仍将作为“classic”总线运行。
实际会发生什么变化?
这些公告将模型列表的扩展与周边运营层的改进结合起来。实际价值并不局限于提供更多模型;模型选择如今与任务的成本和耗时联系得更加紧密,而 CloudWatch Omni 和 Inference Gateway 则针对两个直接的运营问题:理解系统和代理的行为,以及减少异构负载下的推理延迟。
AWS 还通过 AWS MCP Server 为 Amazon SES 和 AWS End User Messaging 推出了人工智能代理技能,用于指导编程代理执行验证发送身份、发送生产邮件以及构建带有卡片和按钮的 RCS 代理等任务。这些技能可与 Claude Code、Codex、Cursor 和 Kiro 配合使用。
Strands Agents 团队宣布推出 Strands harness,这是一种通用代理框架,可在本地运行或部署到任何位置,并依据 Apache 2.0 许可。它支持来自 Amazon Bedrock、Anthropic、OpenAI、Google 和 Ollama 的模型,并包含用于管理上下文缓存、压缩工具结果以及在多次运行之间保留记忆的设置。该团队表示,与在相同模型上运行的类似框架相比,其成本低约 28%,同时保持准确性;不过,这一结果仍是该团队提出的说法,需要独立验证。