За неделю, завершившуюся 28 сентября 2026 года, AWS добавила в свою экосистему ряд сервисов искусственного интеллекта и инфраструктурных инструментов. Этот подход ориентирован на выбор подходящей модели для каждой задачи с учётом уровня интеллекта, стоимости и времени отклика, вместо использования самой большой доступной модели во всех случаях.
Новые модели через Amazon Bedrock
Amazon Bedrock сделал доступными модели GPT-6 Sol и GPT-6 Luna от OpenAI. GPT-6 Sol предназначена для разработки, повторяющихся и сложных операций, тогда как GPT-6 Luna ориентирована на определённые и повторяемые задачи при их запуске в больших объёмах. AWS заявляет, что обе модели предлагаются по цене, заметно ниже, чем у их предшественников GPT-5.6.
Claude Opus 5.5 от Anthropic также стал доступен через Bedrock как первая модель семейства Claude 5.5. Предполагается, что она выполняет больше задач с использованием меньшего числа токенов по сравнению с Claude Opus 5 и оптимизирована для агентной разработки и длительно выполняющихся задач.
Мониторинг приложений и агентов в едином пространстве
AWS запустила сервис Amazon CloudWatch Omni для мониторинга приложений и агентов искусственного интеллекта в рамках единого совместного интерфейса. Сервис использует OpenTelemetry, что позволяет отображать текущие измерительные данные без повторной настройки. Он также предоставляет доступ через единый адрес с унифицированной корпоративной аутентификацией, без необходимости прямых прав доступа к консоли.
CloudWatch Omni автоматически распознаёт сервисы и связывает их зависимости, а также интегрирует AWS DevOps Agent в расследования для объединения сигналов и отслеживания первопричин сбоев.
Практические изменения в инференсе и событийной архитектуре
AWS также представила Amazon SageMaker HyperPod Inference Gateway — нативный для Kubernetes уровень маршрутизации, разворачиваемый как единое управляемое расширение для Amazon EKS без изменений в приложении. Он направляет запросы на основе актуальных сигналов, таких как использование KV cache, длина очереди, успешность обращений к prefix cache и ожидаемое время отклика, вместо традиционной балансировки round-robin. AWS утверждает, что это позволило сократить задержку до первого токена до 82% в сценариях с разнородным оборудованием и прерывистыми нагрузками. Уровень поддерживает серверы моделей, совместимые с OpenAI, включая vLLM и SGLang.
В Amazon EventBridge теперь можно создавать общий центральный шина событий между аккаунтами организации через AWS RAM, с возможностями упорядочивания событий, дедупликации на основе содержимого и синхронного вызова таких целей, как AWS Lambda. Новый ресурс Subscriber объединяет политики фильтрации, цели и повторные попытки, тогда как модель тарификации ingress/egress заменяет накопительные сборы за маршрутизацию между аккаунтами в архитектурах с несколькими шинами. Существующие шины продолжают работать как шины «classic».
Что меняется на практике?
Эти объявления объединяют расширение списка моделей с улучшением окружающих их операционных уровней. Практическая ценность заключается не только в доступности дополнительных моделей: выбор модели теперь сильнее связан со стоимостью и длительностью задачи, тогда как CloudWatch Omni и Inference Gateway нацелены на две непосредственные операционные проблемы: понимание поведения систем и агентов, а также снижение задержки инференса при неоднородных нагрузках.
AWS также запустила навыки для агентов искусственного интеллекта в Amazon SES и AWS End User Messaging через AWS MCP Server, чтобы направлять агентов программирования при выполнении таких задач, как проверка личности отправителя, отправка производственной электронной почты и создание агента RCS с карточками и кнопками. Эти навыки работают с Claude Code, Codex, Cursor и Kiro.
Команда Strands Agents объявила о выпуске Strands harness — общего фреймворка для агентов, который можно запускать локально или развёртывать в любом месте; он распространяется по лицензии Apache 2.0. Он поддерживает модели Amazon Bedrock, Anthropic, OpenAI, Google и Ollama, а также включает настройки для управления кэшированием контекста, сокращения результатов инструментов и сохранения памяти между запусками. По утверждению команды, его стоимость примерно на 28% ниже, чем у аналогичных фреймворков на тех же моделях при сохранении точности; однако это заявление самой команды и требует независимой проверки.