Durante la semana que terminó el 28 de septiembre de 2026, AWS añadió a su ecosistema una serie de servicios de inteligencia artificial y herramientas de infraestructura, en una tendencia centrada en elegir el modelo adecuado para cada tarea según la inteligencia, el coste y el tiempo de respuesta, en lugar de utilizar el modelo más grande disponible en todos los casos.
Nuevos modelos a través de Amazon Bedrock
Amazon Bedrock puso a disposición los modelos GPT-6 Sol y GPT-6 Luna de OpenAI. GPT-6 Sol está dirigido a trabajos de desarrollo y operaciones repetitivas y complejas, mientras que GPT-6 Luna se centra en tareas específicas y repetibles cuando se ejecutan a gran escala. AWS afirma que ambos modelos tienen precios claramente inferiores a los de sus predecesores, GPT-5.6.
Claude Opus 5.5 de Anthropic también pasó a estar disponible a través de Bedrock, como el primer modelo de la familia Claude 5.5. Se supone que ejecuta más tareas utilizando menos tokens en comparación con Claude Opus 5, y está ajustado para la programación basada en agentes y las tareas de larga duración.
Supervisión de aplicaciones y agentes en un solo espacio
AWS lanzó Amazon CloudWatch Omni para supervisar aplicaciones y agentes de inteligencia artificial dentro de una única experiencia colaborativa. El servicio se basa en OpenTelemetry, lo que permite mostrar los datos de telemetría actuales sin reconfiguración. También permite el acceso mediante una sola dirección, con inicio de sesión empresarial unificado y sin necesidad de permisos de acceso directo a la consola.
CloudWatch Omni identifica automáticamente los servicios y relaciona sus dependencias. También integra AWS DevOps Agent en las sesiones de investigación para correlacionar las señales y rastrear las causas raíz de las interrupciones.
Cambios prácticos en la inferencia y la arquitectura basada en eventos
AWS también presentó Amazon SageMaker HyperPod Inference Gateway, una capa de enrutamiento nativa de Kubernetes que se implementa como un único complemento administrado para Amazon EKS, sin modificaciones en la aplicación. Dirige las solicitudes según señales en tiempo real, como el uso de la caché KV, la longitud de la cola, el éxito de las coincidencias de la caché de prefijos y el tiempo de respuesta previsto, en lugar del equilibrio de carga round-robin tradicional. AWS afirma que esto redujo la latencia hasta el primer token en un 82% en escenarios con hardware diverso y cargas intermitentes. La capa admite servidores de modelos compatibles con OpenAI, incluidos vLLM y SGLang.
En Amazon EventBridge, ahora es posible crear un bus de eventos central compartido entre las cuentas de la organización mediante AWS RAM, con opciones para ordenar los eventos, eliminar duplicados basándose en el contenido y realizar invocaciones síncronas de destinos como AWS Lambda. El nuevo recurso Subscriber también reúne las políticas de filtrado, los destinos y los reintentos, mientras que un modelo de precios de ingress/egress sustituye las tarifas de enrutamiento acumuladas entre cuentas en arquitecturas con múltiples buses. Los buses actuales seguirán funcionando como buses “classic”.
¿Qué cambia en la práctica?
Estos anuncios combinan la ampliación de la lista de modelos con la mejora de las capas operativas que los rodean. El valor práctico no se limita a la disponibilidad de modelos adicionales; la elección del modelo está ahora más vinculada al coste y al tiempo de la tarea, mientras que CloudWatch Omni e Inference Gateway abordan dos problemas operativos directos: comprender el comportamiento de los sistemas y los agentes, y reducir la latencia de inferencia bajo cargas heterogéneas.
AWS también lanzó habilidades para agentes de inteligencia artificial en Amazon SES y AWS End User Messaging mediante AWS MCP Server, con el fin de orientar a los agentes de programación en tareas como verificar la identidad del remitente, enviar correo electrónico de producción y crear un agente RCS con tarjetas y botones. Estas habilidades funcionan con Claude Code, Codex, Cursor y Kiro.
El equipo de Strands Agents anunció Strands harness, un marco general para agentes que puede ejecutarse localmente o desplegarse en cualquier lugar, y que está licenciado bajo Apache 2.0. Admite modelos de Amazon Bedrock, Anthropic, OpenAI, Google y Ollama, e incluye configuraciones para gestionar el almacenamiento en caché del contexto, reducir los resultados de las herramientas y conservar la memoria entre ejecuciones. Según el equipo, su coste es aproximadamente un 28% inferior al de marcos similares con los mismos modelos, manteniendo la precisión; este resultado sigue siendo una afirmación del equipo y requiere verificación independiente.