Inteligencia artificial

Microsoft: el criterio del progreso en inteligencia artificial debe ser el «rendimiento útil», no el tamaño de la infraestructura

Rani Borkar, de Microsoft, considera que el éxito de la infraestructura de inteligencia artificial no se mide por el número de chips o tokens procesados, sino por la cantidad de inteligencia útil generada por cada unidad de energía, memoria e inversión. Aboga por un diseño integral que abarque desde los centros de datos y los chips hasta los modelos, el software y los agentes.

2026-09-02
7 min de lectura
7 visitas
فريق تحرير certi.news
Microsoft: el criterio del progreso en inteligencia artificial debe ser el «rendimiento útil», no el tamaño de la infraestructura

Rani Borkar, quien dirige en Microsoft las organizaciones responsables de la planificación, ingeniería, desarrollo y despliegue del hardware y la infraestructura de la plataforma de computación en la nube, plantea una perspectiva diferente para medir el progreso en la era de la inteligencia artificial. En lugar de centrarse en el número de chips, el tamaño de los centros de datos o la cantidad de tokens que el sistema puede generar, propone adoptar el concepto de «rendimiento» (Yield): es decir, la cantidad de producción útil que puede obtenerse de los recursos disponibles.

Borkar toma prestado el concepto de la industria de los semiconductores, donde el rendimiento se refiere al número de chips funcionales que pueden extraerse de cada oblea. Según su visión, este principio debería ampliarse para incluir el capital, la energía, la memoria, las comunicaciones, los modelos y el software, hasta llegar al valor que la inteligencia artificial aporta al trabajo y a la vida cotidiana.

¿Por qué ya no basta con ampliar la infraestructura?

El artículo señala que la expansión de la inteligencia artificial se aceleró a un ritmo superior al observado con Internet, los ordenadores personales y los teléfonos inteligentes, pero su uso global todavía alcanza solo aproximadamente al 18 % de la fuerza laboral, mientras que la mayor parte del uso se concentra en las conversaciones. A medida que los sistemas pasan a realizar tareas de razonamiento, planificación, uso de herramientas y ejecución de flujos de trabajo agénticos más largos, los requisitos de infraestructura cambian radicalmente.

Borkar afirma que una sola tarea agéntica puede utilizar más de 3400 veces la cantidad de tokens que consumen las interacciones conversacionales habituales. Este aumento ejerce presión sobre la energía, la densidad de los racks, el tamaño de los paquetes y la capacidad de memoria. Considera que la respuesta tradicional, consistente en añadir más silicio, memoria, energía y fibra, no puede prolongarse indefinidamente, ya que cada nueva mejora podría requerir mayores insumos que la generación anterior.

La perspectiva propone dos vías paralelas: mejoras graduales en las arquitecturas actuales para aumentar la eficiencia, el aprovechamiento y la viabilidad económica, y transformaciones más profundas que redibujen la curva de rendimiento mediante nuevas arquitecturas, materiales y métodos de diseño de sistemas y modelos. Borkar cita el paso de los procesadores al diseño multinúcleo después de que el aumento de la frecuencia de reloj chocara con una barrera energética, así como la transición de la memoria NAND del diseño plano al diseño vertical.

El rendimiento es el resultado de la colaboración entre todas las capas

El artículo sostiene que el cuello de botella no se resuelve necesariamente en la capa en la que aparece. Medir el rendimiento de un componente aislado no es suficiente, porque las ganancias y las pérdidas se acumulan entre el centro de datos, el silicio, los modelos y las herramientas que coordinan las tareas de los agentes. Por ello, Borkar aboga por un «diseño conjunto» que determine primero el resultado deseado y después optimice de nuevo todo el sistema, en lugar de maximizar el rendimiento de un solo elemento.

En cuanto a la memoria, Microsoft considera que el problema no consiste únicamente en la escasez de componentes, sino que constituye un desafío a nivel de sistema. El razonamiento necesita admitir modelos más grandes y contextos más largos, además de proporcionar los datos con rapidez, mientras que los agentes añaden operaciones de generación, recuperación, uso de herramientas y memoria persistente dentro de bucles que pueden prolongarse durante minutos u horas. La experiencia de la plataforma Azure Maia muestra que reducir el consumo de memoria de la caché KV puede combinar la ingeniería de modelos, la ciencia de datos y la compresión, junto con la gestión del software de las jerarquías de memoria, la optimización del silicio, el movimiento de datos y los compiladores.

La idea no consiste simplemente en añadir nuevos bytes, sino en extraer una mayor cantidad de inteligencia útil de cada byte disponible.

De las redes a la energía

A nivel de los clústeres, la inteligencia no procede de un solo chip, sino de miles de chips que funcionan como un único sistema. Por ello, el resultado no depende únicamente de la velocidad de los enlaces, sino también de la gestión de la congestión, la recuperación ante fallos, la distribución de las cargas de trabajo, la complejidad de la programación y los límites entre el silicio, el sistema y el software.

Borkar afirma que el diseño de la plataforma Maia partió del resultado que se quería lograr —un razonamiento eficiente a escala de flota— y no de un diseño de red preestablecido. Esto incluyó la construcción de una red de expansión de dos niveles, la integración de funciones de la tarjeta de red dentro del chip y el desarrollo de una capa de transporte personalizada. Según el artículo, este enfoque permitió obtener un rendimiento escalable en clústeres de razonamiento densos, simplificar la programación, aumentar la flexibilidad de las cargas de trabajo y reducir el hardware de red necesario.

En cuanto a la energía, pasó de ser un recurso consumido por el sistema a convertirse en una restricción que debe incorporarse al diseño desde la red eléctrica hasta el chip. El artículo señala que la potencia de los racks aumentó de decenas de kilovatios a cientos de ellos, y que los complejos de centros de datos operan a escala de gigavatios. También menciona soluciones como los transformadores de estado sólido y la distribución de corriente continua a 800 voltios para reducir las pérdidas de distribución.

Microsoft presenta el procesador para servidores Azure Cobalt 200, basado en Arm, como ejemplo de este diseño conjunto; permite que cada núcleo controle de forma individual el voltaje y la frecuencia, además de determinar por software el consumo de energía de cada máquina virtual. La empresa afirma que el control preciso permite ajustar la energía protegiendo al mismo tiempo el rendimiento de las cargas de trabajo críticas, lo que hace posible operar un mayor número de servidores dentro de los mismos límites energéticos.

¿Qué importa en la práctica?

La importancia de este planteamiento reside en trasladar el debate de la carrera por la capacidad bruta a la eficiencia con la que los recursos se convierten en resultados. Para los operadores de la nube y de los centros de datos, esto significa que la evaluación del hardware no puede separarse de las redes, el software, la refrigeración y la gestión de las cargas. Para los desarrolladores de modelos y agentes, la eficiencia de la memoria, la duración de las tareas y la integración de herramientas se convierten en factores que influyen en la escalabilidad tanto como el tamaño del modelo.

Sin embargo, esta conclusión sigue siendo una visión procedente de Microsoft y basada parcialmente en su experiencia en la construcción y operación de infraestructura de inteligencia artificial a gran escala, y no un estándar independiente demostrado para todos los entornos. Además, el artículo no ofrece cifras comparativas detalladas para medir las mejoras de Maia o Cobalt 200, ni especifica el coste o el calendario de aplicación de las soluciones mencionadas fuera del contexto de Azure.

Aun así, la «necesidad de rendimiento» plantea una pregunta práctica a la industria: ¿las crecientes inversiones en energía, chips y centros de datos se traducen en una inteligencia accesible a un coste adecuado y en una productividad y un valor tangibles? En la visión de Borkar, el rendimiento no se completa al generar tokens, sino cuando esos resultados se transforman en un descubrimiento científico más rápido, una señal médica detectada de forma temprana, un mejor aprendizaje o nuevas oportunidades para las pequeñas empresas.

Fuente de la noticia
Microsoft Official Blog
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias