Chips y semiconductores

¿Por qué la computación de inteligencia artificial del futuro no dependerá de un solo tipo de chip?

Los centros de datos avanzan hacia clústeres heterogéneos que combinan CPUs, GPUs, NPUs, aceleradores personalizados y conectividad óptica, en lugar de depender de una sola GPU para todas las tareas. Este cambio convierte el software, la gestión de redes y la energía en factores decisivos para reducir el costo de los tokens y mejorar el aprovechamiento del hardware.

2026-08-19
7 min de lectura
15 visitas
فريق تحرير certi.news
¿Por qué la computación de inteligencia artificial del futuro no dependerá de un solo tipo de chip?

La arquitectura de los centros de datos de inteligencia artificial avanza hacia clústeres de computación heterogéneos que combinan unidades centrales de procesamiento (CPUs), unidades de procesamiento gráfico (GPUs), unidades de procesamiento neuronal (NPUs) y aceleradores personalizados, además de memoria de alto ancho de banda y tecnologías de interconexión de cobre y ópticas. Este cambio refleja la distinta naturaleza de las tareas de entrenamiento e inferencia de los modelos, especialmente con el crecimiento de las aplicaciones de inteligencia artificial agéntica, que requieren una combinación de cálculos paralelos, gestión del estado, toma de decisiones y ejecución de llamadas a herramientas.

Esto se planteó en un debate organizado por Semiconductor Engineering con Satadal Bhattacharjee, de Arm; Ashish Darbari, de Axiomise; Moshiko Emmer, de Cadence; Sharad Chole, de Expedera; Cameron Brunner, de Siemens EDA; y Sumit Vishwakarma, de Synopsys. El material representa la tercera y última parte de una serie de debates sobre el cambio en la arquitectura de los centros de datos de inteligencia artificial.

De un servidor potente a un sistema distribuido

Los clústeres con múltiples procesadores cambian la naturaleza del problema de ingeniería. En lugar de diseñar un solo servidor que equilibre procesamiento, memoria y entrada y salida, el rendimiento pasa a depender de la división de las cargas de trabajo, los patrones de comunicación y la capacidad de la red de interconexión para transferir datos y ejecutar operaciones de sincronización de forma eficiente.

Los participantes explicaron que los distintos modelos de paralelismo, como Tensor parallel, data parallel, context parallel y pipeline parallel, requieren diferentes formas de topología de red. El paralelismo por canalización conecta etapas sucesivas, mientras que el paralelismo tensorial exige operaciones de agregación amplias y luego volver a difundir los resultados. Por ello, la elección de la red de interconexión se convierte en parte de la definición del clúster, y no en un componente separado de este.

La importancia de la memoria aumenta a medida que los modelos crecen. Además de los parámetros fijos del modelo, existe un contexto variable que se ve afectado por el número de solicitudes procesadas y el volumen de información que conserva el sistema. Por eso, el costo de la memoria HBM y la forma en que se utiliza son factores que influyen en la eficiencia de las unidades GPU, especialmente dentro de centros de datos que buscan aumentar el número de solicitudes procesadas por segundo.

Descomposición de la inferencia entre clústeres especializados

Satadal Bhattacharjee considera que una de las tendencias importantes es descomponer el canal de inferencia en etapas separadas. El proceso comienza con la etapa de prefill, que procesa la solicitud y determina lo que se requiere de ella; se trata de una etapa intensiva en cómputo. Después llega la etapa de decode, que genera la respuesta, seguida de la etapa de ejecución de tareas por parte de los agentes, como llamar a herramientas o ejecutar una acción específica.

En este modelo, se puede asignar un clúster de hardware y software a la etapa de prefill, otro clúster a la etapa de decode y un clúster de cómputo a la ejecución de tareas de los agentes; posteriormente, estos clústeres se conectan entre sí, generalmente mediante Ethernet, según el debate. Esto permite utilizar cada tipo de hardware para la tarea que mejor se adapta a él, en lugar de ejecutar todas las etapas en una sola GPU.

Bhattacharjee señaló el anuncio de Nvidia sobre el uso de Groq 3 LPU en un clúster de prefill como ejemplo de que la inferencia puede necesitar más de un tipo de procesador. También mencionó que DigitalOcean anunció el despliegue de una arquitectura de inferencia de cinco capas preparada para utilizar clústeres heterogéneos con hardware de AMD y Nvidia, con la posibilidad de añadir posteriormente nuevo hardware.

El software es el eslabón de coordinación

No basta con reunir CPUs, GPUs, NPUs y aceleradores en un solo sistema. El software debe conocer las características de cada componente, decidir dónde se ejecuta cada etapa y coordinar las operaciones de transferencia de datos, planificación, espera y acceso a las interfaces de programación. Las unidades CPU pueden encargarse de tareas de gestión del estado, direccionamiento de instrucciones y llamadas a herramientas, mientras que los aceleradores realizan los cálculos intensivos, incluidas las operaciones de multiplicación de matrices relacionadas con la inferencia y el razonamiento.

Las máquinas virtuales se utilizan para abstraer los clústeres en un nivel superior, pero los participantes describieron los entornos basados en contenedores, incluido Docker, como el método predominante para desplegar componentes y cadenas de herramientas de controladores de GPU de forma reproducible. Por encima de la capa de contenedores permanecen componentes especializados para la ejecución, la coordinación, la planificación, la gestión de colas, el despliegue de modelos y la prestación de interfaces de programación.

Los participantes consideraron que disponer de un ecosistema de software integrado es una de las razones de la fortaleza de Nvidia, después de que la empresa invirtiera en software durante más de 20 años. Sin embargo, la transición hacia hardware de múltiples empresas exige una capa de coordinación capaz de gestionar esta diversidad. Se mencionaron empresas como Gimlet Labs y Together AI como compañías que trabajan en la provisión de esta capa, incluida la optimización de la operación de clústeres de prefill, decode y ejecución.

La interconexión y la energía determinan la escalabilidad

Entre las opciones de interconexión entre clústeres se encuentran Ethernet, InfiniBand y Slingshot, una tecnología de redes de alta velocidad basada en Ethernet de Hewlett Packard Enterprise. Según el debate, Ethernet ofrece un estándar más amplio, mientras que las tecnologías personalizadas pueden proporcionar un mejor rendimiento en determinados casos, a cambio de quedar vinculadas al ecosistema de un proveedor específico.

También crece el interés por la interconexión óptica: Google utiliza unidades TPU con enlaces ópticos, mientras se investigan tecnologías de óptica integrada en el paquete (co-packaged optics). El atractivo de los fotones reside en la reducción de la resistencia y la disipación energética en comparación con los enlaces eléctricos, algo importante en clústeres que ya afrontan desafíos térmicos y costos de refrigeración.

A nivel del paquete, la integración de varios chips, memoria HBM y distintos componentes aumenta la complejidad de los efectos térmicos, mecánicos y eléctricos. El calor, la deformación o los problemas de electromigración y de integridad de la señal pueden afectar al rendimiento del nodo y de todo el clúster. Por ello, no se necesita tanto una única tecnología de interconexión universal como capas de interconexión compatibles con cada nivel, desde la conexión entre los chips dentro del paquete hasta la red del clúster.

¿Por qué importa esta tendencia?

La conclusión planteada por Bhattacharjee es que la energía representa el primer problema, mientras que la eficiencia de los tokens ocupa el siguiente lugar. Los clústeres heterogéneos ofrecen una vía para reducir el costo del token mediante la adaptación del hardware a la naturaleza de cada etapa, pero lograrlo exige software de coordinación maduro y mediciones claras de la ubicación de los datos, el ancho de banda, el estado térmico y la especialización de cada motor. Dado que este ecosistema depende generalmente de componentes de múltiples empresas, construir un sistema que funcione de manera eficiente a gran escala sigue siendo un desafío de ingeniería abierto, no simplemente un proceso de sustituir una GPU por otro acelerador.

Fuente de la noticia
Semiconductor Engineering
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias