Opiniones y análisis

¿Pueden las unidades GPU mantener su dominio sobre la computación de inteligencia artificial?

Geoff Tate considera que las unidades GPU, lideradas por Nvidia, todavía poseen sólidas ventajas en flexibilidad y sistemas integrados, pero los chips personalizados de Google, Amazon, OpenAI y otras empresas han comenzado a competir directamente con ellas. El futuro del dominio dependerá de la capacidad de los fabricantes de GPU para afrontar las limitaciones de energía, chips y memoria, así como de demostrar el rendimiento de los chips personalizados fuera de las pruebas iniciales.

2026-09-09
7 min de lectura
11 visitas
فريق تحرير certi.news
¿Pueden las unidades GPU mantener su dominio sobre la computación de inteligencia artificial?

Geoff Tate considera que las unidades de procesamiento gráfico (GPU) todavía representan alrededor del 70% de la capacidad instalada mundial de computación para inteligencia artificial, según el fabricante, frente al 30% de los chips personalizados, dominados principalmente por Google y Amazon. Sin embargo, esta ventaja ya no está garantizada, ya que las empresas de la nube y los desarrolladores de modelos avanzados han comenzado a diseñar su propio hardware para reducir el coste de ejecutar cargas de trabajo específicas y mejorar el consumo de energía.

Los datos de Epoch.ai en los que se basa el autor indican que la capacidad instalada mundial de computación para inteligencia artificial creció 17 veces en tres años. En 2023, la cuota de Nvidia era del 90%, frente al 10% de Google, mientras que la computación personalizada representó el 20% del crecimiento durante los últimos tres años. Tate señala que los datos no incluyen a Meta, Microsoft y Cerebras, cuyas capacidades describe como relativamente pequeñas dentro de esta medición.

Las ventajas de Nvidia van más allá de la unidad de procesamiento

Según el autor, la fortaleza de Nvidia no depende de una GPU individual, sino de un ecosistema integrado que incluye unidades de interconexión y expansión, racks, unidades centrales de procesamiento y procesadores de red. La empresa ofrece el ecosistema NVL72, el procesador Vera orientado a cargas de trabajo de agentes de inteligencia artificial, la unidad BlueField y las redes Spectrum-6, además de la opción Groq 3 LPX para inferencia de baja latencia.

Nvidia afirma que el procesador Vera ofrece un rendimiento 1,8 veces superior en cargas de trabajo de agentes frente a un procesador convencional, mientras que la empresa presenta los sistemas Vera Rubin como capaces de lograr una mejora de entre dos y 30 veces frente a GB300 en la prueba DeepSeek-v4-PRO, según el nivel de interactividad. El artículo también menciona que los sistemas Vera Rubin comenzaron a funcionar en racks de CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud y Nebius.

Nvidia prevé un crecimiento del 70% en su próximo ejercicio fiscal, señalando que la demanda está limitada por la oferta. Asimismo, sus compromisos para asegurar el suministro, según lo indicado en la conferencia sobre resultados, aumentaron de 119.000 millones de dólares a 279.000 millones de dólares. Tate considera que obtener capacidad de fabricación de TSMC y proporcionar memoria HBM seguirán siendo factores decisivos en la competencia.

Los chips personalizados se acercan al centro de la competencia

El diseño interno de chips proporciona a las empresas de la nube y a los desarrolladores de modelos un conocimiento directo de sus cargas de trabajo, de la separación entre las necesidades de entrenamiento e inferencia y de los cuellos de botella de la infraestructura. A medida que aumentan las dimensiones de la computación, diseñar dos chips especializados —uno para entrenamiento y otro para inferencia— se ha vuelto más viable económicamente, especialmente si permite mejorar el throughput por vatio entre un 10% y un 30% y reducir en una proporción similar el área de silicio.

El artículo destaca a OpenAI mediante el chip Jalapeño, un acelerador de inferencia que la empresa diseñó para sus cargas de trabajo, con soporte para las etapas de prefill y decode y manteniendo local la memoria KV Cache. El sistema utiliza switches Broadcom Tomahawk 6 para construir un dominio que incluye 128 chips y un dominio global de hasta 2048 chips. Según las pruebas iniciales de OpenAI, Jalapeño superó a Nvidia GB300 en cargas de trabajo de GPT-OSS, DeepSeek R1 y Kimi K2.5, pero las pruebas se basaron en la predicción de un solo token y todavía no incluyeron la predicción de múltiples tokens, que la empresa espera que eleve el rendimiento entre tres y cinco veces.

Tate describe la comparación entre Jalapeño y Vera Rubin como una estimación aproximada, basada en la proyección de curvas de rendimiento publicadas y no en una prueba directa completa. Por ello, considera que los resultados son prometedores, pero necesitan verificación en el despliegue en producción y con escalas y cargas de trabajo más amplias. Además, Jalapeño está destinado a la inferencia y no aborda las necesidades de entrenamiento, que pueden representar un tercio de las necesidades computacionales de OpenAI o más.

Google, Meta y AMD amplían las alternativas

En la octava generación de TPU, Google lanza dos versiones simultáneas: TPU 8t para entrenamiento y TPU 8i para inferencia. El artículo señala que TPU 8i es aproximadamente 1,4 veces más grande que 8t debido a su necesidad de memoria HBM adicional, mientras que la topología de interconexión difiere entre ambas versiones según las distintas exigencias del entrenamiento y la inferencia. Google afirma que la nueva generación ofrece aproximadamente el doble del rendimiento de las generaciones anteriores, mientras que Morgan Stanley estimó las ventas de TPU en unos 9.000 millones de dólares en el segundo semestre de 2026, 84.000 millones de dólares en 2027 y 108.000 millones de dólares en 2028.

Por su parte, Meta desarrolla la serie MTIA para cargas de trabajo de sistemas de recomendación y, posteriormente, de entrenamiento e inteligencia generativa, mientras que Cerebras presentó el chip CS-4, del que afirma que duplica la velocidad de tokens por usuario frente a CS-3 y alcanza hasta diez veces más throughput por vatio. AMD también presentó la unidad MI455x y el sistema Helios, y su cuota de la capacidad instalada mundial, según el artículo, aumentó del 0% al 6%, aunque en la presentación mencionada no había un esquema de rendimiento para una prueba de inteligencia artificial específica.

¿Qué significa esto para los fabricantes de GPU?

Lectura de certi.news: los datos no apuntan a un final inminente de las GPU, sino a un desplazamiento de la competencia desde el rendimiento del chip general hacia la eficiencia del sistema completo, la disponibilidad de energía, memoria y fabricación, y la capacidad del hardware para atender cargas de trabajo específicas. La flexibilidad de las GPU seguirá siendo una ventaja importante para los clientes que ejecutan modelos y cargas de trabajo diversos, mientras que los chips personalizados pueden imponerse cuando las cargas de trabajo de una empresa son lo bastante conocidas y estables como para justificar un diseño propio.

Tate propone que Nvidia estudie el desarrollo de chips separados para entrenamiento e inferencia en lugar de depender de un único diseño general, y que Nvidia y AMD adopten tecnologías de interconexión óptica como optical circuit switching y co-packaged optics a medida que el cobre se aproxima a sus límites prácticos. Sin embargo, aclara que algunas de estas propuestas son opiniones analíticas y que forma parte de los consejos de administración de dos empresas que trabajan en tecnologías de interconexión óptica, por lo que deben considerarse recomendaciones del autor del material y no hechos independientes.

La conclusión que presenta el autor es que Nvidia posee grandes barreras defensivas, pero se enfrenta a clientes con recursos enormes y un incentivo directo para ejecutar sus modelos en su propio hardware. Si Jalapeño demuestra en el despliegue en producción un rendimiento similar o superior al de Vera Rubin, será un indicio sólido de que el dominio de las GPU se ha convertido en objeto de competencia real, y no solo en una posibilidad teórica.

Fuente de la noticia
Semiconductor Engineering
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias