Opiniones y análisis

GLM-5.3-Flash pone a prueba la economía de operar modelos de inteligencia artificial

Parviz Syed Mohammed considera que el modelo GLM-5.3-Flash de Z.ai obliga a replantear la distribución de las cargas de trabajo de inteligencia artificial gracias a su bajo coste y sus pesos abiertos. Propone dividir las tareas en tres niveles de gasto y orientar aproximadamente el 45 % del volumen de tareas hacia el modelo de bajo coste después de probarlo en la práctica.

2026-08-26
7 min de lectura
11 visitas
فريق تحرير certi.news
GLM-5.3-Flash pone a prueba la economía de operar modelos de inteligencia artificial

Parviz Syed Mohammed considera que revelar la identidad del misterioso modelo Ox Alpha muestra una transformación importante en el mercado de la inteligencia artificial: la comparación entre modelos ya no gira únicamente en torno al máximo nivel de inteligencia, sino a cuánta inteligencia obtiene una organización por cada dólar. El 26 de agosto, Z.ai reveló que el modelo que apareció en OpenRouter era GLM-5.3-Flash y que se había ejecutado deliberadamente ante tráfico público antes de anunciar su identidad.

El modelo había llamado la atención de aficionados y desarrolladores independientes porque ofrecía un buen rendimiento sin coste al principio, lo que llevó a procesar varios billones de tokens al día, mientras que las estimaciones de la comunidad sobre el volumen de uso durante una semana oscilaron entre cifras de un solo dígito y más de 20 billones de tokens. Lo más importante, según el artículo, es que el servicio dependía por completo de chips y de infraestructura chinos, no de un laboratorio estadounidense, como algunos observadores habían supuesto durante los seis días previos a la revelación.

El precio reorganiza la comparación

El precio anunciado para GLM-5.3-Flash es de 15 centavos por entrada y 50 centavos por salida por cada millón de tokens. OpenRouter ofrece un descuento del 50 % hasta el 9 de septiembre, con lo que el precio pasa a ser de 7,5 centavos por entrada y 25 centavos por salida. Además, los pesos del modelo son abiertos bajo una licencia MIT, mientras que la inferencia la alojan entidades como Z.ai, GMI Cloud, Cloudflare y otros proveedores en Estados Unidos.

Según la comparación de Artificial Analysis, en la que el modelo fue incluido ese mismo día, GLM-5.3-Flash obtuvo una puntuación de 57 en el índice de inteligencia frente a unos nueve centavos por tarea. En cambio, GPT-5.6 Sol (max) alcanza una puntuación aproximada de 59 por 67 centavos por tarea, mientras que Grok 4.6 registra 61 por 94 centavos. El autor calcula que una diferencia de solo dos puntos entre los dos primeros modelos implica un precio aproximadamente 7,4 veces mayor, mientras que una diferencia de unos cuatro puntos requiere casi diez veces el coste.

Estas cifras no constituyen un juicio general sobre la calidad de los modelos ni sustituyen las pruebas específicas de cada organización, pero ilustran el argumento principal del artículo: cuando los modelos se aproximan entre sí en los indicadores de rendimiento, el coste de inferencia puede convertirse en un factor decisivo para determinar el volumen de uso, especialmente en programación, agentes y tareas repetitivas.

La presión sobre los presupuestos precede a la decisión de abandonar la inteligencia artificial

El autor cita a Uber para explicar el problema. The Information informó en abril de que el director de tecnología, Praveen Neppalli Naga, había declarado que el presupuesto anual de programación previsto para 2026 se consumió en cuatro meses y que una demostración de dos horas le costó personalmente 1.200 dólares. Para junio, Uber había establecido un límite de 1.500 dólares por persona y por herramienta.

Eso no significa que las herramientas carezcan de utilidad; el artículo distingue entre «utilidad» y «valor». El autor señala que Andrew Macdonald, director de operaciones de Uber, no pudo vincular los paneles de control con un aumento del 25 % en el número de funcionalidades útiles para los consumidores. Asimismo, los resultados de una encuesta de McKinsey de 2026, tal como los recoge la fuente, indican que el 80 % de los participantes afirmó haberse vuelto más rápido y que el 37 % de las empresas observó un efecto en el beneficio antes de intereses e impuestos, mientras que el 32 % de las empresas superó la compra de al menos un programa porque pudo desarrollar la funcionalidad internamente mediante agentes de programación.

La lectura editorial aquí es que las organizaciones afrontan una doble ecuación: quieren reducir la factura, pero no pueden simplemente detener sus inversiones en inteligencia artificial. Por ello, el debate pasa de «¿usamos inteligencia artificial?» a una pregunta más práctica: ¿qué modelo utiliza cada equipo, para qué tipo de tareas y con qué métrica de éxito?

Tres niveles en lugar de un solo modelo

Mohammed propone distribuir las tareas de programación y de trabajo con agentes en tres niveles, contabilizando la proporción de tareas y tokens, no la proporción del gasto financiero. En el nivel superior se encuentran los modelos Fable y Opus para decisiones irreversibles, análisis de estrategias y planes de ejecución detallados; el autor estima que estas tareas no superan el 5 % del volumen de trabajo.

El nivel intermedio incluye Kimi K3, Gemini 3.7 Flash, GPT-5.6 Sol y Grok 4.6, todos los cuales, según la fuente, rondan una puntuación de 60 en el índice de inteligencia. Propone asignarles aproximadamente el 50 % del volumen de tareas, especialmente la programación diaria y el trabajo habitual. Señala que Kimi goza de popularidad en programación, mientras que Grok 4.6 se sitúa cerca de él, aunque su menor tamaño de contexto sigue siendo una limitación.

El 45 % restante se asignaría, según la propuesta del autor, a GLM-5.3-Flash como modelo para trabajos de gran volumen. Sin embargo, este porcentaje no es una receta fija: la herramienta utilizada para ejecutar los modelos, la combinación de tareas de programación, contenido y marketing, y los resultados de la evaluación interna son los factores que deben determinar la distribución real.

¿Qué debería medirse antes de rehacer el presupuesto?

El artículo concluye que los modelos chinos con pesos abiertos, como los modelos de Zhipu, Qwen y DeepSeek, entre otros, deben incorporarse explícitamente a los cálculos de costes, no excluirse simplemente por su origen. Señala que la cuota de tokens de los modelos chinos en OpenRouter superó la de los modelos estadounidenses a principios de junio y que la parte alta de la lista siguió estando ocupada en su mayoría por laboratorios chinos.

Antes de la oleada de lanzamientos prevista de Google, xAI, Anthropic, OpenAI y DeepSeek en septiembre, el autor propone contabilizar el consumo de tokens y vincular el gasto con un indicador claro, como el crecimiento de clientes o de ingresos, o al menos con la velocidad de desarrollo y la productividad. También insta a preparar un presupuesto de inteligencia artificial para cada organización o equipo y, después, definir una política de modelos por niveles: un modelo de alto nivel para decisiones estratégicas, uno intermedio para las plazas de pago y la programación diaria, y uno de bajo coste para tareas intensivas y repetitivas.

La opinión del autor no demuestra que GLM-5.3-Flash vaya a ser la mejor opción para todas las organizaciones ni que los indicadores de comparación generales reflejen el rendimiento en todos los contextos. Pero ofrece un criterio práctico para la revisión: no todas las solicitudes deberían recibir el modelo más caro disponible, del mismo modo que no debería adoptarse el modelo más barato sin evaluaciones y métricas de valor claras. La pregunta abierta que deja el artículo es si las curvas de coste y rendimiento mantendrán esta tendencia después de la llegada de los nuevos lanzamientos y si las empresas de inteligencia artificial capaces de reducir el coste de inferencia lograrán realmente captar la mayor parte del volumen de uso.

Fuente de la noticia
VentureBeat Startups & Funding
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias