Elon Musk anunció que Grok Bot elegirá el modelo de inteligencia artificial más adecuado para cada tarea, en lugar de depender siempre de Grok. Musk escribió que SpaceX utilizará «el mejor modelo de backend» para lograr el mejor resultado, y mencionó Claude Opus 5.5, MidJourney, Suno y otras interfaces entre las opciones posibles.
Grok Bot es un producto conjunto de SpaceXAI, el laboratorio de inteligencia artificial de Musk que se integró en SpaceX, y Cursor. SpaceX había acordado en junio comprar Cursor por 60.000 millones de dólares en acciones, y la operación se cerró en agosto. Grok Bot se lanzó en versión beta durante el mismo mes.
La clasificación de modelos se convierte en una forma de reducir costes
El artículo describe este enfoque como «clasificación de modelos»: dirigir cada solicitud al modelo que mejor se adapte al tipo de trabajo y a su coste, reservando los modelos más caros para las tareas más complejas. Según entrevistas realizadas por el autor con líderes de 22 empresas durante el evento ScaleUp:AI de Insight Partners, al menos diez de ellos afirmaron seguir este enfoque.
En un ejemplo, una empresa de seguridad utiliza primero un motor de reglas para examinar los datos y luego pasa lo que queda a modelos pequeños. Uno de sus responsables afirmó que pasar un petabyte de datos por cualquier modelo, incluso uno pequeño, podría costar millones de dólares. En otro ejemplo, se utiliza un modelo de bajo coste para comprender la solicitud del usuario antes de derivarla a un modelo más caro para ejecutar la tarea.
El principal motivo es controlar el gasto en tokens. Algunas empresas comenzaron con presupuestos abiertos para inteligencia artificial, pero después volvieron a una pregunta más precisa: ¿qué compraron realmente a cambio de todos esos tokens? Otras empresas también intentan formar a sus empleados para que elijan el modelo adecuado, en lugar de utilizar automáticamente el modelo más potente.
Los modelos más baratos se encargan de la mayor parte del volumen
Los datos de OpenRouter, un servicio que permite acceder a cientos de modelos mediante una única conexión, reflejan esta tendencia. En la semana que terminó el 7 de octubre de 2026, cuatro modelos Flash de bajo coste y alta velocidad figuraron entre los diez modelos más utilizados por número de tokens. DeepSeek V4.1 Flash encabezó la lista con 33,6 billones de tokens, seguido de GLM 5.3 Flash con 10,5 billones y MiMo-V2.6-Flash con 10,1 billones.
En cambio, el uso de Claude Opus 5.5 creció un 74 % en una semana hasta alcanzar 3,37 billones de tokens, pero permaneció en el noveno puesto por volumen. El artículo explica que el modelo avanzado está recibiendo una proporción cada vez mayor de las tareas, sin asumir la mayor parte del tráfico de uso.
Los resultados mencionados en las pruebas de The New Stack indican que los modelos más baratos pueden ser suficientes en muchos casos: Claude Sonnet 5.5 superó las 15 pruebas de programación con un coste un 42 % inferior al de Opus 5.5, mientras que GPT-6.1 Sol igualó la precisión de GPT-6 Astra con un coste equivalente al 18 % de esta.
¿Qué cambia en la práctica?
El cambio no significa que el modelo más potente haya dejado de ser necesario, sino que su elección se ha convertido en una decisión operativa que requiere orientación y pruebas. El artículo advierte sobre los riesgos de cambiar rápidamente; un equipo de ingeniería fracasó después de sustituir un modelo por otro antes de una presentación importante y tuvo que revertir el cambio. La conclusión fue la necesidad de utilizar pruebas de evaluación antes de cambiar de modelo.
Los datos de OpenRouter siguen siendo un indicador, no una medición completa del mercado, porque reflejan a usuarios de un servicio que ya eligieron utilizar un enrutador de modelos. Además, el número de tokens no mide la cantidad de usuarios ni el gasto, y los contratos empresariales pueden ser más estables. Sin embargo, la coincidencia de este indicador con las prácticas de las empresas incluidas en las entrevistas y con el anuncio de Grok Bot deja claro que la fidelidad a un único modelo está retrocediendo en favor de una arquitectura que elige el modelo según la tarea y el coste.