Parviz Syed Mohammed estime que la révélation de l’identité du mystérieux modèle Ox Alpha illustre une transformation importante du marché de l’intelligence artificielle : la comparaison entre les modèles ne porte plus seulement sur le niveau d’intelligence le plus élevé, mais sur la quantité d’intelligence obtenue par une organisation pour chaque dollar. Le 26 août, Z.ai a révélé que le modèle apparu sur OpenRouter était GLM-5.3-Flash et qu’il avait été délibérément exposé à un trafic public avant que son identité ne soit annoncée.
Le modèle avait attiré l’attention des passionnés et des développeurs indépendants parce qu’il offrait de bonnes performances sans coût au départ, ce qui a entraîné le traitement de plusieurs milliers de milliards de tokens par jour, tandis que les estimations de la communauté concernant le volume d’utilisation sur une semaine allaient de quelques chiffres à plus de 20 000 milliards de tokens. Plus important encore, selon l’article, le service reposait entièrement sur des puces et une infrastructure chinoises, et non sur un laboratoire américain comme certains observateurs l’avaient supposé au cours des six jours précédant la révélation.
Le prix bouleverse la comparaison
Le prix annoncé pour GLM-5.3-Flash est de 15 centimes pour l’entrée et de 50 centimes pour la sortie par million de tokens. OpenRouter propose également une remise de 50 % jusqu’au 9 septembre, ramenant le prix à 7,5 centimes pour l’entrée et à 25 centimes pour la sortie. Les poids du modèle sont en outre ouverts sous licence MIT, tandis que l’inférence est hébergée par des acteurs comprenant Z.ai, GMI Cloud, Cloudflare et d’autres fournisseurs aux États-Unis.
Selon la comparaison d’Artificial Analysis, qui a intégré le modèle le même jour, GLM-5.3-Flash a obtenu un score de 57 sur l’indice d’intelligence pour environ neuf centimes par tâche. En comparaison, GPT-5.6 Sol (max) atteint un score d’environ 59 pour 67 centimes par tâche, tandis que Grok 4.6 obtient un score de 61 pour 94 centimes. L’auteur calcule qu’un écart de seulement deux points entre les deux premiers modèles correspond à un prix environ 7,4 fois supérieur, tandis que l’écart d’environ quatre points exige près de dix fois plus de dépenses.
Ces chiffres ne constituent pas un jugement général sur la qualité des modèles et ne dispensent pas chaque organisation de réaliser ses propres tests, mais ils illustrent l’argument principal de l’article : lorsque les modèles se rapprochent les uns des autres dans les indicateurs de performance, le coût de l’inférence peut devenir un facteur déterminant du volume d’utilisation, notamment dans la programmation, les agents et les tâches répétitives.
La pression sur les budgets précède la décision d’abandonner l’IA
L’auteur cite Uber pour illustrer le problème. The Information a rapporté en avril que, selon le directeur technique Praveen Neppalli Naga, le budget annuel de programmation prévu pour 2026 avait été consommé en quatre mois et qu’une démonstration expérimentale de deux heures lui avait personnellement coûté 1 200 dollars. En juin, Uber avait fixé un plafond de 1 500 dollars par personne et par outil.
Cela ne signifie pas que les outils sont inutiles ; l’article distingue l’« utilité » de la « valeur ». L’auteur rapporte qu’Andrew Macdonald, directeur des opérations chez Uber, n’a pas pu établir de lien entre les outils et une augmentation de 25 % du nombre de fonctionnalités utiles aux consommateurs. Les résultats de l’enquête McKinsey de 2026, tels que cités par la source, indiquent également que 80 % des participants ont déclaré être devenus plus rapides, que 37 % des entreprises avaient observé un effet sur le bénéfice avant intérêts et impôts, tandis que 32 % des entreprises avaient renoncé à acheter au moins un logiciel parce qu’elles pouvaient construire la fonctionnalité en interne au moyen d’agents de programmation.
La lecture éditoriale est ici que les organisations sont confrontées à une double équation : elles veulent réduire la facture, mais ne peuvent pas simplement interrompre leurs investissements dans l’IA. Le débat passe donc de la question « Devons-nous utiliser l’IA ? » à une question plus concrète : quel modèle chaque équipe doit-elle utiliser, pour quel type de tâches et avec quelle mesure de la réussite ?
Trois niveaux plutôt qu’un seul modèle
Mohammed propose de répartir les tâches de programmation et le travail agentique sur trois niveaux, en calculant la part des tâches et des tokens, et non la part des dépenses financières. Au niveau supérieur se trouvent les modèles Fable et Opus pour les décisions irréversibles, l’analyse des stratégies et les plans d’exécution détaillés ; l’auteur estime que ces tâches ne représentent pas plus de 5 % du volume de travail.
Le niveau intermédiaire comprend Kimi K3, Gemini 3.7 Flash, GPT-5.6 Sol et Grok 4.6, qui, selon la source, tournent tous autour d’un score de 60 sur l’indice d’intelligence. Il propose d’y consacrer environ 50 % du volume des tâches, notamment la programmation quotidienne et le travail habituel. Il indique que Kimi est populaire pour la programmation, tandis que Grok 4.6 s’en rapproche, sa fenêtre de contexte plus réduite demeurant toutefois une contrainte.
Les 45 % restants sont attribués, dans la proposition de l’auteur, à GLM-5.3-Flash, en tant que modèle destiné aux travaux à grande échelle. Toutefois, cette proportion ne constitue pas une recette fixe ; c’est l’outil utilisé pour exécuter les modèles, la combinaison des tâches entre programmation, contenu et marketing, ainsi que les résultats de l’évaluation interne, qui doivent déterminer la répartition effective.
Que faut-il mesurer avant de reconstruire le budget ?
L’article conclut que les modèles chinois à poids ouverts, tels que les modèles de Zhipu, Qwen, DeepSeek et d’autres, doivent être explicitement intégrés aux calculs de coûts, et non écartés simplement en raison de leur origine. Il indique que la part des modèles chinois dans les tokens sur OpenRouter a dépassé celle des modèles américains au début du mois de juin et que le haut du classement est resté majoritairement occupé par des laboratoires chinois.
Avant la vague de sorties attendues de Google, xAI, Anthropic, OpenAI et DeepSeek en septembre, l’auteur propose de recenser la consommation de tokens et de relier les dépenses à un indicateur clair, comme la croissance du nombre de clients ou des revenus, ou au minimum la vitesse de développement et la productivité. Il appelle également à établir un budget d’IA au niveau de chaque organisation ou équipe, puis à définir une politique de modèles par niveaux : un modèle haut de gamme pour les décisions stratégiques, un modèle intermédiaire pour les sièges payants et la programmation quotidienne, et un modèle bas de gamme pour les tâches intensives et répétitives.
Le point de vue de l’auteur ne prouve pas que GLM-5.3-Flash sera le meilleur choix pour chaque organisation, ni que les indicateurs de comparaison généraux reflètent les performances dans tous les contextes. Il fournit toutefois un critère pratique de révision : chaque requête ne devrait pas recevoir le modèle le plus coûteux disponible, pas plus qu’il ne faudrait adopter le modèle le moins cher sans évaluations ni indicateurs de valeur clairs. La question ouverte laissée par l’article est de savoir si les courbes de coût et de performance resteront orientées de cette manière après l’arrivée des nouvelles sorties, et si les entreprises d’IA capables de réduire le coût de l’inférence s’empareront effectivement de la majeure partie du volume d’utilisation.