Intelligence artificielle

Qwen3.8-27B rapproche les modèles d’IA avancés de l’exécution locale

Le modèle ouvert Qwen3.8-27B d’Alibaba offre des capacités multimodales, de codage et d’agents logiciels dans un format pouvant être exécuté localement après compression à environ 17 gigaoctets. Malgré de solides indicateurs de performance, sa forte consommation de tokens et la lenteur de l’inférence imposent un arbitrage pratique entre qualité et vitesse.

2026-08-17
8 min de lecture
12 vues
فريق تحرير certi.news
Qwen3.8-27B rapproche les modèles d’IA avancés de l’exécution locale

Alibaba a lancé le modèle Qwen3.8-27B sur la plateforme Hugging Face vendredi, sous licence open source Apache 2.0, permettant ainsi aux développeurs de télécharger ses poids, de les examiner, de les modifier et de l’exécuter indépendamment des interfaces de modèles cloud. L’importance de cette publication ne tient pas uniquement à ses 27 milliards de paramètres, mais aussi à sa capacité à combiner la compréhension des images et des vidéos, un contexte pouvant atteindre 262 144 tokens, un raisonnement réglable, ainsi que la prise en charge des tâches de programmation et des flux de travail d’agents logiciels.

La source décrit le modèle comme une version compacte et facile à déployer des capacités de la génération Qwen3.8. La version en précision 16 bits nécessite environ 56 gigaoctets de mémoire GPU, tandis que la version FP8 en demande près de 28 gigaoctets. Après compression en 4 bits, le modèle lui-même ne pèse plus qu’environ 17 gigaoctets, ce qui le rend exécutable sur des appareils grand public haut de gamme, comme un puissant ordinateur de jeu ou un ordinateur portable bien équipé.

De grandes capacités dans un format plus compact

La combinaison entre performances et taille a été l’une des principales raisons de l’ampleur des réactions des développeurs et des utilisateurs avancés de l’IA. Lors du lancement, Alibaba a présenté de solides résultats dans plusieurs évaluations : le modèle a obtenu 61,7 à SWE-bench Pro, 90,3 à LiveCodeBench v6, 70,7 à CoWorkBench et 84,3 à OSWorld-Verified.

Dans le tableau comparatif publié par l’entreprise, Qwen3.8-27B a dépassé le résultat indiqué pour Claude Opus 4.6 Max aux tests SWE-bench Pro et LiveCodeBench, tandis que Claude est resté en tête à Terminal-Bench, GPQA Diamond et Humanity’s Last Exam. Ces résultats ne suffisent toutefois pas à déclarer un vainqueur toutes catégories confondues : certaines évaluations d’Alibaba sont internes, et les outils de test ainsi que les méthodes de mesure ne sont pas nécessairement identiques pour tous les modèles.

Des résultats indépendants ultérieurs ont donné un nouvel élan à cette publication. Artificial Analysis lui a attribué une note de 52 à l’Intelligence Index, un indicateur composite regroupant neuf évaluations de programmation, de sciences, de raisonnement et de tâches professionnelles. Cette note est égale à celle actuellement attribuée par l’indice à GPT-5.6 Luna d’OpenAI avec le niveau de raisonnement maximal, un modèle propriétaire accessible uniquement via le cloud. Qwen3.8-27B a également obtenu 51 à l’Agentic Index, devançant Claude Opus 4.8 avec le niveau d’effort de raisonnement maximal.

Ces comparaisons ne signifient pas que les modèles sont parfaitement équivalents, mais elles expliquent l’intérêt des développeurs. Cline, un agent logiciel open source, a décrit ce résultat comme la première fois qu’un modèle local enregistrait des capacités proches de celles des modèles de pointe. Joshua “Xenova” Lochner a également testé l’exécution du modèle à l’aide de noyaux WebGPU personnalisés, ce qui souligne la possibilité de l’intégrer dans différents environnements d’exécution.

Que permet concrètement l’exécution locale ?

Simon Willison a testé une version compressée d’environ 17 gigaoctets, au format Q4_K_M, sur un MacBook Pro équipé d’un processeur M5 Max et sur un Nvidia DGX Spark. Dans ses expériences, le modèle a pu écrire du code, comprendre des images et exécuter une boucle d’agent logiciel via le framework Pi agent. Il a également navigué dans une base de code pour expliquer le fonctionnement de l’authentification, puis écrit et testé un outil Python convertissant le journal d’un agent au format JSONL en Markdown.

Ces expériences illustrent la différence pratique entre un modèle accessible uniquement via une API et un fichier pouvant être conservé sur une station de travail. Le développeur peut exécuter et modifier le modèle, et le maintenir au sein de sa propre infrastructure, au lieu d’envoyer les données à un fournisseur externe. Cela ouvre des possibilités en matière de confidentialité, de sécurité de l’information, de gouvernance et de contrôle du déploiement, sans signifier automatiquement que le modèle convient à chaque tâche ni que son exécution sera rapide.

L’intérêt s’est également reflété dans le taux d’utilisation : Cybernews a indiqué que le modèle avait dépassé 3 millions de téléchargements depuis Hugging Face au cours de ses trois premiers jours, tandis que des versions compressées compatibles avec les outils d’inférence locale sont rapidement apparues. La communauté LocalLLaMA sur Reddit a créé un sujet consacré au rassemblement des résultats de tests, des versions compressées, des instructions de configuration et des comparaisons.

La qualité a un coût en temps

La principale limite de Qwen3.8-27B est sa tendance à trop réfléchir. Selon Artificial Analysis, le modèle a généré 160 millions de tokens de sortie lors des tests de l’Intelligence Index, contre une médiane de 43 millions de tokens pour des modèles open source à poids ouverts comparables. La source relie ce phénomène au réglage de raisonnement par défaut xhigh ; lors d’une expérience de Willison, la création d’un dessin SVG représentant un cygne à bicyclette a pris 21 minutes et consommé plus de 22 000 tokens de raisonnement. Il a donc recommandé de commencer une utilisation ordinaire avec un raisonnement faible ou désactivé.

Tomasz Tunguz a constaté un compromis similaire lors d’un petit test portant sur neuf tâches, comparé à DeepSeek V4 Flash. Lorsque le raisonnement était activé, Qwen s’est montré légèrement meilleur en qualité dans le système d’agent utilisé, mais il était environ 30 fois plus lent et 4,5 fois plus coûteux, tout en rappelant que neuf tâches ne suffisent pas à trancher le résultat.

Les logiciels d’inférence pourraient contribuer à réduire l’écart. Le modèle intègre la technologie Multi-Token Prediction, et Willison a fait état d’une amélioration des performances d’environ 72 % sur le DGX Spark après son activation via llama.cpp, par rapport à la configuration par défaut de LM Studio. Malgré cela, ses exécutions habituelles via LM Studio produisaient entre 15 et 30 tokens par seconde, une vitesse nettement inférieure à la réactivité de nombreux modèles hébergés.

Qu’est-ce que cela signifie pour les entreprises ?

La comparaison la plus importante pour les organisations n’est pas de savoir si un modèle de 27 milliards de paramètres dépasse Claude ou GPT dans un seul tableau, mais s’il peut effectuer localement suffisamment de programmation, d’analyse de documents, de compréhension visuelle et de tâches agentiques pour remplacer les appels d’API dans des catégories opérationnelles de travail. Grâce à la licence Apache 2.0, les poids peuvent être examinés, modifiés et hébergés derrière les contrôles de l’entreprise, tandis qu’Alibaba documente sa compatibilité avec les frameworks vLLM, SGLang et TokenSpeed.

Alibaba affirme qu’une version gérée de Qwen Cloud arrivera ultérieurement, avec un contexte par défaut d’un million de tokens et des outils intégrés. Mais la valeur actuelle de Qwen3.8-27B réside dans l’option d’un déploiement local moins dépendant de l’infrastructure cloud. Une vérification indépendante plus poussée de ses résultats reste nécessaire, et la lenteur de l’inférence pourrait limiter son utilité dans les interactions en temps réel. La publication ne prouve donc pas que les modèles locaux ont atteint une équivalence générale avec les modèles de pointe, mais elle montre que des capacités récemment associées à des services coûteux peuvent désormais être exécutées à partir d’un fichier plus compact sur du matériel appartenant à l’utilisateur.

Source de l’actualité
VentureBeat Startups & Funding
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités