Intelligence artificielle

PrismML compresse un modèle de raisonnement à 5,9 gigaoctets pour l’exécuter localement

PrismML a lancé le modèle Bonsai 2 27B, qui compresse le modèle Qwen3.8 27B à 5,9 gigaoctets tout en conservant 98 % de ses résultats aux tests de référence, rapprochant ainsi l’exécution de modèles de raisonnement avancés des ordinateurs et peut-être des téléphones haut de gamme. L’entreprise mise sur des poids ternaires pour réduire les besoins en mémoire sans perte importante de performances.

2026-09-17
4 min de lecture
2 vues
فريق تحرير certi.news
PrismML compresse un modèle de raisonnement à 5,9 gigaoctets pour l’exécuter localement

La start-up d’intelligence artificielle PrismML a lancé son modèle Bonsai 2 27B, qui compresse le modèle open source Qwen3.8 27B d’Alibaba en un fichier de seulement 5,9 gigaoctets. L’entreprise affirme que le modèle compressé atteint 98 % des scores agrégés du modèle original aux tests de référence, tout en réduisant les besoins en mémoire d’environ neuf à dix fois.

Cette nouvelle taille rend l’exécution du modèle possible sur un ordinateur personnel, voire sur un smartphone haut de gamme, au lieu de dépendre entièrement de serveurs cloud. Cela ne signifie pas que tous les téléphones pourront l’exécuter concrètement, car la source évoque la compatibilité avec les téléphones sous forme d’hypothèse, et les performances réelles dépendent du matériel et des logiciels associés à l’exécution du modèle.

Comment fonctionne la technologie de compression ?

PrismML s’appuie sur ce qu’elle appelle des poids ternaires. Les poids d’un modèle sont les valeurs qui stockent une partie des informations qu’il apprend pendant l’entraînement et nécessitent généralement 16 bits par poids, selon les explications de l’entreprise. La nouvelle approche représente chaque poids par l’une de trois valeurs seulement : plus un, moins un ou zéro. La réduction du nombre de valeurs possibles diminue fortement l’espace nécessaire au stockage du modèle.

L’entreprise est dirigée par Babak Hassibi, professeur au Caltech et spécialiste des techniques de compression, tandis qu’Ion Stoica y intervient comme conseiller. Parmi ses soutiens figurent Khosla Ventures, Cerberus Capital et Caltech. PrismML a levé un tour de financement d’amorçage de 22,25 millions de dollars. Elle n’est pas la seule entreprise à travailler sur la compression des grands modèles de langage : la source cite également Multiverse Computing comme concurrent dans ce domaine.

De meilleurs résultats que la version précédente

Bonsai 2 représente une amélioration par rapport à la première version de Bonsai, lancée par l’entreprise en mars et qui avait atteint 95 % des scores du modèle original, selon ce que TechCrunch a rapporté au sujet de l’entreprise. PrismML affirme que la première version a été téléchargée plus de 11 millions de fois, tandis que ses modèles plus petits ont enregistré 2,6 millions de téléchargements supplémentaires.

Mais le taux de 98 % ne signifie pas une correspondance parfaite avec le modèle original et ne prouve pas à lui seul que l’écart restant ne se manifestera pas dans les usages pratiques. Hassibi reconnaît que la compression laissera probablement une certaine empreinte sur les performances. En outre, les tests de référence ne reflètent pas toutes les tâches réelles, et l’environnement logiciel dans lequel le modèle fonctionne influence également sa précision.

Pourquoi cette évolution est-elle importante ?

Si PrismML continue à réduire la taille des modèles tout en préservant la majeure partie de leurs capacités, l’exécution locale de modèles de raisonnement pourrait devenir plus réalisable. Cela permettrait de traiter les données sur l’appareil de l’utilisateur plutôt que de les envoyer vers le cloud, ce qui pourrait renforcer la confidentialité et réduire la dépendance à une connexion externe, selon l’argument avancé par Stoica. Cela ne répond toutefois pas encore aux questions concernant la consommation d’énergie, la vitesse de réponse et la compatibilité des appareils, et ne prouve pas que le modèle offrira le même niveau de performances dans tous les scénarios.

L’entreprise prévoit d’appliquer sa technologie de compression à des modèles beaucoup plus grands. Hassibi a déclaré que les prochaines versions pourraient atteindre plusieurs centaines de milliards de paramètres au cours des prochains mois. Il estime que les modèles plus grands pourraient offrir à la compression une marge plus large pour préserver leurs capacités, mais cet objectif reste un projet futur et non un résultat disponible à ce jour. Le rapport a également évoqué des rumeurs de discussions avec Apple, mais Hassibi a refusé de les commenter : il n’est donc pas possible de les considérer comme un partenariat ou un accord annoncé.

Source de l’actualité
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités