L’entreprise TypeSafe AI a lancé le modèle Jev, un modèle d’intelligence artificielle fondé sur l’architecture Transformer, mais qui n’appartient pas à la catégorie des grands modèles de langage et ne produit pas de texte destiné à l’utilisateur. À la place, le modèle renvoie des probabilités correspondant à ce que l’entreprise appelle des « décisions calibrées », après que le développeur a défini à l’avance les types de sorties requis.
L’entreprise est dirigée par Diogo Almeida, ancien chercheur chez OpenAI qui a participé à la conception de ChatGPT et contribué au développement de la technique d’apprentissage par renforcement à partir de retours humains (RLHF). Selon Almeida, les modèles d’intelligence artificielle se sont largement concentrés sur l’amélioration de la gestion du langage humain, alors que l’automatisation logicielle a besoin de sorties plus disciplinées et directement exploitables par l’ordinateur.
Une vitesse accrue et un coût réduit
TypeSafe AI affirme que l’absence de génération de langage rend Jev rapide et peu coûteux, tout en réduisant le risque d’hallucination, puisque l’utilisateur définit à l’avance les résultats possibles. L’entreprise ne facture pas les tokens de sortie, tandis que les tokens d’entrée sont mesurés en milliards plutôt qu’en millions, selon l’article source.
Le modèle a rapidement attiré l’attention des développeurs, au point que son interface de programmation d’application a temporairement cessé de servir les utilisateurs en raison d’une forte demande. Lors d’un test mené par Vercel pour classer des commandes en vue d’un examen de sécurité, le remplacement d’un modèle d’OpenAI par Jev a produit des résultats entre cinq et 18 fois plus rapides, avec une précision supérieure, selon l’ingénieur logiciel Pranit Sharma.
Lors d’un autre test portant sur la classification de courriels commerciaux, Nikhil Mudholkar, directeur technique de Bryo AI, a constaté que Gemini était légèrement plus précis, mais coûtait entre 10 et 20 fois plus cher. Mudholkar a estimé que les scores de confiance renvoyés par Jev étaient plus importants pour l’automatisation, car ils fournissent une probabilité utilisable pour décider s’il convient d’exécuter une action ou de l’ignorer.
Qu’est-ce qui change concrètement ?
Ces utilisations montrent que Jev ne vise pas nécessairement à remplacer les modèles de langage dans toutes les tâches. Il peut prendre en charge la classification, l’orientation des requêtes vers le modèle approprié, la surveillance des effets des agents d’intelligence artificielle ou la détection des tentatives de contournement des restrictions. Dans ces scénarios, sa rapidité et son faible coût peuvent rendre la surveillance en temps réel plus pratique.
Toutefois, le recours aux probabilités n’élimine pas le besoin de jugement humain ni celui de règles opérationnelles. Armin Ronacher, directeur technique d’Earendil, a indiqué que l’utilisateur devait définir la manière de traiter un score de 50 % ou de 95 %, c’est-à-dire établir des seuils clairs avant de convertir les sorties en actions automatisées. Une partie de la responsabilité liée à la gestion de l’incertitude passe ainsi du modèle à la conception de l’application.
Une architecture non divulguée et une concurrence attendue
TypeSafe AI n’a pas révélé les détails de l’architecture de Jev, tandis que des observateurs externes soupçonnent qu’il pourrait être fondé sur un modèle de langage à poids ouverts, ce que l’entreprise n’a pas confirmé dans l’article. TypeSafe AI décrit le modèle comme un « modèle System One » axé sur l’intuition et la sélection de la tâche appropriée, et affirme qu’il a été entraîné exclusivement sur des données synthétiques à l’aide d’une technique qu’elle appelle « l’apprentissage par renforcement à partir de décisions calibrées ».
Selon une analyse de certi.news, l’importance de Jev ne réside pas seulement dans le fait qu’il s’agit d’un nouveau modèle, mais aussi dans la manière dont il présente l’intelligence artificielle comme une couche décisionnelle spécialisée intégrée aux logiciels, plutôt que comme une interface conversationnelle générale. Si les résultats des tests mentionnés sont exacts, cette approche pourrait convenir aux tâches répétitives produisant des sorties définies. Toutefois, les comparaisons publiées restent limitées et ne suffisent pas à elles seules pour évaluer les performances dans différents domaines ou types de charge de travail. De plus, le manque de clarté concernant l’architecture et la méthode de production des données laisse ouvertes des questions sur la vérifiabilité et la capacité de mise à l’échelle.
TypeSafe AI prévoit de créer d’autres versions du modèle selon différents modes, et Ronacher s’attend à voir apparaître des concurrents une fois l’utilité pratique de ce type de modèles mieux établie.