Suivez les dernières actualités, explications et histoires technologiques associées.
JetBrains a lancé le modèle ouvert Mellum2.1 sous licence Apache 2.0, en mettant l’accent sur l’exécution locale d’agents de programmation et d’agents secondaires, ou sur l’infrastructure propre à l’utilisateur. Cette version repose sur un entraînement par apprentissage par renforcement au sein d’environnements logiciels réels, avec d’importantes améliorations dans la gestion des dépôts de code et la vitesse d’inférence.
Un article de la CNCF estime que l’exploitation d’une infrastructure d’intelligence artificielle d’entreprise ne consiste pas à déployer un seul modèle ou cluster, mais à gérer un parc partagé d’unités GPU pour plusieurs équipes, en équilibrant utilisation, isolation et coûts. L’article présente des couches technologiques comprenant le provisionnement, l’allocation, la planification, les réseaux, le stockage, la supervision et la facturation.
Perplexity a lancé la plateforme Portable Computer pour exécuter localement ses agents sur les appareils des utilisateurs, en commençant par Nvidia DGX Spark et les ordinateurs Linux équipés de cartes RTX disposant d’au moins 24 Go de mémoire. Le système conserve par défaut les modèles, les fichiers et le travail sur l’appareil, avec la possibilité de demander l’autorisation de l’utilisateur avant de transférer une étape précise à un modèle cloud plus puissant.
CohereLabs a lancé le modèle North-Micro-Vision-Instruct, un modèle de vision et de langage à poids ouverts comprenant 2,4 milliards de paramètres et prenant en charge le traitement des images à leur résolution native, sous licence Apache 2.0. Le modèle cible les applications de compréhension des documents et des diagrammes, l’OCR et l’ajustement personnalisé. Il inclut également une prise en charge communautaire de MLX-VLM et une recette AutoModel pour le déploiement sur les unités de traitement graphique de NVIDIA.
Le projet AX-Ray de VIDRAFT présente une méthode d’évaluation des modèles qui va au-delà des scores de performance, après avoir identifié et reproduit des défauts décrits comme une fuite causale dans les modèles Zyphra/Zamba2-1.2B et nvidia/Nemotron-H-8B-Base-8K. Le cadre classe ces cas parmi les défauts empêchant le déploiement, tout en les distinguant des problèmes liés au chemin de service ou à l’interface de programmation d’application.
Liquid AI a annoncé la mise à disposition des modèles LFM2.5-2.6B et LFM2.5-2.6B-Base sur Hugging Face, avec prise en charge de l’appel d’outils et des flux de travail en plusieurs étapes localement. Le modèle vise l’exécution d’agents rapides sur les ordinateurs et les téléphones, avec une consommation inférieure à 2,5 gigaoctets de mémoire.