Liquid AI a annoncé la mise à disposition des modèles LFM2.5-2.6B et LFM2.5-2.6B-Base sur Hugging Face, afin d’exécuter des agents d’intelligence artificielle localement sur les appareils plutôt que de dépendre entièrement de l’inférence dans le cloud. Selon l’entreprise, le modèle prend en charge l’appel d’outils et les flux de travail en plusieurs étapes, tout en offrant une taille et une vitesse adaptées à une utilisation sur les ordinateurs portables et les téléphones.
Cette version cible les développeurs qui ont besoin de déployer des agents à grande échelle, tout en conservant les données sur l’appareil et en réduisant leur dépendance à une facture d’inférence dans le cloud. Liquid AI affirme que le modèle rivalise avec des modèles environ quatre fois plus grands que lui dans l’utilisation d’outils, le suivi des instructions et les tâches d’agents en plusieurs étapes.
Un entraînement personnalisé pour les tâches d’agents
LFM2.5-2.6B a été préentraîné sur environ 34 000 milliards de tokens, et la phase d’entraînement intermédiaire a inclus l’extension de la fenêtre de contexte à 128 000 tokens. Le modèle a ensuite suivi quatre étapes pour passer d’un modèle de base à un agent capable de gérer des outils et des tâches successives.
- Affinage supervisé : deux cycles d’entraînement fortement axés sur les données d’utilisation des outils, la recherche sur le Web et les parcours de travail des agents.
- Spécialisation des enseignants : entraînement d’un modèle enseignant spécialisé pour chaque domaine, comme les mathématiques, la programmation et l’utilisation d’outils.
- Distillation multidomaine : transfert des capacités des modèles spécialisés vers un modèle unique.
- Apprentissage par renforcement agentique : exécution d’un entraînement en plusieurs cycles au sein de véritables frameworks d’agents, afin que le modèle apprenne à gérer différents outils, les instructions système et les environnements de tâches en plusieurs étapes.
L’écosystème d’apprentissage par renforcement agentique sépare l’amélioration du modèle, l’inférence et l’exécution des environnements. Le système utilise le moteur d’entraînement pour améliorer le modèle et le moteur de déploiement pour générer les actions avec la politique la plus récente, tandis que le framework de renforcement coordonne les opérations d’entraînement ainsi que la collecte des trajectoires et des récompenses. Les actions sont exécutées au sein d’un service Sandbox, où Blackbox Harness héberge l’agent et coordonne ses interactions avec l’environnement de la tâche, sans nécessiter de modification des frameworks pris en charge.
Résultats des tests et performances
Liquid AI a comparé le modèle à des modèles dont la taille atteint environ quatre fois la sienne, notamment gemma-4-E2B-it, gemma-4-E4B-it, Qwen3.5-4B et Qwen3.5-9B. LFM2.5-2.6B était le plus petit modèle du groupe, mais il est arrivé en tête de tous les tests de suivi des instructions inclus dans la comparaison. Il a également dominé les tests d’utilisation d’outils, à l’exception de BFCLv4, dans lequel Qwen3.5-9B l’a dépassé.
Le modèle a obtenu 80,07 au test Multi-IF, 85,49 à IFStruct, 77,83 à ToolSandbox et 62,85 à la moyenne de Claw-Eval en anglais. Dans les tâches d’agents, il a surpassé les deux modèles Gemma et a maintenu des performances comparables à celles des modèles Qwen, tandis que les modèles plus grands restaient nettement en avance en programmation.
Vitesse d’exécution et disponibilité
Le modèle est compatible dès le premier jour avec plusieurs outils d’inférence, notamment llama.cpp, MLX, vLLM, SGLang et ONNX. L’entreprise affirme que la vitesse de génération atteint 220 tokens par seconde sur une puce Apple M5 Max et 113 tokens par seconde sur un processeur AMD Ryzen AI Max+ 395, avec une exécution du modèle dans moins de 2,5 gigaoctets de mémoire. Elle indique également qu’il est possible d’exécuter des agents capables de fonctionner sur téléphone à une vitesse de 30 tokens par seconde.
Sur les unités de traitement graphique, le modèle atteint environ 15 000 tokens de sortie par seconde en cas de forte concurrence, soit approximativement 1,3 milliard de tokens par jour sur une seule unité H100. Les développeurs peuvent essayer la démonstration WebGPU dans le navigateur ou utiliser le modèle avec des frameworks d’agents locaux comme OpenClaw, Hermes Agent et Pi. Une démonstration d’un agent de recherche fonctionnant sur l’appareil est également disponible.