CohereLabs a annoncé le lancement de North-Micro-Vision-Instruct, un modèle de vision et de langage à poids ouverts comprenant 2,4 milliards de paramètres et prenant en charge l’entrée d’images à leur résolution native, sous licence Apache 2.0. L’entreprise affirme qu’il s’agit de son plus petit modèle de vision et de langage à ce jour, conçu pour servir de base compacte à des applications multimédias spécialisées.
Le modèle et ses poids sont disponibles sur Hugging Face dans le dépôt CohereLabs/North-Micro-Vision-Instruct. La prise en charge générale de vLLM est encore en préparation, tandis que CohereLabs a utilisé une version interne de vLLM lors de ses évaluations.
Accent sur les documents et les images à leur résolution native
North Micro Vision conserve le rapport hauteur-largeur de l’image ainsi que ses détails fins, au lieu de réduire d’abord chaque image à un petit carré. Cela permet de traiter les petits textes, les mises en page de documents, les tableaux, les diagrammes, les captures d’écran et les formulaires. L’entraînement couvre également plusieurs langues et domaines visuels, notamment les documents, les diagrammes et les images naturelles.
Ces capacités ciblent les développeurs qui ont besoin d’un modèle pouvant être ajusté à des domaines visuels spécifiques ou exécuté dans des environnements locaux et en périphérie soumis à des contraintes. CohereLabs indique qu’avec une pile d’inférence adaptée et des techniques de quantification, des modèles de cette taille pourraient prendre en charge des expériences allant au-delà du déploiement sur des serveurs, jusqu’aux ordinateurs portables et aux appareils classés dans les catégories de l’edge ou des téléphones mobiles.
Une architecture en trois composants
Le modèle se compose d’un encodeur visuel à résolution native, d’un module de projection et d’un modèle de langage compact. Il combine un encodeur visuel entraîné par l’entreprise et comprenant 400 millions de paramètres, ainsi que le modèle de langage interne North Micro LLM, qui comprend 2 milliards de paramètres.
Le modèle de langage suit l’architecture Command A+, avec une alternance de trois couches d’attention à fenêtre glissante utilisant des encodages positionnels rotatifs, et d’une seule couche d’attention globale dépourvue d’encodages positionnels. L’encodeur visuel utilise 2D RoPE et des encodages positionnels appris à une dimension afin de préserver la structure spatiale des images à leur résolution native. Le module de projection injecte les représentations de plusieurs couches de l’encodeur visuel dans les couches initiales correspondantes du modèle de langage.
Un entraînement en plusieurs étapes
L’entraînement du modèle s’est déroulé en quatre étapes. Le processus a commencé par l’initialisation de l’encodeur visuel et du module de projection, puis la résolution a été augmentée en deux étapes, avec l’entraînement conjoint de l’encodeur, du module de projection et du modèle de langage. Le modèle a ensuite fait l’objet d’un ajustement supervisé, avant que l’entraînement ne s’achève par une version simplifiée de la technique Mixed Preference Optimization destinée à améliorer la sécurité, l’alignement et la qualité des réponses.
L’entraînement de l’encodeur visuel est passé d’une résolution de 384×384 pixels, à l’aide de 10 millions d’exemples, à 1024×1024 pixels avec 13 millions d’exemples, puis à une résolution native maximale de 1654×2339 pixels avec 10 millions d’exemples. Cette dernière correspond à une page A4 à 200 points par pouce, ce qui permet au modèle de traiter une seule page de document tout en conservant son rapport hauteur-largeur.
Lors de la phase d’ajustement supervisé, 50 millions d’échantillons multimodaux ont été utilisés, principalement répartis entre l’OCR natif, les diagrammes et les tableaux, la localisation et le comptage, les questions-réponses fondées sur l’OCR et la compréhension générale des images. Les données comprenaient également la légende d’images, les connaissances, le texte seul, ainsi que les mathématiques et les sciences. Le processus s’est appuyé sur des ensembles de données accessibles au public et sur un ensemble interne de documents multilingues de l’entreprise.
Résultats des évaluations et intégrations disponibles
CohereLabs a évalué le modèle sur des tâches comprenant la compréhension générale, multilingue et multi-image des images, la compréhension des diagrammes, des documents et de l’OCR, les sciences et la technologie, la localisation et le comptage, la résistance aux hallucinations ainsi que les capacités textuelles. Selon les résultats publiés, le modèle a obtenu 0,921 au test DocVQA, 0,808 à ChartQA, 0,792 à OCRBench et 0,725 à CountBench, tandis que ses performances à HallusionBench ont atteint 0,615.
L’entreprise fournit des poids compatibles avec MLX-VLM grâce à une contribution communautaire de Prince Canuma et Neywa. Elle propose également, en partenariat avec NVIDIA, une recette AutoModel permettant aux développeurs d’ajuster le modèle et de le déployer sur des unités de traitement graphique de NVIDIA, ainsi qu’une prise en charge de l’ajustement personnalisé via le framework communautaire Axolotl.