CohereLabs 宣布发布 North-Micro-Vision-Instruct,这是一款开放权重视觉语言模型,包含 24 亿个参数,支持以原始分辨率输入图像,并采用 Apache 2.0 许可证。公司表示,该模型是其迄今为止最小的视觉语言模型,旨在成为专业多媒体应用的紧凑型基础模型。
该模型及其权重已通过 Hugging Face 提供,仓库为 CohereLabs/North-Micro-Vision-Instruct。vLLM 的正式支持仍在准备中,而 CohereLabs 在评估期间使用了内部版本的 vLLM。
专注于文档与原生分辨率图像
North Micro Vision 保留图像的宽高比和精细细节,而不是先将每张图像缩小为小型方形图像。这使其能够处理小字体、文档布局、表格、图表、屏幕截图和表单。训练还涵盖多种语言和视觉领域,包括文档、图表和自然图像。
这些能力面向需要将模型调整到特定视觉领域,或在本地和边缘限制条件下运行模型的开发者。CohereLabs 指出,借助合适的推理软件包和量化技术,此类规模的模型可能支持超越服务器部署的应用,涵盖笔记本电脑以及归类为边缘设备或移动设备的硬件。
由三个组件构成的架构
该模型由原生分辨率视觉编码器、投影模块和紧凑型语言模型组成。它结合了公司训练的、包含 4 亿个参数的视觉编码器,以及内部 North Micro LLM 语言模型,后者包含 20 亿个参数。
语言模型采用 Command A+ 架构,在使用旋转位置嵌入的滑动窗口注意力层与一个不使用位置嵌入的全局注意力层之间交替排列,前者每三层出现一次。视觉编码器使用 2D RoPE 和一维可学习位置嵌入,以保留原生分辨率图像中的空间结构。投影模块将视觉编码器多个层的表示注入语言模型相应的早期层。
多阶段训练
该模型经过四个阶段的训练。训练首先初始化视觉编码器和投影模块,随后分两个阶段提高分辨率,同时联合训练编码器、投影模块和语言模型。之后,模型接受指令微调,最后使用简化版的 Mixed Preference Optimization 技术完成训练,以改善安全性、对齐性和回答质量。
视觉编码器的训练分辨率从 384×384 像素开始,使用 1000 万个样本;随后通过 1300 万个样本提升至 1024×1024 像素;最后通过 1000 万个样本提升至最高原生分辨率 1654×2339 像素。这一上限相当于 200 dpi 分辨率下的 A4 页面,使模型能够在保留宽高比的同时处理单页文档。
在指令微调阶段,使用了 5000 万个多模态样本,主要分布在原生 OCR、图表与表格、定位与计数、OCR 问答以及通用图像理解任务中。数据还包括图像描述、知识、纯文本、数学和科学内容。该过程基于公开可用的数据集以及公司内部的多语言文档数据集。
评估结果与可用集成
CohereLabs 在包括通用图像理解、多语言和多图像理解、图表与文档理解及 OCR、科学与技术、定位与计数、抗幻觉能力以及文本能力在内的任务上评估了该模型。根据公布的结果,该模型在 DocVQA 测试中的得分为 0.921,在 ChartQA 中为 0.808,在 OCRBench 中为 0.792,在 CountBench 中为 0.725,而在 HallusionBench 中的表现为 0.615。
公司提供了与 MLX-VLM 兼容的权重,该适配由 Prince Canuma 和 Neywa 以社区贡献形式完成。此外,公司还与 NVIDIA 合作提供 AutoModel 配方,使开发者能够微调模型并将其部署到 NVIDIA 图形处理单元上,同时通过社区的 Axolotl 框架支持定制微调。