CohereLabs는 North-Micro-Vision-Instruct 출시를 발표했다. 이 모델은 24억 개의 매개변수를 포함하고 원본 해상도 이미지 입력을 지원하는 오픈 웨이트 비전-언어 모델이며, Apache 2.0 라이선스로 제공된다. 회사는 이 모델이 현재까지 자사의 가장 작은 비전-언어 모델이며, 전문 멀티모달 애플리케이션을 위한 소형 기반으로 설계됐다고 밝혔다.
모델과 가중치는 Hugging Face의 CohereLabs/North-Micro-Vision-Instruct 저장소에서 제공된다. vLLM에 대한 일반 지원은 아직 준비 중이며, CohereLabs는 평가 과정에서 내부 vLLM 버전을 사용했다.
문서와 원본 해상도 이미지에 집중
North Micro Vision은 모든 이미지를 먼저 작은 정사각형으로 축소하는 대신 이미지의 가로세로 비율과 세부 정보를 유지한다. 이를 통해 작은 텍스트, 문서 레이아웃, 표, 차트, 스크린샷 및 양식을 처리할 수 있다. 또한 학습에는 문서, 차트 및 자연 이미지 등 여러 언어와 시각적 분야가 포함된다.
이러한 기능은 특정 시각 분야에 맞게 조정하거나 로컬 및 엣지 제약 환경에서 실행할 수 있는 모델이 필요한 개발자를 대상으로 한다. CohereLabs는 적절한 추론 패키지와 양자화 기술을 활용하면 이 정도 규모의 모델이 서버 배포를 넘어 노트북과 엣지 또는 모바일 기기 범주에 속하는 장치에서의 실험도 지원할 수 있다고 설명한다.
세 가지 구성 요소로 이루어진 구조
이 모델은 원본 해상도 비전 인코더, 프로젝션 모듈 및 소형 언어 모델로 구성된다. 회사가 학습한 4억 개의 매개변수를 포함하는 비전 인코더와, 20억 개의 매개변수를 포함하는 내부 언어 모델 North Micro LLM을 결합한다.
언어 모델은 Command A+ 구조를 따르며, 회전 위치 임베딩을 사용하는 슬라이딩 윈도우 방식의 어텐션 층 세 개와 위치 임베딩이 없는 전역 어텐션 층 하나를 번갈아 배치한다. 비전 인코더는 2D RoPE와 학습 가능한 1차원 위치 임베딩을 사용해 원본 해상도 이미지의 공간 구조를 보존한다. 프로젝션 모듈은 비전 인코더의 여러 층에서 나온 표현을 언어 모델의 대응하는 초기 층에 주입한다.
다단계 학습
모델 학습은 네 단계로 진행됐다. 먼저 비전 인코더와 프로젝션 모듈을 초기화한 뒤, 두 단계에 걸쳐 해상도를 높이면서 인코더, 프로젝션 모듈 및 언어 모델을 함께 학습했다. 이후 모델은 지도 미세 조정을 거쳤으며, 안전성, 정렬 및 응답 품질을 개선하기 위해 Mixed Preference Optimization 기법의 간소화된 버전으로 학습을 마무리했다.
비전 인코더 학습은 1,000만 개의 예제를 사용한 384×384픽셀 해상도에서 시작해 1,300만 개의 예제를 통한 1024×1024픽셀 해상도로 진행됐고, 이후 1,000만 개의 예제를 통해 1654×2339픽셀의 원본 해상도 한도에 도달했다. 이 한도는 인치당 200도트 해상도의 A4 용지와 유사하므로, 모델은 가로세로 비율을 유지하면서 문서 한 페이지를 처리할 수 있다.
지도 미세 조정 단계에서는 5,000만 개의 멀티모달 샘플이 사용됐으며, 주로 원본 OCR, 차트 및 표, 위치 지정 및 개수 세기, OCR 질의응답, 일반 이미지 이해로 구성됐다. 또한 이미지 설명, 지식, 텍스트 전용 데이터, 수학 및 과학도 포함됐다. 이 과정은 공개적으로 이용 가능한 데이터 세트와 회사 내부의 다국어 문서 데이터 세트를 기반으로 했다.
평가 결과와 이용 가능한 통합
CohereLabs는 일반 이미지 이해, 다국어 및 다중 이미지 이해, 차트·문서 이해 및 OCR, 과학·기술, 위치 지정 및 개수 세기, 환각 저항성, 텍스트 능력을 포함하는 작업에서 모델을 평가했다. 공개된 결과에 따르면 모델은 DocVQA에서 0.921, ChartQA에서 0.808, OCRBench에서 0.792, CountBench에서 0.725를 기록했으며, HallusionBench 성능은 0.615였다.
회사는 Prince Canuma와 Neywa의 커뮤니티 기여를 바탕으로 MLX-VLM과 호환되는 가중치를 제공한다. 또한 NVIDIA와 협력해 개발자가 모델을 미세 조정하고 NVIDIA 그래픽 처리 장치에 배포할 수 있도록 하는 AutoModel 레시피와 함께, 커뮤니티의 Axolotl 프레임워크를 통한 맞춤형 미세 조정 지원도 제공한다.