CohereLabs, 2,4 milyar parametre içeren ve görüntü girdilerini özgün çözünürlüklerinde destekleyen açık ağırlıklı bir görme ve dil modeli olan North-Micro-Vision-Instruct’ın piyasaya sürüldüğünü duyurdu. Model, Apache 2.0 lisansı altında sunuluyor. Şirket, modelin bugüne kadarki en küçük görme ve dil modeli olduğunu ve özel çoklu ortam uygulamaları için kompakt bir temel olarak tasarlandığını belirtiyor.
Model ve ağırlıkları Hugging Face üzerinde CohereLabs/North-Micro-Vision-Instruct deposunda bulunuyor. vLLM için genel destek hâlâ hazırlanıyor; CohereLabs değerlendirmeleri sırasında vLLM’nin dahili bir sürümünü kullandı.
Belgelere ve özgün çözünürlüklü görüntülere odaklanma
North Micro Vision, her görüntüyü önce küçük bir kareye küçültmek yerine görüntünün en-boy oranını ve ince ayrıntılarını koruyor. Bu, küçük metinlerin, belge düzenlerinin, tabloların, diyagramların, ekran görüntülerinin ve formların işlenmesini sağlıyor. Eğitim ayrıca belgeler, diyagramlar ve doğal görüntüler de dâhil olmak üzere çeşitli dilleri ve görsel alanları kapsıyor.
Bu yetenekler, belirli görsel alanlar için ayarlanabilen veya yerel ve uç bilişim kısıtlamaları içinde çalıştırılabilen bir modele ihtiyaç duyan geliştiricileri hedefliyor. CohereLabs, bu boyuttaki modellerin uygun bir çıkarım yığını ve kuantizasyon teknikleriyle sunucularda dağıtımın ötesine geçerek dizüstü bilgisayarları, uç bilişim sınıfındaki cihazları veya cep telefonlarını kapsayan deneyleri destekleyebileceğini belirtiyor.
Üç bileşenli mimari
Model; özgün çözünürlüklü bir görsel kodlayıcıdan, bir projeksiyon biriminden ve kompakt bir dil modelinden oluşuyor. Şirket tarafından eğitilen ve 400 milyon parametre içeren bir görsel kodlayıcı ile 2 milyar parametre içeren şirket içi North Micro LLM dil modelini bir araya getiriyor.
Dil modeli, döner konumsal gömmeler kullanan üç adet kayan pencereli dikkat katmanı ile konumsal gömmeler içermeyen tek bir genel dikkat katmanının dönüşümlü kullanımını içeren Command A+ mimarisini izliyor. Görme kodlayıcı ise özgün çözünürlüklü görüntülerdeki uzamsal yapıyı korumak için 2D RoPE ve öğrenilmiş tek boyutlu konumsal gömmeler kullanıyor. Projeksiyon birimi, görsel kodlayıcının birden fazla katmanındaki temsilleri dil modelinin karşılık gelen erken katmanlarına enjekte ediyor.
Çok aşamalı eğitim
Model dört aşamadan geçen bir eğitim sürecinden geçirildi. Süreç, görsel kodlayıcı ile projeksiyon biriminin başlatılmasıyla başladı; ardından kodlayıcı, projeksiyon birimi ve dil modeli birlikte eğitilirken çözünürlük iki aşamada artırıldı. Daha sonra model öğretimli ince ayardan geçirildi ve eğitim, güvenliği, hizalamayı ve yanıt kalitesini iyileştirmek için Mixed Preference Optimization tekniğinin basitleştirilmiş bir sürümüyle tamamlandı.
Görsel kodlayıcının eğitimi, 10 milyon örnek kullanılarak 384×384 piksel çözünürlükten, 13 milyon örnek üzerinden 1024×1024 piksel çözünürlüğe ve ardından 10 milyon örnek aracılığıyla 1654×2339 piksel olan özgün çözünürlük sınırına yükseltildi. Bu sınır, inç başına 200 nokta çözünürlükteki bir A4 sayfasına karşılık geliyor ve modelin bir belge sayfasını en-boy oranını koruyarak işlemesine olanak tanıyor.
Öğretimli ince ayar aşamasında, temel olarak özgün OCR, diyagramlar ve tablolar, konum belirleme ve sayma, OCR soru-cevap ve genel görüntü anlama arasında dağıtılmış 50 milyon çoklu ortam örneği kullanıldı. Veriler ayrıca görüntü açıklamalarını, bilgiyi, yalnızca metni, matematik ve bilimi de kapsıyordu. Süreç, kamuya açık veri kümelerine ve şirketin kurum içindeki çok dilli belge koleksiyonuna dayandırıldı.
Değerlendirme sonuçları ve mevcut entegrasyonlar
CohereLabs modeli genel görüntü anlama, çok dilli ve çok görüntülü anlama, diyagram ve belge anlama ile OCR, bilim ve teknoloji, konum belirleme ve sayma, halüsinasyon direnci ve metin yeteneklerini içeren görevlerde değerlendirdi. Yayımlanan sonuçlara göre model, DocVQA testinde 0,921, ChartQA’da 0,808, OCRBench’te 0,792 ve CountBench’te 0,725 puan alırken HallusionBench performansı 0,615 oldu.
Şirket, Prince Canuma ve Neywa’nın topluluk katkısıyla MLX-VLM ile uyumlu ağırlıklar sunuyor. Ayrıca NVIDIA ile ortaklaşa, geliştiricilerin modeli ince ayarlamasına ve NVIDIA grafik işlem birimlerinde dağıtmasına olanak tanıyan bir AutoModel tarifi ile topluluk tarafından geliştirilen Axolotl çerçevesi üzerinden özel ince ayar desteği sağlıyor.