Inteligencia artificial

CohereLabs lanza el modelo North Micro Vision de pesos abiertos para procesar imágenes en su resolución nativa

CohereLabs ha lanzado North-Micro-Vision-Instruct, un modelo de visión y lenguaje de pesos abiertos que incluye 2.400 millones de parámetros y admite el procesamiento de imágenes en su resolución nativa, con licencia Apache 2.0. El modelo está orientado a aplicaciones de comprensión de documentos y diagramas, OCR y ajuste personalizado, e incluye compatibilidad comunitaria con MLX-VLM y una receta de AutoModel para su implementación en unidades de procesamiento gráfico de NVIDIA.

2026-08-14
5 min de lectura
14 visitas
فريق تحرير certi.news
CohereLabs lanza el modelo North Micro Vision de pesos abiertos para procesar imágenes en su resolución nativa

CohereLabs anunció el lanzamiento de North-Micro-Vision-Instruct, un modelo de visión y lenguaje de pesos abiertos que incluye 2.400 millones de parámetros y admite entradas de imágenes en su resolución nativa, bajo la licencia Apache 2.0. La empresa afirma que el modelo es su modelo de visión y lenguaje más pequeño hasta la fecha y que fue diseñado como base compacta para aplicaciones multimedia especializadas.

El modelo y sus pesos están disponibles en Hugging Face en el repositorio CohereLabs/North-Micro-Vision-Instruct. La compatibilidad general con vLLM todavía está en preparación, mientras que CohereLabs utilizó una versión interna de vLLM durante sus evaluaciones.

Enfoque en documentos e imágenes en su resolución nativa

North Micro Vision conserva la relación de aspecto y los detalles finos de la imagen, en lugar de reducir primero cada imagen a un cuadrado pequeño. Esto permite trabajar con textos pequeños, diseños de documentos, tablas, diagramas, capturas de pantalla y formularios. El entrenamiento también abarca múltiples idiomas y ámbitos visuales, incluidos documentos, diagramas e imágenes naturales.

Estas capacidades están dirigidas a desarrolladores que necesitan un modelo que pueda ajustarse a ámbitos visuales específicos o ejecutarse bajo restricciones locales y de borde. CohereLabs señala que modelos de este tamaño podrían admitir, con una pila de inferencia adecuada y técnicas de cuantización, experiencias que vayan más allá de la implementación en servidores para incluir ordenadores portátiles y dispositivos clasificados como de borde o teléfonos móviles.

Arquitectura de tres componentes

El modelo consta de un codificador visual de resolución nativa, un módulo de proyección y un modelo de lenguaje compacto. Combina un codificador visual entrenado por la empresa que incluye 400 millones de parámetros con el modelo de lenguaje interno North Micro LLM, que incluye 2.000 millones de parámetros.

El modelo de lenguaje sigue la arquitectura Command A+, alternando tres capas de atención con ventana deslizante que utilizan incrustaciones posicionales rotatorias y una única capa de atención global sin incrustaciones posicionales. El codificador visual utiliza 2D RoPE e incrustaciones posicionales aprendidas unidimensionales para conservar la estructura espacial en imágenes de resolución nativa. El módulo de proyección inyecta representaciones de múltiples capas del codificador visual en capas tempranas correspondientes del modelo de lenguaje.

Entrenamiento en varias etapas

El entrenamiento del modelo pasó por cuatro etapas. El proceso comenzó con la inicialización del codificador visual y el módulo de proyección; después, la resolución se incrementó en dos etapas mientras se entrenaban conjuntamente el codificador, el módulo de proyección y el modelo de lenguaje. A continuación, el modelo se sometió a ajuste instructivo y el entrenamiento concluyó con una versión simplificada de la técnica Mixed Preference Optimization para mejorar la seguridad, la alineación y la calidad de las respuestas.

El entrenamiento del codificador visual progresó desde una resolución de 384×384 píxeles utilizando 10 millones de ejemplos, hasta 1024×1024 píxeles mediante 13 millones de ejemplos, y después hasta un límite de resolución nativa de 1654×2339 píxeles mediante 10 millones de ejemplos. Este límite equivale a una página A4 a 200 puntos por pulgada, lo que permite al modelo procesar una sola página de documento conservando su relación de aspecto.

En la etapa de ajuste instructivo se utilizaron 50 millones de muestras multimodales, distribuidas principalmente entre OCR nativo, diagramas y tablas, localización y conteo, preguntas y respuestas de OCR y comprensión general de imágenes. Los datos también incluyeron descripción de imágenes, conocimiento, texto únicamente, matemáticas y ciencias. El proceso se basó en conjuntos de datos disponibles públicamente y en una colección interna de documentos multilingües de la empresa.

Resultados de evaluación e integraciones disponibles

CohereLabs evaluó el modelo en tareas que abarcan la comprensión general, multilingüe y de múltiples imágenes; la comprensión de diagramas, documentos y OCR; ciencias y tecnología; localización y conteo; resistencia a las alucinaciones; y capacidades textuales. Según los resultados publicados, el modelo obtuvo 0,921 en la prueba DocVQA, 0,808 en ChartQA, 0,792 en OCRBench y 0,725 en CountBench, mientras que su rendimiento en HallusionBench fue de 0,615.

La empresa ofrece pesos compatibles con MLX-VLM con una contribución comunitaria de Prince Canuma y Neywa. Asimismo, distribuye, en colaboración con NVIDIA, una receta de AutoModel que permite a los desarrolladores ajustar y desplegar el modelo en unidades de procesamiento gráfico de NVIDIA, además de ofrecer compatibilidad con el ajuste personalizado mediante el marco comunitario Axolotl.

Fuente de la noticia
Hugging Face Blog
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias