Alibaba lanzó el modelo Qwen3.8-27B en la plataforma Hugging Face el viernes, bajo una licencia de código abierto Apache 2.0, lo que permite a los desarrolladores descargar sus pesos, examinarlos, modificarlos y ejecutarlos lejos de las interfaces de los modelos en la nube. La importancia del lanzamiento no está relacionada únicamente con sus 27.000 millones de parámetros, sino con su capacidad para combinar la comprensión de imágenes y vídeo, un contexto de hasta 262.144 tokens, inferencia ajustable y soporte para tareas de programación y flujos de trabajo de agentes de software.
La fuente describe el modelo como una versión compacta y fácil de implementar de las capacidades de la generación Qwen3.8. La versión de 16 bits necesita unos 56 gigabytes de memoria de GPU, mientras que la versión FP8 requiere aproximadamente 28 gigabytes. Al comprimirla a 4 bits, el tamaño del propio modelo se reduce a unos 17 gigabytes, lo que permite ejecutarlo en dispositivos de consumo avanzados, como un ordenador gaming potente o un portátil bien equipado.
Grandes capacidades en un tamaño menor
La combinación de rendimiento y tamaño fue una de las principales razones de las amplias reacciones entre desarrolladores y usuarios avanzados de IA. En el lanzamiento, Alibaba presentó cifras sólidas en varias pruebas: el modelo obtuvo 61,7 en SWE-bench Pro, 90,3 en LiveCodeBench v6, 70,7 en CoWorkBench y 84,3 en OSWorld-Verified.
En la tabla comparativa publicada por la empresa, Qwen3.8-27B superó la puntuación indicada para Claude Opus 4.6 Max en las pruebas SWE-bench Pro y LiveCodeBench, mientras que Claude siguió por delante en Terminal-Bench, GPQA Diamond y Humanity’s Last Exam. Sin embargo, estos resultados no bastan para proclamar un ganador absoluto: algunas evaluaciones de Alibaba son internas y las herramientas de prueba y los métodos de medición no son necesariamente idénticos entre todos los modelos.
Resultados independientes posteriores dieron un impulso adicional al lanzamiento. Artificial Analysis le otorgó una puntuación de 52 en Intelligence Index, un indicador compuesto que incluye nueve evaluaciones de programación, ciencias, razonamiento y tareas profesionales. Esta puntuación igualó el resultado que el índice atribuye actualmente a GPT-5.6 Luna de OpenAI con el nivel máximo de inferencia, un modelo propietario disponible únicamente a través de la nube. Qwen3.8-27B también obtuvo 51 en Agentic Index, por delante de Claude Opus 4.8 con el máximo esfuerzo de inferencia.
Estas comparaciones no significan que los modelos sean completamente equivalentes, pero explican el interés de los desarrolladores. Cline, un agente de software de código abierto, describió el resultado como la primera ocasión en que un modelo local registra una capacidad cercana a la de los modelos líderes. Joshua “Xenova” Lochner también probó la ejecución del modelo utilizando núcleos WebGPU personalizados, lo que apunta a la posibilidad de integrarlo en distintos entornos de ejecución.
¿Qué permite en la práctica la ejecución local?
Simon Willison probó una versión comprimida de aproximadamente 17 gigabytes, de tipo Q4_K_M, en un MacBook Pro equipado con un procesador M5 Max y en una Nvidia DGX Spark. En sus experimentos, el modelo pudo escribir código, comprender imágenes y ejecutar un bucle de agente de software mediante el framework Pi agent. También se desplazó por una base de código para explicar el mecanismo de autenticación y escribió y probó una herramienta de Python para convertir un registro de agente en formato JSONL a Markdown.
Estos experimentos muestran la diferencia práctica entre un modelo accesible únicamente mediante una API y un archivo que puede conservarse en una estación de trabajo. El desarrollador puede ejecutar y modificar el modelo y mantenerlo dentro de su propia infraestructura, en lugar de enviar los datos a un proveedor externo. Esto abre opciones relacionadas con la privacidad, la seguridad de la información, la gobernanza y el control de la implementación, sin significar automáticamente que el modelo sea adecuado para todas las tareas o que su ejecución vaya a ser rápida.
El interés también se reflejó en la tasa de uso: Cybernews informó de que el modelo superó los 3 millones de descargas desde Hugging Face durante sus tres primeros días, mientras que rápidamente aparecieron versiones comprimidas compatibles con herramientas de inferencia local. La comunidad LocalLLaMA de Reddit creó un hilo específico para recopilar resultados de pruebas, versiones comprimidas, instrucciones de configuración y comparaciones.
La calidad tiene un coste temporal
La limitación más evidente de Qwen3.8-27B es su tendencia a pensar en exceso. Artificial Analysis afirma que el modelo generó 160 millones de tokens de salida durante las pruebas de Intelligence Index, frente a una mediana de 43 millones de tokens en modelos de pesos abiertos similares. La fuente relaciona esto con la configuración de inferencia predeterminada xhigh; en el experimento de Willison, generar un dibujo SVG de un cisne montado en bicicleta tardó 21 minutos y consumió más de 22.000 tokens de inferencia. Por ello, recomendó comenzar el uso normal con una inferencia baja o sin inferencia.
Tomasz Tunguz registró una compensación similar en una pequeña prueba de nueve tareas frente a DeepSeek V4 Flash. Con la inferencia activada, Qwen superó ligeramente en calidad dentro del sistema de agente que utilizó, pero fue unas 30 veces más lento y 4,5 veces más costoso, aunque advirtió que nueve tareas no bastan para zanjar el resultado.
El software de inferencia puede ayudar a reducir la brecha. El modelo incluye la técnica Multi-Token Prediction, y Willison informó de una mejora del rendimiento de aproximadamente el 72 % en DGX Spark tras activarla mediante llama.cpp, en comparación con la configuración predeterminada de LM Studio. Aun así, sus ejecuciones habituales mediante LM Studio producían entre 15 y 30 tokens por segundo, una velocidad muy inferior a la respuesta de muchos modelos alojados.
¿Qué significa esto para las empresas?
La comparación más importante para las organizaciones no es si un modelo de 27.000 millones de parámetros supera a Claude o GPT en una única tabla, sino si puede realizar localmente suficiente programación, análisis de documentos, comprensión visual y tareas de agentes como para sustituir las llamadas a API en categorías prácticas de trabajo. Gracias a la licencia Apache 2.0, los pesos pueden examinarse, modificarse y alojarse detrás de los controles de la organización, mientras que Alibaba documenta su compatibilidad con los frameworks vLLM y SGLang y con TokenSpeed.
Alibaba afirma que más adelante llegará una versión gestionada de Qwen Cloud con un contexto predeterminado de un millón de tokens y herramientas integradas. Sin embargo, el valor actual de Qwen3.8-27B reside en la opción de implementación local, menos dependiente de la infraestructura en la nube. Sigue siendo necesario verificar de forma independiente sus resultados, y la lentitud de la inferencia puede limitar su utilidad en interacciones en tiempo real. Por tanto, el lanzamiento no demuestra que los modelos locales hayan alcanzado una paridad general con los modelos líderes, pero sí muestra que capacidades que hasta hace poco estaban vinculadas a servicios costosos ahora pueden ejecutarse desde un archivo más pequeño en hardware propiedad del usuario.