La startup de inteligencia artificial PrismML lanzó su modelo Bonsai 2 27B, que comprime el modelo de código abierto Qwen3.8 27B de Alibaba en un archivo de solo 5,9 gigabytes. La empresa afirma que el modelo comprimido obtiene el 98 % de las puntuaciones agregadas del modelo original en las pruebas de referencia, con una reducción de los requisitos de memoria de aproximadamente entre nueve y diez veces.
El nuevo tamaño hace posible ejecutar el modelo en un ordenador personal y quizá en un teléfono inteligente de alta gama, en lugar de depender por completo de servidores en la nube. Esto no significa que todos los teléfonos puedan ejecutarlo en la práctica, ya que la fuente plantea la compatibilidad con teléfonos en términos de posibilidad, y el rendimiento real depende del hardware y del software que rodean la ejecución del modelo.
¿Cómo funciona la tecnología de compresión?
PrismML se basa en lo que denomina pesos ternarios. Los pesos del modelo son los valores que almacenan parte de la información que aprende durante el entrenamiento y normalmente requieren 16 bits por peso, según la explicación de la empresa. En cambio, el nuevo enfoque representa cada peso con uno de solo tres valores: uno positivo, uno negativo o cero. Reducir el número de valores posibles disminuye considerablemente el espacio necesario para almacenar el modelo.
La empresa está dirigida por Babak Hassibi, profesor en Caltech y especialista en técnicas de compresión, mientras que Ion Stoica trabaja como asesor. Entre sus patrocinadores figuran Khosla Ventures, Cerberus Capital y Caltech. PrismML recaudó una ronda inicial de 22,25 millones de dólares y no es la única empresa que trabaja en la compresión de modelos lingüísticos grandes, ya que la fuente también señaló a Multiverse Computing como competidora en este ámbito.
Resultados mejores que los de la versión anterior
Bonsai 2 representa una mejora respecto a la primera versión de Bonsai, que la empresa lanzó en marzo y que alcanzó el 95 % de las puntuaciones del modelo original, según informó TechCrunch citando a la empresa. PrismML afirma que la primera versión se descargó más de 11 millones de veces, mientras que sus modelos más pequeños registraron 2,6 millones de descargas adicionales.
Sin embargo, el 98 % no implica una coincidencia completa con el modelo original ni demuestra por sí solo que la diferencia restante no vaya a aparecer en usos prácticos. Hassibi reconoce que probablemente la compresión tendrá algún efecto en el rendimiento, y las pruebas de referencia tampoco reflejan todas las tareas del mundo real. Además, el entorno de software en el que funciona el modelo también influye en su precisión.
¿Por qué es importante este avance?
Si PrismML continúa reduciendo los modelos mientras conserva la mayor parte de sus capacidades, la ejecución local de modelos de razonamiento podría volverse más viable. Esto permite procesar los datos en el dispositivo del usuario en lugar de enviarlos a la nube, lo que podría favorecer la privacidad y reducir la dependencia de la conexión externa, según el argumento de Stoica. No obstante, todavía no resuelve las cuestiones relativas al consumo de energía, la velocidad de respuesta y la compatibilidad de los dispositivos, ni demuestra que el modelo vaya a ofrecer el mismo nivel de rendimiento en todos los escenarios.
La empresa tiene previsto aplicar la tecnología de compresión a modelos mucho más grandes, y Hassibi afirmó que las próximas versiones podrían situarse en el rango de varios cientos de miles de millones de parámetros durante los próximos meses. Considera que los modelos más grandes podrían ofrecer a la compresión un margen más amplio para conservar sus capacidades, aunque este objetivo sigue siendo un plan futuro y no un resultado disponible por ahora. El informe también mencionó rumores sobre conversaciones con Apple, pero Hassibi se negó a comentarlos, por lo que no pueden considerarse una asociación o un acuerdo anunciado.