Liquid AI anunció la disponibilidad de los modelos LFM2.5-2.6B y LFM2.5-2.6B-Base en Hugging Face, para ejecutar agentes de inteligencia artificial localmente en dispositivos en lugar de depender por completo de la inferencia en la nube. Según la empresa, el modelo ofrece compatibilidad con la invocación de herramientas y los flujos de trabajo de varios pasos, con un tamaño y una velocidad adecuados para su uso en ordenadores portátiles y teléfonos.
La versión está dirigida a desarrolladores que necesitan desplegar agentes a gran escala, manteniendo los datos en el dispositivo y reduciendo la dependencia de una factura de inferencia en la nube. Liquid AI afirma que el modelo compite con modelos aproximadamente cuatro veces más grandes que él en el uso de herramientas, el seguimiento de instrucciones y las tareas agénticas de varios pasos.
Entrenamiento personalizado para tareas agénticas
LFM2.5-2.6B se preentrenó con unos 34 billones de tokens, y la fase de entrenamiento intermedio incluyó la ampliación de la ventana de contexto a 128.000 tokens. Posteriormente, el modelo pasó por cuatro etapas para transformarlo de un modelo base en un agente capaz de trabajar con herramientas y tareas secuenciales.
- Ajuste fino supervisado: dos rondas de entrenamiento centradas en gran medida en datos de uso de herramientas, búsqueda web y flujos de trabajo de agentes.
- Especialización de profesores: entrenamiento de un modelo profesor especializado para cada ámbito, como matemáticas, programación y uso de herramientas.
- Destilación multidominio: transferencia de las capacidades de los modelos especializados a un único modelo.
- Refuerzo agéntico: ejecución de entrenamiento de varias rondas dentro de marcos de agentes reales, para que el modelo aprenda a trabajar con distintas herramientas, instrucciones del sistema y entornos de tareas de varios pasos.
El sistema de refuerzo agéntico separa la mejora del modelo, la inferencia y la ejecución de los entornos. El sistema utiliza el motor de entrenamiento para mejorar el modelo y el motor de despliegue para generar acciones con la política más reciente, mientras que el marco de refuerzo coordina los procesos de entrenamiento y la recopilación de trayectorias y recompensas. Las acciones se ejecutan dentro de un servicio Sandbox, donde Blackbox Harness aloja al agente y coordina su interacción con el entorno de la tarea, sin necesidad de modificar los marcos compatibles.
Resultados de las pruebas y rendimiento
Liquid AI comparó el modelo con modelos de aproximadamente hasta cuatro veces su tamaño, entre ellos gemma-4-E2B-it, gemma-4-E4B-it, Qwen3.5-4B y Qwen3.5-9B. LFM2.5-2.6B fue el modelo más pequeño del grupo, pero encabezó todas las pruebas de seguimiento de instrucciones incluidas en la comparación, además de liderar las pruebas de uso de herramientas, excepto BFCLv4, en la que Qwen3.5-9B obtuvo mejores resultados.
El modelo obtuvo 80,07 en la prueba Multi-IF, 85,49 en IFStruct, 77,83 en ToolSandbox y 62,85 en la media de Claw-Eval en inglés. En las tareas agénticas, superó a los modelos Gemma y mantuvo un rendimiento similar al de los modelos Qwen, mientras que los modelos más grandes siguieron claramente por delante en programación.
Velocidad de ejecución y disponibilidad
Desde el primer día, el modelo es compatible con varias herramientas de inferencia, entre ellas llama.cpp, MLX, vLLM, SGLang y ONNX. La empresa afirma que la velocidad de generación en una unidad Apple M5 Max alcanza los 220 tokens por segundo y llega a 113 tokens por segundo en un procesador AMD Ryzen AI Max+ 395, con el modelo funcionando con menos de 2,5 gigabytes de memoria. También señala que es posible ejecutar agentes capaces en el teléfono a una velocidad de 30 tokens por segundo.
En unidades de procesamiento gráfico, el modelo alcanza unos 15.000 tokens de salida por segundo con un alto nivel de concurrencia, lo que equivale aproximadamente a 1.300 millones de tokens al día en una única unidad H100. Los desarrolladores pueden probar la demostración de WebGPU en el navegador o utilizar el modelo con marcos de agentes locales como OpenClaw, Hermes Agent y Pi. También hay disponible una demostración de un agente de investigación que funciona en el dispositivo.