Liquid AI는 클라우드 추론에 전적으로 의존하는 대신 기기에서 인공지능 에이전트를 로컬로 실행할 수 있도록 LFM2.5-2.6B 및 LFM2.5-2.6B-Base 모델을 Hugging Face에서 공개했다고 발표했다. 회사에 따르면 이 모델은 도구 호출과 다단계 워크플로를 지원하며, 노트북과 휴대전화에서 사용하기에 적합한 크기와 속도를 제공한다.
이번 출시는 데이터를 기기에 유지하고 클라우드 추론 비용에 대한 의존도를 줄이면서 에이전트를 대규모로 배포해야 하는 개발자를 대상으로 한다. Liquid AI는 이 모델이 도구 사용, 지시 따르기, 다단계 에이전트 작업에서 자신보다 약 4배 큰 모델과 경쟁한다고 밝혔다.
에이전트 작업에 맞춘 학습
LFM2.5-2.6B는 약 34조 개의 토큰으로 사전 학습됐으며, 중간 학습 단계에서는 컨텍스트 창을 128,000개 토큰으로 확장했다. 이후 이 모델은 기본 모델에서 도구와 연속 작업을 처리할 수 있는 에이전트로 전환되기 위해 네 단계를 거쳤다.
- 지도 미세 조정: 도구 사용 데이터, 웹 검색, 에이전트 워크플로에 중점을 둔 두 차례의 학습을 진행했다.
- 교사 전문화: 수학, 프로그래밍, 도구 사용 등 각 분야에 특화된 교사 모델을 학습했다.
- 다중 분야 증류: 전문 모델의 능력을 하나의 모델로 이전했다.
- 에이전트 강화: 실제 에이전트 프레임워크 안에서 다중 라운드 학습을 수행해, 모델이 다양한 도구, 시스템 지시, 다단계 작업 환경을 다루도록 학습했다.
에이전트 강화 시스템은 모델 개선, 추론, 환경 실행을 분리한다. 시스템은 학습 엔진으로 모델을 개선하고, 롤아웃 엔진으로 최신 정책에 따른 행동을 생성하며, 강화 프레임워크가 학습 과정과 궤적 및 보상 수집을 조율한다. 행동은 Sandbox 서비스 안에서 실행되며, Blackbox Harness가 에이전트를 호스팅하고 작업 환경과의 상호작용을 조율하므로 지원되는 프레임워크를 수정할 필요가 없다.
테스트 결과와 성능
Liquid AI는 gemma-4-E2B-it, gemma-4-E4B-it, Qwen3.5-4B, Qwen3.5-9B를 비롯해 크기가 약 4배에 이르는 모델들과 이 모델을 비교했다. LFM2.5-2.6B는 비교 대상 중 가장 작은 모델이었지만, 비교에 포함된 모든 지시 따르기 테스트에서 1위를 차지했다. 또한 BFCLv4를 제외한 도구 사용 테스트에서도 1위를 기록했으며, BFCLv4에서는 Qwen3.5-9B가 더 높은 성능을 보였다.
이 모델은 Multi-IF 테스트에서 80.07, IFStruct에서 85.49, ToolSandbox에서 77.83, 영어 Claw-Eval 평균에서 62.85를 기록했다. 에이전트 작업에서는 두 Gemma 모델을 앞섰고 Qwen 모델과 비슷한 성능을 유지했지만, 프로그래밍에서는 더 큰 모델들이 뚜렷하게 앞섰다.
실행 속도와 제공 현황
이 모델은 출시 첫날부터 llama.cpp, MLX, vLLM, SGLang, ONNX 등 여러 추론 도구와 호환된다. 회사에 따르면 Apple M5 Max에서 생성 속도는 초당 220토큰이며, AMD Ryzen AI Max+ 395 프로세서에서는 초당 113토큰에 이르고, 모델은 2.5GB 미만의 메모리에서 실행된다. 또한 초당 30토큰의 속도로 휴대전화에서 작동하는 에이전트를 실행할 수 있다고 밝혔다.
그래픽 처리 장치에서는 높은 동시성 조건에서 초당 약 15,000개의 출력 토큰에 도달하며, 이는 H100 한 대에서 하루 약 13억 토큰을 처리하는 수준이다. 개발자는 브라우저에서 WebGPU 데모를 시험하거나 OpenClaw, Hermes Agent, Pi 같은 로컬 에이전트 프레임워크와 함께 모델을 사용할 수 있다. 기기에서 작동하는 검색 에이전트의 데모도 제공된다.