Ferramentas

llama.cpp

Acompanhe as últimas notícias, explicações e histórias tecnológicas relacionadas.

Cobertura mais recente

CN
Como o Rust cria aplicações de modelos de linguagem usando o Rig?

Como o Rust cria aplicações de modelos de linguagem usando o Rig?

Uma apresentação prática conjunta da JetBrains e da Rust Foundation explica como usar a biblioteca Rig para criar agentes de inteligência artificial em Rust, com suporte a provedores de modelos, ferramentas, RAG e modelos locais. O material também destaca uma abordagem para testar integrações de modelos por meio do registro de solicitações HTTP e sua reprodução em um ambiente de integração contínua.

CN
Qwen3.8-27B aproxima modelos avançados de IA da execução local

Qwen3.8-27B aproxima modelos avançados de IA da execução local

O modelo aberto Qwen3.8-27B da Alibaba oferece capacidades multimodais, de programação e de agentes de software em um tamanho que pode ser executado localmente após ser comprimido para cerca de 17 GB. Apesar dos fortes indicadores de desempenho, seu alto consumo de tokens e a lentidão da inferência exigem um equilíbrio prático entre qualidade e velocidade.

CN
Experimento de bartowski revela os limites dos dados do imatrix e a importância de sua diversidade nos modelos GGUF

Experimento de bartowski revela os limites dos dados do imatrix e a importância de sua diversidade nos modelos GGUF

bartowski apresenta um experimento amplo para aprimorar os dados de calibração usados com o imatrix ao quantizar modelos por meio do llama.cpp e conclui que os maiores ganhos aparecem em taxas de bits baixas, especialmente em modelos de mistura de especialistas (MoE). O novo dataset é menor e mais focado, mas combina textos diversificados e conversas formatadas para o uso de ferramentas.

CN
A Liquid AI lança o modelo LFM2.5-2.6B para executar agentes localmente em dispositivos

A Liquid AI lança o modelo LFM2.5-2.6B para executar agentes localmente em dispositivos

A Liquid AI anunciou a disponibilização dos modelos LFM2.5-2.6B e LFM2.5-2.6B-Base no Hugging Face, com suporte a chamadas de ferramentas e fluxos de trabalho de várias etapas localmente. O modelo foi projetado para executar agentes rápidos em computadores e telefones, com consumo inferior a 2,5 GB de memória.