Acompanhe as últimas notícias, explicações e histórias tecnológicas relacionadas.
A JetBrains lançou o modelo aberto Mellum2.1 sob a licença Apache 2.0, com foco na execução de agentes de programação e subagentes localmente ou na infraestrutura própria do usuário. A versão baseia-se em treinamento por aprendizagem por reforço em ambientes de software reais, com grandes melhorias no trabalho com repositórios de código e na velocidade de inferência.
Um artigo da CNCF argumenta que operar uma infraestrutura empresarial de IA não consiste em implantar um único modelo ou cluster, mas em gerenciar uma frota compartilhada de unidades de GPU para várias equipes, equilibrando utilização, isolamento e custo. O artigo apresenta camadas técnicas que incluem provisionamento, alocação, agendamento, redes, armazenamento, monitoramento e faturamento.
A Perplexity lançou a plataforma Portable Computer para executar seus agentes localmente nos dispositivos dos usuários, começando pelo Nvidia DGX Spark e por computadores Linux equipados com placas RTX com pelo menos 24 GB de memória. O sistema mantém os modelos, arquivos e o trabalho no dispositivo por padrão, com a possibilidade de solicitar a aprovação do usuário antes de encaminhar uma etapa específica para um modelo de nuvem mais potente.
A CohereLabs lançou o modelo North-Micro-Vision-Instruct, um modelo de visão e linguagem de pesos abertos com 2,4 bilhões de parâmetros que oferece suporte ao processamento de imagens em sua resolução nativa, sob a licença Apache 2.0. O modelo é voltado para aplicações de compreensão de documentos e diagramas, OCR e ajuste personalizado, além de incluir suporte da comunidade ao MLX-VLM e uma receita do AutoModel para implantação em unidades de processamento gráfico da NVIDIA.
O projeto AX-Ray da VIDRAFT apresenta um método de avaliação de modelos que vai além das pontuações de desempenho, após identificar e reproduzir falhas que descreveu como vazamento causal nos modelos Zyphra/Zamba2-1.2B e nvidia/Nemotron-H-8B-Base-8K. A estrutura classifica esses casos como falhas que impedem a implantação, distinguindo-os de problemas no caminho de serviço ou na API.
A Liquid AI anunciou a disponibilização dos modelos LFM2.5-2.6B e LFM2.5-2.6B-Base no Hugging Face, com suporte a chamadas de ferramentas e fluxos de trabalho de várias etapas localmente. O modelo foi projetado para executar agentes rápidos em computadores e telefones, com consumo inferior a 2,5 GB de memória.