Inteligência artificial

A Z.ai revela a identidade do modelo Ox Alpha e o disponibiliza com pesos abertos sob o nome GLM-5.3-Flash

A Z.ai confirmou que o misterioso modelo Ox Alpha pertence à empresa e o lançou sob o nome GLM-5.3-Flash, disponibilizando seus pesos por meio do Hugging Face. O modelo tem como alvo a programação e tarefas agentivas de longo prazo, baseia-se em 320 bilhões de parâmetros, com cerca de 18 bilhões ativados em cada consulta, e oferece um contexto de até um milhão de tokens.

2026-08-27
4 min de leitura
10 visualizações
certi.news
A Z.ai revela a identidade do modelo Ox Alpha e o disponibiliza com pesos abertos sob o nome GLM-5.3-Flash

A empresa chinesa de inteligência artificial Z.ai revelou que o modelo que apareceu na semana passada na plataforma OpenRouter sob o nome Ox Alpha é um de seus modelos e o relançou com o nome GLM-5.3-Flash. A empresa disponibilizou os pesos do modelo por meio do Hugging Face, abrindo caminho para que os desenvolvedores tenham acesso a ele e o executem de acordo com o formato oferecido pela Z.ai, em vez de ele permanecer como um serviço de origem desconhecida em uma plataforma de terceiros.

O Ox Alpha havia surgido gratuitamente no OpenRouter sem revelar a entidade responsável por seu desenvolvimento, mas rapidamente chamou atenção depois de alcançar resultados fortes em diversos testes e rankings. A ausência de uma identidade do desenvolvedor gerou debates sobre o laboratório por trás do modelo, e a Z.ai foi um dos principais nomes mencionados antes de a empresa confirmar sua relação com o modelo.

Um modelo voltado para programação e tarefas agentivas

A Z.ai apresenta o modelo como um modelo de raciocínio voltado para programação, tarefas de agentes de longo prazo e cargas de trabalho em ambientes de produção. De acordo com as informações publicadas, o GLM-5.3-Flash foi projetado para lidar com tarefas prolongadas de desenvolvimento de software, problemas complexos de raciocínio e fluxos de trabalho que combinam contexto textual e visual.

O modelo utiliza uma arquitetura de Mixture of Experts (MoE) com um total de 320 bilhões de parâmetros, mas apenas cerca de 18 bilhões de parâmetros ficam ativos ao processar cada consulta. A janela de contexto também chega a um milhão de tokens, com suporte a textos, imagens e vídeos, enquanto o comprimento da resposta gerada pode chegar a 131.072 tokens.

Uma arquitetura de atenção projetada para contextos longos

A Z.ai afirma que o modelo difere das gerações anteriores do GLM na arquitetura de atenção utilizada. A sparse attention concentra-se nas partes mais relevantes das entradas, em vez de avaliar todos os tokens ao mesmo tempo, com o objetivo de reduzir a necessidade de computação ao lidar com entradas longas.

Já a abordagem de linear attention busca controlar o crescimento do uso de memória à medida que o contexto aumenta. A empresa afirma que o treinamento do modelo utilizou um conjunto de dados de 30 trilhões de tokens e também empregou um método chamado mHC para melhorar o processo de treinamento.

O que isso significa para os desenvolvedores?

A Z.ai afirma que o custo de execução do GLM-5.3-Flash é dez vezes menor que o custo de execução de seu modelo anterior. Se essa diferença se refletir no uso real, ela poderá ser importante para equipes que executam tarefas agentivas prolongadas ou precisam processar contextos grandes, mas o material não fornece detalhes sobre as condições de medição, os preços ou os requisitos de hardware; portanto, a comparação financeira ainda precisa de verificação independente.

Nos testes apresentados pela empresa, o modelo foi comparado com Claude Opus 4.8, GPT-5.6 Terra e Gemini 3.7 Flash. Segundo os resultados da Z.ai, o GLM-5.3-Flash obteve a maior pontuação no teste GDPval-AA v2, que mede o desempenho em tarefas intensivas em conhecimento, e ficou em segundo lugar no AutomationBench, que mede a capacidade de concluir tarefas dentro de aplicativos na nuvem.

A importância do anúncio está na combinação de três elementos: pesos disponíveis por meio do Hugging Face, um contexto muito longo e um foco claro em agentes e programação. No entanto, isso, por si só, não comprova a superioridade do modelo sobre os modelos concorrentes, porque os resultados mencionados foram divulgados pela própria empresa e o material não inclui detalhes sobre a metodologia ou a possibilidade de reproduzir os testes. O lançamento faz parte de um esforço mais amplo das empresas chinesas de inteligência artificial para oferecer modelos de pesos abertos e orientados a um custo de execução mais baixo como alternativas aos modelos fechados fornecidos por empresas como OpenAI e Anthropic.

Fonte da notícia
c
Autor

certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias