Inteligência artificial

Iniciativa UK-LLM desenvolve modelo de inteligência artificial capaz de raciocinar em galês

A iniciativa UK-LLM, em colaboração com a University College London, a Universidade de Bangor e a NVIDIA, está desenvolvendo um modelo aberto de inteligência artificial baseado no Nemotron e compatível com raciocínio em galês e inglês. Espera-se que o modelo e seus dados sejam disponibilizados aos setores empresarial e público, enquanto a Nscale oferecerá o modelo aos desenvolvedores por meio de uma interface de programação de aplicações.

2025-09-13
4 min de leitura
8 visualizações
فريق تحرير certi.news
Iniciativa UK-LLM desenvolve modelo de inteligência artificial capaz de raciocinar em galês

A iniciativa UK-LLM está desenvolvendo um modelo de inteligência artificial capaz de raciocinar em inglês e galês, com o objetivo de apoiar a prestação de serviços públicos, como saúde, educação e recursos jurídicos, em galês, língua falada por cerca de 850 mil pessoas no País de Gales.

O novo modelo baseia-se na família NVIDIA Nemotron de código aberto e foi desenvolvido pela University College London em colaboração com a Universidade de Bangor e a NVIDIA. Espera-se que o modelo, juntamente com conjuntos de dados galeses de treinamento e avaliação, seja disponibilizado para uso por instituições, empresas e pelo setor público, permitindo a realização de pesquisas adicionais, o treinamento de novos modelos e o desenvolvimento de aplicações.

Apoio aos serviços públicos e às línguas locais

O primeiro-ministro britânico, Keir Starmer, afirmou que permitir que a inteligência artificial raciocine em galês pode tornar os serviços públicos, da saúde à educação, acessíveis a todos na língua em que vivem. O projeto está ligado aos esforços do governo galês para promover o uso ativo da língua, no âmbito da iniciativa Cymraeg 2050, que tem como objetivo alcançar um milhão de falantes de galês até 2050.

O modelo pode ajudar instituições públicas e empresas que operam no País de Gales a traduzir conteúdo ou oferecer chatbots bilíngues. Isso inclui prestadores de serviços de saúde, professores, meios de comunicação, varejistas e proprietários de restaurantes, ajudando-os a disponibilizar conteúdo escrito em galês, além do inglês.

A iniciativa foi fundada em 2023 com o nome BritLLM, é liderada pela University College London e anteriormente lançou dois modelos para línguas utilizadas no Reino Unido. A equipe do UK-LLM pretende aplicar a mesma metodologia a outras línguas, incluindo córnico, irlandês, escocês e gaélico escocês, e também planeja colaborar com entidades internacionais para desenvolver modelos para línguas da África e do Sudeste Asiático.

Dados de treinamento e infraestrutura computacional

A equipe de desenvolvimento utilizou o modelo Llama Nemotron Super, que contém 49 bilhões de parâmetros, e o modelo Nemotron Nano, que contém 9 bilhões de parâmetros, e depois realizou treinamento adicional com dados em galês. Devido à disponibilidade limitada de dados em galês em comparação com o inglês e o espanhol, a equipe recorreu aos microsserviços NVIDIA NIM específicos para gpt-oss-120b e DeepSeek-R1 para traduzir do inglês para o galês os conjuntos de dados abertos do Nemotron, que incluem mais de 30 milhões de entradas.

Os trabalhos de tradução e treinamento foram executados usando um cluster de GPUs por meio da plataforma NVIDIA DGX Cloud Lepton, além de centenas de chips NVIDIA GH200 Grace Hopper Superchips no supercomputador Isambard-AI. O computador está localizado na Universidade de Bristol e conta com um investimento do governo britânico de 225 milhões de libras esterlinas.

Revisão linguística e disponibilização para desenvolvedores

A Universidade de Bangor apoia o projeto com sua experiência linguística e cultural, enquanto Gruffudd Prys e sua equipe revisam a precisão dos dados de treinamento traduzidos automaticamente e dos dados de avaliação traduzidos manualmente. A equipe também avalia a capacidade do modelo de lidar com características sutis do galês, como a alteração das consoantes no início das palavras de acordo com as palavras vizinhas.

A Nscale, provedora britânica de serviços de nuvem para inteligência artificial, disponibilizará o novo modelo aos desenvolvedores por meio de uma interface de programação de aplicações. A equipe do UK-LLM considera que a estrutura utilizada pode servir de base para o desenvolvimento de modelos multilíngues, aproveitando os modelos Nemotron e seus dados e descrições disponibilizados publicamente.

Fonte da notícia
NVIDIA AI Blog
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias