人工智能

UK-LLM计划开发能够进行威尔士语推理的人工智能模型

UK-LLM计划与伦敦大学学院、班戈大学和NVIDIA合作,开发一个基于Nemotron、支持威尔士语和英语推理的开放人工智能模型。预计该模型及其数据将向商业和公共部门提供,而Nscale将通过应用程序接口向开发者提供该模型。

2025-09-13
1 分钟阅读
8 浏览量
فريق تحرير certi.news
UK-LLM计划开发能够进行威尔士语推理的人工智能模型

UK-LLM计划正在开发一种能够以英语和威尔士语进行推理的人工智能模型,旨在支持以威尔士语提供医疗保健、教育和法律资源等公共服务。威尔士语在威尔士约有850,000人使用。

这一新模型基于开源的NVIDIA Nemotron系列,由伦敦大学学院与班戈大学和NVIDIA合作开发。预计该模型以及威尔士语训练和评估数据集将向机构、企业和公共部门开放使用,从而开展进一步研究、训练新模型并开发应用程序。

支持公共服务和本地语言

英国首相基尔·斯塔默表示,让人工智能能够以威尔士语进行推理,可以使医疗保健到教育等公共服务都能以人们生活中使用的语言向所有人提供。该项目与威尔士政府在Cymraeg 2050倡议下推动语言积极使用的努力相关,该倡议的目标是到2050年实现100万名威尔士语使用者。

该模型可以帮助在威尔士运营的公共机构和企业翻译内容或提供双语聊天机器人。其中包括医疗保健服务提供者、教师、媒体、零售商和餐馆经营者,帮助他们在英语之外提供威尔士语书面内容。

该倡议于2023年以BritLLM之名成立,由伦敦大学学院领导,此前已经发布了两个面向英国所使用语言的模型。UK-LLM团队计划将同样的方法应用于其他语言,包括康沃尔语、爱尔兰语、苏格兰语和苏格兰盖尔语;该团队还计划与国际机构合作,为非洲和东南亚的语言开发模型。

训练数据和计算基础设施

开发团队使用了包含490亿个参数的Llama Nemotron Super模型,以及包含90亿个参数的Nemotron Nano模型,随后利用威尔士语数据对这两个模型进行了进一步训练。由于可用的威尔士语数据与英语和西班牙语数据相比有限,团队借助面向gpt-oss-120b和DeepSeek-R1的NVIDIA NIM微服务,将包含超过3,000万条记录的开放Nemotron数据集从英语翻译成威尔士语。

翻译和训练工作使用了通过NVIDIA DGX Cloud Lepton平台提供的GPU集群,并使用了Isambard-AI超级计算机上的数百块NVIDIA GH200 Grace Hopper Superchips。该计算机位于布里斯托尔大学,并获得英国政府2.25亿英镑的投资。

语言审校和向开发者开放

班戈大学凭借其语言和文化专业知识支持该项目;Gruffudd Prys及其团队审查机器翻译训练数据和人工翻译评估数据的准确性。团队还评估模型处理威尔士语细微特征的能力,例如词首辅音会根据相邻词语发生变化。

Nscale是一家英国人工智能云服务提供商,将通过应用程序接口向开发者提供这一新模型。UK-LLM团队认为,所采用的框架可以成为开发多语言模型的基础,并利用公开提供的Nemotron模型、数据及其配方。

新闻来源
NVIDIA AI Blog
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻