Инициатива UK-LLM разрабатывает модель искусственного интеллекта, способную рассуждать на английском и валлийском языках, чтобы поддержать предоставление государственных услуг, таких как здравоохранение, образование и юридические ресурсы, на валлийском языке, на котором говорят около 850 000 человек в Уэльсе.
Новая модель основана на открытом семействе NVIDIA Nemotron и разработана University College London совместно с Бангорским университетом и NVIDIA. Ожидается, что модель, а также наборы данных для обучения и оценки на валлийском языке будут доступны учреждениям, компаниям и государственному сектору, что позволит проводить дополнительные исследования, обучать новые модели и разрабатывать приложения.
Поддержка государственных услуг и местных языков
Премьер-министр Великобритании Кир Стармер заявил, что способность искусственного интеллекта рассуждать на валлийском языке может сделать государственные услуги — от здравоохранения до образования — доступными для всех на языке, на котором они живут. Проект связан с усилиями правительства Уэльса по расширению активного использования языка в рамках инициативы Cymraeg 2050, которая предусматривает достижение 1 миллиона носителей валлийского языка к 2050 году.
Модель может помочь государственным учреждениям и компаниям, работающим в Уэльсе, переводить контент или предоставлять двуязычных чат-ботов. Это касается поставщиков медицинских услуг, преподавателей, средств массовой информации, розничных продавцов и владельцев ресторанов, помогая им предоставлять письменный контент на валлийском языке наряду с английским.
Инициатива была создана в 2023 году под названием BritLLM; её возглавляет University College London, и ранее она выпустила две модели для языков, используемых в Великобритании. Команда UK-LLM намерена применить ту же методологию к другим языкам, включая корнский, ирландский, шотландский и шотландский гэльский, а также планирует сотрудничать с международными организациями для разработки моделей языков Африки и Юго-Восточной Азии.
Данные для обучения и вычислительная инфраструктура
Команда разработчиков использовала модель Llama Nemotron Super, включающую 49 миллиардов параметров, и модель Nemotron Nano, включающую 9 миллиардов параметров, а затем провела их последующее обучение с использованием данных на валлийском языке. Из-за ограниченного объёма доступных данных на валлийском языке по сравнению с английским и испанским команда привлекла микросервисы NVIDIA NIM для gpt-oss-120b и DeepSeek-R1, чтобы перевести открытые наборы данных Nemotron, содержащие более 30 миллионов записей, с английского на валлийский.
Перевод и обучение выполнялись с использованием кластера GPU через платформу NVIDIA DGX Cloud Lepton, а также сотен чипов NVIDIA GH200 Grace Hopper Superchips на суперкомпьютере Isambard-AI. Компьютер расположен в Бристольском университете и поддерживается инвестициями британского правительства в размере 225 миллионов фунтов стерлингов.
Языковая проверка и доступ для разработчиков
Бангорский университет поддерживает проект своей лингвистической и культурной экспертизой, а Гриффудд Прайс и его команда проверяют точность автоматически переведённых данных для обучения и переведённых вручную данных для оценки. Команда также оценивает способность модели работать с тонкими особенностями валлийского языка, такими как изменение согласных в начале слов в зависимости от соседних слов.
Компания Nscale, британский облачный поставщик услуг искусственного интеллекта, предоставит новую модель разработчикам через API. Команда UK-LLM считает, что использованная структура может стать основой для разработки многоязычных моделей благодаря открыто доступным моделям Nemotron, их данным и описаниям.