Японская компания Preferred Networks (PFN) рассматривает разработку своей языковой модели PLaMo с нуля как способ контролировать ключевые решения при создании модели, а не просто как попытку конкурировать с американскими и китайскими моделями по показателям производительности. По словам 田中大輔, руководителя отдела разработки больших языковых моделей компании, значение этого подхода заключается в том, что PFN с самого начала непосредственно участвует в определении архитектуры, данных и методов обработки.
Об этом говорилось в интервью с 田中大輔 и ムジビヤ・アディヤン, руководителем отдела планирования больших языковых моделей и ответственным за PreferredAI, в рамках обсуждения границ применимости определения моделей искусственного интеллекта как «локальных». Этот термин не имеет единого определения: некоторые компании используют открытые модели, разработанные сторонними организациями, а затем дополняют их обучением, ориентированным на японский язык или конкретные области, тогда как PFN выбрала создание PLaMo по принципу «полной разработки с нуля» (Full Scratch).
Контроль над данными повышает интерпретируемость
PFN связывает самостоятельную разработку с возможностью более чётко нести ответственность перед клиентами. Во многих открытых моделях доступна лишь часть информации, например параметры, влияющие на результаты, тогда как обучающие данные и методы разработки полностью не раскрываются. Когда открытую модель дополнительно обучают на новых данных, определить источник конкретного поведения или проблемы в результатах становится сложнее.
В случае PLaMo компания заявляет, что может в большей степени выбирать наборы данных, используемые для обучения, и знать их характеристики. Это особенно важно для компаний, работающих с интеллектуальной собственностью и вынужденных отвечать на вопросы о возможном наличии в обучающих материалах данных, нарушающих авторские права. PFN также считает, что знание этапов обучения помогает расследовать причины ошибок, даже несмотря на то, что некоторые аспекты генеративных моделей остаются полностью неинтерпретируемыми.
田中 приводит в качестве примера галлюцинации: если PLaMo даст неправильный ответ, компания может связать проблему с конкретной частью набора данных и исправить её. В модели, построенной поверх открытой модели, определить причину удаётся не всегда.
Проектирование с ориентацией на японский язык
По мнению PFN, польза разработки с нуля не ограничивается прозрачностью. Компания спроектировала PLaMo с учётом знаний, связанных с японской культурой и особенностями Японии, а также разработала собственный языковой анализатор, известный как Tokenizer, для преобразования текста в единицы, которые может обрабатывать модель.
PFN заявляет, что при обработке японского языка этот анализатор использует примерно на 20–30% меньше токенов по сравнению с анализаторами зарубежных моделей. Количество токенов влияет на эффективность и стоимость обработки, поэтому компания считает, что улучшение этого показателя может дать локальным моделям практическое преимущество даже при конкуренции с моделями с высокими общими возможностями.
Полный контроль над циклом обучения также позволяет создавать наборы данных, связанные с конкретными целями. Это может помочь при создании специализированных моделей для таких областей, как финансовый сектор, поскольку становится проще определить, какие данные нужны для усиления определённого показателя производительности.
Преимущество суверенитета против стоимости разработки
PFN рассматривает разработку PLaMo в более широком контексте геополитических рисков и растущей зависимости от искусственного интеллекта как инфраструктуры. Компания указала, что решение правительства США привело в июне к временному приостановлению доступа к моделям Fable 5 и Mythos 5 американской компании Anthropic, отметив, что подобные события показывают, насколько сильно услуги зависят от международных решений.
Однако полная разработка не является самым дешёвым или быстрым вариантом. Она требует больше времени и ресурсов для обучения, чем дополнительное обучение открытой модели, а также может затруднить достижение уровня новейших открытых моделей с точки зрения производительности. Поэтому PFN не исключает совместного использования обоих подходов: в некоторых случаях дообученной открытой модели может быть достаточно; компания упомянула один пример использования в медицинской сфере.
От PLaMo к локальной инфраструктуре
PFN предоставляет свои модели через интерфейс прикладного программирования (API), а также в локальных средах на территории клиента (On-Premises), что подходит организациям, уделяющим приоритетное внимание управлению своими данными. Компания хочет усилить присутствие PLaMo, связав её с внешними инструментами и приложениями, установленными на компьютере, а также развивая возможности автономного выполнения длительных задач и работы со сложными инструкциями на японском языке.
В серию входит модель PLaMo 3.0 Prime, в которой компания сосредоточилась на сочетании высокой производительности в японском языке и низкой стоимости, а также PLaMo翻訳, предназначенная для перевода. По словам 田中, цель заключается в создании модели или сервиса, обеспечивающего японским пользователям наилучшую экономическую эффективность, а не только в повышении способности к рассуждению.
Сама вычислительная инфраструктура по-прежнему остаётся проблемой. PFN использует вычислительные ресурсы внутри Японии и за рубежом, поскольку одних местных ресурсов недостаточно для удовлетворения текущих требований к обучению. Параллельно компания разрабатывает специализированные чипы для искусственного интеллекта и предлагает вертикальную интеграцию, которая в будущем может способствовать локализации вычислительных ресурсов.
В июле PFN объявила о сотрудничестве с японской компанией в области искусственного интеллекта Noetra, получившей инвестиции от крупных японских компаний. Генеральный директор PFN, 大輔岡野原, возглавит разработку модели, а 田中 и несколько инженеров будут направлены в Noetra. На первом этапе проект нацелен на создание модели физического искусственного интеллекта, способной автономно управлять роботами, с использованием вычислительной инфраструктуры местных операторов. Согласно оценке 田中, модель, которую можно будет назвать «по-настоящему локальной», может появиться уже в начале 2027 года.
Опыт PFN показывает, что «локальность» модели не определяется только её производительностью. Это компромисс между контролем над данными и проектированием, способностью интерпретировать ошибки и эффективностью работы с языком, с одной стороны, и стоимостью обучения и скоростью получения новейших возможностей — с другой. Поэтому практическая стратегия компании, по-видимому, заключается скорее в выборе подходящего уровня независимости для каждого варианта использования, чем в рассмотрении разработки с нуля как единственного решения.