일본 기업 Preferred Networks(PFN)는 자체 언어 모델 PLaMo를 처음부터 개발하는 것을 미국과 중국 모델의 성능 지표에서 경쟁하려는 단순한 시도가 아니라, 모델 구축의 핵심 결정에 대한 통제력을 확보하는 수단으로 보고 있다. 회사의 대규모 언어 모델 개발 부문장 田中大輔에 따르면, 이 접근 방식의 중요성은 PFN이 처음부터 설계, 데이터, 처리 메커니즘을 직접 결정하는 데 있다.
이는 田中大輔 및 대규모 언어 모델 기획 부문장이자 PreferredAI를 담당하는 ムジビヤ・アディヤン과의 인터뷰에서 나왔다. 인터뷰에서는 인공지능 모델을 ‘현지형’이라고 부르는 것의 한계를 논의했다. 이 용어에는 통일된 정의가 없다. 일부 기업은 외부 기관이 개발한 오픈 모델을 기반으로 일본어 또는 특정 분야에 초점을 맞춘 추가 학습을 진행하는 반면, PFN은 ‘완전한 처음부터 개발’(Full Scratch) 방식으로 PLaMo를 구축하는 방식을 선택했다.
데이터 통제가 해석 가능성을 높인다
PFN은 자체 개발과 고객에 대해 더 명확한 책임을 질 수 있는 능력을 연결한다. 많은 오픈 모델에서는 출력에 영향을 미치는 매개변수와 같은 정보의 일부만 제공되고, 학습 데이터와 개발 방식은 완전히 공개되지 않는다. 오픈 모델을 추가 데이터로 재학습하면 특정 행동이나 출력 문제의 원인을 파악하기가 더욱 어려워진다.
PLaMo의 경우 회사는 학습에 사용되는 데이터 세트를 선택하고 그 특성을 더 잘 파악할 수 있다고 말한다. 이 점은 지식재산권을 다루며 학습 자료에 저작권을 침해하는 데이터가 포함되었을 가능성에 관한 질문에 답해야 하는 기업에서 특히 중요하다. 또한 PFN은 학습 단계에 대한 지식을 보유하면 생성형 모델의 일부 측면이 완전히 해석하기 어렵더라도 오류의 원인을 조사하는 데 도움이 된다고 본다.
田中은 환각을 예로 든다. PLaMo가 잘못된 답변을 제시하면 회사는 문제를 데이터 세트의 특정 부분과 연결해 이를 수정할 수 있을지도 모른다. 반면 오픈 모델 위에 구축된 모델에서는 원인을 항상 특정할 수 있는 것은 아니다.
일본어를 겨냥한 설계
PFN에 따르면 처음부터 개발하는 방식의 이점은 투명성에만 국한되지 않는다. 회사는 일본의 문화와 특성에 관련된 지식을 고려해 PLaMo를 설계했으며, 텍스트를 모델이 처리할 수 있는 단위로 변환하는 Tokenizer라는 자체 언어 분석기도 개발했다.
PFN은 이 분석기가 일본어를 처리할 때 외부 모델의 분석기와 비교해 약 20~30% 적은 토큰을 사용한다고 말한다. 토큰 수는 처리 효율과 비용에 영향을 미치므로, 회사는 이 부분을 개선하면 높은 범용 능력을 갖춘 모델과 경쟁하는 상황에서도 현지 모델에 실질적인 이점을 제공할 수 있다고 본다.
또한 전체 학습 주기를 보유하면 특정 목표와 관련된 데이터 세트를 구축할 수 있다. 이는 금융 부문과 같은 분야에 특화된 모델을 만들 때 도움이 될 수 있으며, 특정 성능을 강화하는 데 필요한 데이터 유형을 더 쉽게 지정할 수 있게 한다.
주권의 이점과 개발 비용
PFN은 PLaMo 개발을 지정학적 위험 및 인공지능이 인프라로서 점점 더 많이 사용되는 현상과 관련된 더 넓은 맥락에 놓고 있다. 회사는 미국 정부의 결정으로 6월에 미국 기업 Anthropic의 Fable 5와 Mythos 5 모델 이용이 일시적으로 중단된 일을 언급하며, 이러한 사건은 서비스가 국제적 결정에 얼마나 영향을 받는지 보여준다고 평가했다.
그러나 완전한 처음부터 개발하는 방식은 가장 저렴하거나 빠른 선택지는 아니다. 오픈 모델에 추가 학습을 적용하는 방식보다 더 많은 시간과 학습 자원이 필요하며, 성능 측면에서 최신 오픈 모델을 따라잡기 어려워질 수도 있다. 따라서 PFN은 두 방식을 함께 사용하는 가능성을 배제하지 않는다. 일부 용도에서는 재학습한 오픈 모델로 충분할 수 있으며, 회사는 의료 분야의 사용 사례가 있다고 밝혔다.
PLaMo에서 현지 인프라로
PFN은 API(애플리케이션 프로그래밍 인터페이스)를 통해서뿐만 아니라 고객사 내부의 로컬 환경(On-Premises)에서도 모델을 제공하며, 이는 데이터 관리를 우선시하는 조직에 적합하다. 회사는 PLaMo를 외부 도구 및 컴퓨터에 설치된 애플리케이션과 연결하고, 장시간의 작업을 자율적으로 수행하며 복잡한 일본어 지시를 처리하는 능력을 개발함으로써 PLaMo의 입지를 강화하고자 한다.
제품군에는 높은 일본어 성능과 낮은 비용의 결합에 초점을 맞춘 PLaMo 3.0 Prime과 번역에 특화된 PLaMo翻訳가 포함된다. 田中은 목표가 추론 능력을 높이는 데 그치지 않고 일본 사용자에게 비용 측면에서 가장 뛰어난 효율을 제공하는 모델이나 서비스에 도달하는 것이라고 말한다.
컴퓨팅 인프라 자체도 여전히 과제다. PFN은 일본 내 컴퓨팅 자원만으로는 현재의 학습 요구 사항에 경쟁할 수 없기 때문에 일본 내외의 컴퓨팅 자원을 모두 사용한다. 동시에 회사는 인공지능 전용 칩을 개발하고 있으며, 향후 컴퓨팅 자원의 현지화를 지원할 수 있는 수직적 통합을 추진하고 있다.
7월에 PFN은 일본의 인공지능 기업 Noetra와의 협력을 발표했다. Noetra는 일본 대기업들의 투자를 받고 있다. PFN의 최고경영자 大輔岡野原가 모델 개발을 이끌며, 田中과 여러 엔지니어가 Noetra에 파견된다. 이 프로젝트는 우선 현지 운영자가 보유한 컴퓨팅 인프라를 사용해 로봇을 자율적으로 작동시킬 수 있는 물리적 인공지능 모델을 구축하는 것을 목표로 한다. 田中의 추정에 따르면 ‘진정한 현지형’이라고 부를 수 있는 모델이 이르면 2027년에 등장할 수 있다.
PFN의 경험이 보여주는 것은 모델의 ‘현지성’이 성능만으로 판단되는 것이 아니라는 점이다. 이는 한편으로 데이터와 설계에 대한 통제, 오류 해석 능력, 언어 효율성을, 다른 한편으로 학습 비용과 최신 능력에 도달하는 속도를 서로 절충하는 문제다. 따라서 회사의 실질적인 전략은 처음부터 개발하는 방식을 유일한 해법으로 보기보다는 각 사용 사례에 적합한 독립성의 수준을 선택하는 데 더 가까워 보인다.