TypeSafe AI가 Jev 모델을 출시했다. 이 인공지능 모델은 Transformer 아키텍처를 기반으로 하지만 대규모 언어 모델에 속하지 않으며 사용자에게 텍스트를 생성하지도 않는다. 대신 개발자가 필요한 출력 유형을 미리 지정하면, 회사가 ‘보정된 결정’이라고 부르는 항목에 대한 확률을 반환한다.
회사는 ChatGPT 구축에 참여하고 인간 피드백을 통한 강화학습(RLHF) 기술 개발에 기여한 전 OpenAI 연구자 Diogo Almeida가 이끌고 있다. Almeida는 인공지능 모델이 인간 언어를 다루는 능력 향상에 지나치게 집중해 왔지만, 소프트웨어 자동화에는 컴퓨터가 직접 사용할 수 있는 더욱 엄격하고 제어 가능한 출력이 필요하다고 말한다.
더 높은 속도와 더 낮은 비용
TypeSafe AI는 언어 생성을 피하기 때문에 Jev가 빠르고 저렴하며, 사용자가 가능한 결과를 미리 지정하므로 환각 가능성도 낮아진다고 말한다. 원문 자료에 따르면 회사는 출력 토큰에 요금을 부과하지 않으며, 입력 토큰은 백만 단위가 아니라 10억 단위로 측정된다.
이 모델은 개발자들의 관심을 빠르게 끌었고, 수요 증가로 인해 전용 API가 일시적으로 사용자 서비스를 중단할 정도였다. Vercel이 보안 검토를 목적으로 명령을 분류한 테스트에서 OpenAI 모델을 Jev로 교체하자 소프트웨어 엔지니어 Pranit Sharma에 따르면 5배에서 18배 더 빠른 결과와 더 높은 정확도를 보였다.
상업용 이메일 분류를 대상으로 한 또 다른 테스트에서 Bryo AI의 최고기술책임자 Nikhil Mudholkar는 Gemini가 약간 더 정확했지만 비용은 10배에서 20배 더 높았다고 밝혔다. Mudholkar는 Jev가 반환하는 신뢰도 점수가 자동화에 더 중요하다고 평가했다. 어떤 조치를 실행할지 무시할지를 결정하는 데 사용할 수 있는 확률을 제공하기 때문이다.
실제로 무엇이 달라지는가?
이러한 활용 사례는 Jev가 모든 작업에서 언어 모델을 대체하려는 것은 아님을 보여준다. Jev는 분류, 요청을 적절한 모델로 라우팅하는 작업, 인공지능 에이전트의 결과 모니터링, 또는 제약을 우회하려는 시도 탐지 등을 맡을 수 있다. 이러한 시나리오에서는 빠른 속도와 낮은 비용이 실시간 모니터링을 더욱 실용적으로 만들 수 있다.
그러나 확률에 의존한다고 해서 인간의 판단이나 운영 규칙이 필요 없어지는 것은 아니다. Earendil의 최고기술책임자 Armin Ronacher는 사용자가 50% 또는 95%와 같은 점수를 어떻게 처리할지 정해야 한다고 지적했다. 즉, 출력을 자동화된 조치로 전환하기 전에 명확한 임계값을 설정해야 한다는 뜻이다. 이에 따라 불확실성을 처리하는 일부 책임은 모델에서 애플리케이션 설계로 이동한다.
공개되지 않은 구조와 예상되는 경쟁
TypeSafe AI는 Jev의 구조에 관한 세부 사항을 공개하지 않았으며, 외부 관찰자들은 Jev가 오픈 웨이트 언어 모델 위에 구축되었을 가능성을 의심하고 있다. 원문에서 회사는 이를 확인하지 않았다. TypeSafe AI는 이 모델을 직관과 적절한 작업 선택에 초점을 맞춘 ‘System One 모델’이라고 설명하며, ‘보정된 결정에 의한 강화학습’이라고 부르는 기술을 사용해 합성 데이터만으로 학습했다고 말한다.
certi.news의 분석에 따르면 Jev의 중요성은 단순히 새로운 모델이라는 데 있지 않고, 범용 대화 인터페이스 대신 소프트웨어 내부의 특화된 의사결정 계층으로 인공지능을 제시한다는 데 있다. 언급된 테스트 결과가 사실이라면 이러한 접근법은 출력이 정해진 반복 작업에 적합할 수 있다. 그러나 공개된 비교 자료는 제한적이며, 서로 다른 분야나 작업 부하에서의 성능을 판단하기에는 그 자체로 충분하지 않다. 또한 구조와 데이터 생성 방식이 불분명해 검증 가능성과 확장성에 관한 의문도 남는다.
TypeSafe AI는 다양한 방식으로 작동하는 다른 모델 버전을 구축할 계획이며, Ronacher는 이러한 유형의 모델이 실질적인 가치를 제공한다는 점이 분명해지면 경쟁 모델이 등장할 것으로 예상한다.