OpenAI는 아직 일반 사용을 위해 공개하지 않은 내부 인공지능 모델이 생성한 수학 연구 722편을 GitHub에 공개했다. 독립적인 Advisory Group on Mathematics and Artificial Intelligence (AGMAI)의 평가에 따르면, 이 컬렉션은 372개 결과군을 다루며, 오랫동안 해결되지 않은 미해결 문제를 해결하려는 시도도 포함한다.
그러나 이 연구들이 공개되었다고 해서 최종적인 수학적 성과로 인정된다는 의미는 아니다. OpenAI는 결과가 서로 다른 검증 단계에 있으며, 일부 비공식 연구에는 오류가 있을 수 있다고 설명했다. 또한 모든 연구는 수학계의 검토와 통상적인 학술 경로를 통한 확인이 필요하다.
약 4천 개 문제에서 722편의 연구로
모델은 평가 과정에서 약 4천 개의 수학 문제를 시험했다. OpenAI는 중요도에 따라 결과를 선별한 뒤 372개 문제군과 722편의 연구로 구성된 컬렉션을 공개했다. 회사는 하나의 결과를 생성하는 데 평균적으로 ChatGPT Pro 사용자에게 제공되는 추론 능력 약 3시간에 해당하는 컴퓨팅 자원이 필요했다고 밝혔다.
검토 가능성을 높이기 위해 OpenAI는 10개 문제에 관한 추가 데이터도 공개했다. 여기에는 추론 경로에 대한 간략한 요약, 사용된 컴퓨팅 자원의 추정치, 시도한 문제의 수가 포함된다. 사례는 여러 분야에 걸쳐 있으며, π의 비정규성 측도, Mahler 추측, 직접 유한성에 관한 Kaplansky 추측, 3차원 상대론적 Vlasov-Maxwell 계 등이 포함된다.
Lean을 사용한 검증은 포괄적이지 않다
공개된 증명의 상당 부분은 Lean을 사용해 검토되었다. Lean은 컴퓨터가 증명의 논리적 일관성을 검사할 수 있도록 하는 수학 검증 시스템이다. 그러나 현재 컬렉션의 모든 연구가 Lean을 통한 공식 검증을 거친 것은 아니다.
OpenAI는 공식 검증 절차가 완료되면 GitHub 저장소를 업데이트할 예정이다. 회사는 대부분의 결과가 표준화된 절차에 따라 생성되었지만 예외도 있다고 밝혔다. 리만 제타 함수의 영점이 없는 영역에 관한 연구 중 하나는 다른 방식으로 얻었으며, 가독성을 높이기 위해 사람이 그 내용을 편집했다.
이 소식이 중요한 이유
이 컬렉션의 핵심 가치는 연구 수에만 있는 것이 아니라, 검토 가능한 수학적 결과를 생성하는 새로운 방식을 시험한다는 데 있다. 파일, 컴퓨팅 비용 데이터, 추론 요약, 부분적인 자동 검증을 공개함으로써 연구자들은 모델이 재검토 가능한 발견을 생성하는지, 아니면 그럴듯해 보이는 텍스트만 생성하는지 평가하는 데 필요한 요소를 확보할 수 있다.
반면 분명한 한계도 남아 있다. 검증은 완료되지 않았고 인간 및 학술 검토도 끝나지 않았으며, 모델의 결과는 아직 연구자들이 사용할 수 있는 시스템이나 일반 제품을 구성하지 않는다. AGMAI는 인공지능 기업들이 수학적 결과를 학술 경로를 통해 공개하고, 사용된 모델과 비용 및 방법을 밝히며, 발견을 순전히 마케팅 도구로 전환하지 말 것을 촉구한다.
OpenAI는 또한 인공지능이 생성하는 중요한 결과를 이해하기 위해 워크숍, 학회 및 특별 프로그램에 자금을 지원할 예정이라고 밝혔다. 동시에 내부 모델을 책임 있는 방식으로 이용할 수 있도록 하는 작업도 진행하고 있다. 따라서 이번 컬렉션은 인공지능이 생성한 과학적 결과를 어떻게 기록할지에 대한 시험적 단계이지, 모델의 수학적 능력에 대한 최종적인 판단은 아니다.