오픈AI, 수학 원고 ‘722편’ 공개…AI 경쟁 ‘지식 생산’으로

오픈AI가 미공개 내부 프런티어 모델로 생성한 수학 연구 결과를 대규모로 공개했다. 기존 벤치마크 점수 경쟁을 넘어, AI가 새로운 연구 결과를 만들고 외부 검증에 필요한 산출물까지 제공하는 단계로 평가 무대가 옮겨가고 있다.

오픈AI는 6일 공식 발표와 함께 공개한 깃허브 저장소에서 수학 원고 722편과 372개 결과군을 공개했다고 밝혔다. 각 결과군에는 핵심 결과·보조 논증·파생 결과·대안 증명 등이 포함될 수 있다.

오픈AI의 저장소 설명에 따르면 기존 수학 평가에서 모델 성능이 포화되자 약 4000개의 미해결 연구 문제로 평가 범위를 넓혔다. 결과 하나에 투입된 연산량은 평균적으로 해당 모델을 이용한 ‘챗GPT 프로 사고 연산’ 약 3시간 분량이라고 회사는 추산했다.

다만 4000개 문제와 372개 결과군을 단순 비교해 성공률을 계산할 수는 없다. 하나의 문제에서 여러 원고가 나올 수 있고, 오픈AI가 자체적으로 중요도를 판단해 결과를 선별했기 때문이다. 문제 선정 기준과 탈락한 시도의 전체 분포도 공개되지 않았다.

공개된 연구 목록은 정수론과 대수기하학, 이론 컴퓨터과학, 편미분방정식, 수리물리학 등 17개 분야를 포괄한다. 준리만 가설의 특정 영점 없는 영역, 유리수체 위 힐베르트 열 번째 문제, 원주율의 무리수성 지수 등에 관한 증명을 제시했다고 주장하지만, 이는 아직 수학계의 독립 검토를 거쳐 확립된 결과가 아니다.

이번 공개가 일반적인 모델 벤치마크와 다른 지점은 점수 대신 검토 가능한 연구 산출물이 나왔다는 데 있다. 저장소에는 원고 PDF와 소스 파일, 인용 정보, 수정 이력을 남기는 규칙, 일부 증명의 Lean 형식화 자료가 포함됐다. 주요 결과 10건에 대해서는 모델 추론 과정의 축약 요약도 제공됐다.

Lean 형식화는 자연어 증명을 컴퓨터가 검사할 수 있는 논리식으로 옮긴 것이다. 정해진 공리와 가정 아래 증명 과정에 논리적 빈틈이 없는지 확인할 수 있어 사람의 눈으로만 검토하는 것보다 강한 검증 수단이 된다.

그러나 형식화됐다는 사실만으로 원래 연구 문제가 올바르게 번역됐는지, 가정이 적절한지, 기존 연구와의 관계와 새로움이 충분한지까지 자동으로 보증되지는 않는다. 오픈AI도 모든 원고에 Lean 증명이 붙은 것은 아니며, 형식화되지 않은 결과에는 오류가 있을 수 있다고 명시했다.

결과를 만든 모델도 아직 제품으로 출시되지 않았다. 오픈AI는 모델명과 파라미터 규모, 모델 카드, API 제공 시점 등을 밝히지 않았으며 ‘책임 있는 공개를 추진하고 있다’고만 설명했다. 외부 연구자는 원고와 일부 증명 산출물은 검사할 수 있지만, 같은 조건에서 결과의 생성 과정을 재현할 모델에는 접근할 수 없는 구조다.

오픈AI가 자문한 미국 고등연구소 산하 수학·인공지능 자문그룹은 성명에서 자문 역할이 결과의 영향에 대한 판단이나 오픈AI의 연구 과정에 대한 지지를 뜻하지 않는다고 밝혔다. 공개는 인간이 결과를 이해하고 수학 지식으로 편입하는 과정의 시작일 뿐이며, 최종 평가는 수학계가 맡아야 한다는 입장이다.

자문그룹은 앞서 모델명과 프롬프트, 연산시간·비용, 실패한 문제 수를 공개하고 가능한 한 증명을 형식화하라고 권고했다. 또 AI 연구소가 독점 모델로 첨단 수학 문제를 먼저 풀 경우 연구 도구 접근성에 따라 수학계가 계층화될 수 있다고 경고했다.

이번 공개로 AI 연구 경쟁의 병목도 달라질 가능성이 커졌다. 모델이 수백 건의 연구 주장을 만드는 속도가 전문가의 검토 속도를 앞서면, 희소해지는 것은 증명 초안이 아니라 이를 검증하고 기존 지식과 연결해 설명할 사람과 계산 자원이다.

향후 모델의 과학 역량은 시험 점수 하나보다 어떤 문제를 선택했는지, 실패를 얼마나 투명하게 공개하는지, 증명을 기계가 검사할 수 있는 형태로 제공하는지, 오류를 어떻게 수정하는지로 평가될 가능성이 크다. 오픈AI가 공개한 것은 722개의 확정된 정리가 아니라, AI가 지식 생산 단계에 진입했다는 주장과 이를 검증해야 할 대규모 작업 목록이다.

오윤성

오윤성 기자

댓글 남기기