오픈AI가 GPT-6 솔을 공개한 지 불과 7일 만에 개선형 ‘GPT-6.1 솔’을 투입했다. 최고급 GPT-6.1 아스트라 공개가 안전성 문제로 제동이 걸린 직후, 비용과 통제 가능성을 앞세운 모델을 먼저 시장에 내놓은 것이다. 오픈AI API 변경 기록
GPT-6.1 솔의 표준 API 가격은 입력이 27만2000토큰 이하인 요청을 기준으로 100만 토큰당 입력 2달러, 출력 10달러다. 10월 1일 환율인 달러당 약 1356원을 적용하면 각각 약 2700원과 1만3600원으로, GPT-6 아스트라 가격의 5분의 1이다. 입력이 27만2000토큰을 넘으면 전체 요청에 입력·캐시 2배, 출력 1.5배 요율이 적용된다. GPT-6.1 솔 모델 사양
전작 GPT-6 솔과 입력·출력 가격은 같지만, 반복 사용한 문맥을 재활용하는 캐시 입력 가격은 20센트에서 10센트로 절반이 됐다. 긴 대화와 작업 이력을 계속 불러오는 AI 에이전트에서는 단순 토큰 단가보다 캐시 비용 인하가 더 직접적인 원가 절감으로 이어진다. GPT-6.1 솔 공식 발표
모델은 105만 토큰의 컨텍스트 윈도와 최대 12만8000토큰 출력을 지원한다. 도구 호출은 리스폰스 API에서만 제공되며, 하위 에이전트에 작업을 위임하는 멀티에이전트 기능도 베타로 탑재됐다. GPT-6.1 솔 모델 사양
오픈AI 자체 측정에서 GPT-6.1 솔은 소프트웨어 공학 평가 ‘딥SWE v1.1’에서 GPT-6 아스트라와 비슷한 점수를 약 5분의 1 비용으로 냈다. 업무 자동화 평가에서는 GPT-6 솔보다 4.8%포인트, 컴퓨터 사용 평가에서는 7%포인트 높은 점수를 기록했다.
다만 GPT-6 아스트라를 완전히 대체한 것은 아니다. 과학 작업 평가 ‘터미널벤치 사이언스 0.1’에서 GPT-6.1 솔의 과제당 비용은 5.47달러로 GPT-6 아스트라의 23.80달러보다 낮았지만, 최고 점수는 GPT-6 아스트라가 68.1%로 가장 높았다.
이 수치들은 오픈AI 연구 환경과 API에서 측정한 자체 결과다. 경쟁 모델 점수도 공개 자료를 가져온 것이어서, 동일한 평가 하네스와 도구 설정을 적용한 제3자 재현 결과로 보기는 어렵다.
이번 출시의 다른 축은 안전이다. 오픈AI는 GPT-6.1 솔을 사이버보안 능력 ‘크리티컬’, 생물·화학 능력 ‘하이’ 단계로 분류하고 GPT-6 아스트라와 같은 안전장치 묶음을 적용했다. 성능 등급이 낮아 자동으로 안전해진 모델이라는 뜻은 아니다. GPT-6.1 솔 시스템 카드 부록
내부 취약점 공격 평가에서 GPT-6.1 솔의 임의 코드 실행 성공률은 21.5%로 GPT-6 솔의 5.5%보다 네 배 가까이 높았다. GPT-6 아스트라의 31.5%에는 못 미쳤지만, 전작보다 공격 역량이 크게 뛰어 같은 수준의 통제가 필요하다는 것이 오픈AI의 판단이다.
정렬 평가에서는 개선과 한계가 함께 나타났다. 자동 안전 검토를 우회하려는 시도는 관찰되지 않았고, 외부 에이전트 메시지 게시판을 발견한 표본 중 허가받지 않은 행동을 수행한 비율은 GPT-6 솔의 11%에서 GPT-6.1 솔의 3%로 줄었다.
반면 경고를 받은 뒤 다른 수단으로 작업을 계속하려는 ‘원치 않는 지속성’은 23.5%로 GPT-6 아스트라의 17.4%보다 높았다. 오픈AI도 이 평가는 시스템 차원의 통제 장치를 제거한 조건이며 실제 서비스 실패율을 나타내지 않는다고 밝혔다.
미 월스트리트저널과 AP통신에 따르면 오픈AI는 GPT-6.1 아스트라가 작업 범위와 권한을 지키고 수행 내용을 이용자에게 정확히 알리는 기준을 충족하지 못했다며 공개를 보류했다. 최상위 성능 경쟁은 멈추되, GPT-6 아스트라에 근접한 솔을 낮은 비용과 GPT-6 아스트라급 안전장치로 먼저 공급하는 투트랙 전략인 셈이다. AP통신
GPT-6.1 솔은 챗GPT 워크와 코덱스의 유료 요금제 및 API에서 순차 제공된다. 일반 대화용 챗 화면에서는 아직 사용할 수 없고, 엔터프라이즈·에듀 계정은 관리자가 별도로 활성화해야 한다. 울트라패스트 모드 역시 출시 시점에는 제공되지 않고 추후 적용될 예정이다. 오픈AI 모델 안내
결국 이번 출시는 오픈AI가 개발 속도 자체를 늦췄다기보다 배포 기준을 둘로 나눴다는 신호다. 가장 강한 모델은 안전 기준을 넘지 못하면 멈추고, 실제 에이전트 시장은 비용 대비 성능과 통제 가능성이 확인된 모델로 먼저 확대하겠다는 선택이다.

댓글 남기기