오픈AI의 GPT-6 솔(Max)이 Agent Arena에서 순개선율 7.68%로 6위를 기록했다. API 가격은 GPT-5.6 솔 프로모션 가격보다 입력·출력 기준 각각 50% 낮아졌다.
오픈AI는 22일 GPT-6 솔과 GPT-6 루나를 공개했다. GPT-6 솔의 API 가격은 100만 토큰당 입력 2달러(약 2738원), 출력 10달러(약 1만3690원)다. 앞서 공개된 GPT-6 솔·루나의 API 가격과 비교하면 GPT-5.6 솔 프로모션 가격보다 비용이 절반으로 낮아졌다.
Agent Arena 공식 순위에는 GPT-6 솔(Max)이 순개선율 7.68%로 6위에, GPT-5.6 솔(xHigh)은 6.16%로 8위에 올라 있다.
Agent Arena의 순개선율은 단일 시험 점수가 아니다. 실제 에이전트 세션에서 작업 성공 여부, 사용자의 긍정·부정 반응, 수정 지시 이행, 명령어 오류 복구, 존재하지 않는 도구 호출 여부 등을 종합해 산출한다.
평가 과정에서는 모델 자체의 효과와 도구·하네스 구성의 효과를 나누기 위해 무작위 배정과 인과 추적 방식을 활용한다. 따라서 순개선율은 일반적인 코딩 벤치마크 점수나 모델의 절대 정확도를 의미하지 않는다.
Agent Arena에 표시된 GPT-6 솔의 세션당 비용 중앙값은 0.74달러다. GPT-5.6 솔은 0.91달러로, 두 모델의 실제 세션 비용에도 차이가 나타났다.
GPT-6 솔은 AutomationBench 1.0.6에서 xhigh 설정 기준 33.2%의 점수와 작업당 0.27달러의 비용을 기록했다. 이는 모델의 성능과 함께 한 작업을 완료하는 데 드는 비용을 함께 제시한 결과다.
DeepSWE v1.1에서는 68.8%를 기록했다. 클로드 페이블 5의 최고 점수 69.9%에 근접했으며, 작업당 비용은 약 80% 낮았다고 오픈AI는 밝혔다.
다만 이 같은 비교는 모델별 설정과 평가 환경이 같다고 보기 어렵다. 같은 모델이라도 추론 수준, 도구 구성, 작업 유형에 따라 성공률과 비용이 달라질 수 있다.
오픈AI는 GPT-6 솔의 차별점으로 최고 성능보다 반복 작업의 비용 효율을 내세웠다. 업무 자동화처럼 같은 유형의 작업을 여러 차례 수행하는 환경에서는 토큰 단가와 함께 작업당 비용이 주요 지표가 될 수 있다.
명목상 API 가격과 실제 세션 비용은 다를 수 있다. 에이전트가 몇 차례 도구를 호출하는지, 작업 실패 뒤 재시도하는지, 대화가 얼마나 길어지는지에 따라 최종 비용이 달라지기 때문이다.
오픈AI는 업무 자동화 평가에서 GPT-6 솔이 클로드 오퍼스 5보다 높은 점수를 기록하면서 작업당 비용은 9% 수준이었다고 밝혔다. 이 수치 역시 특정 평가 환경에서 나온 결과로, 모든 작업에 그대로 적용되는 비용 우위를 뜻하지는 않는다.
이용자 반응은 엇갈렸다. 일부 이용자는 낮아진 사용량과 비용을 긍정적으로 평가했지만, 레딧 일부 이용자는 특정 코딩 작업에서 GPT-6 솔이 GPT-5.6 솔보다 느리거나 결과가 약했다고 주장했다.
레딧 이용자들의 평가는 개별 사용 경험에 기반한 반응이다. 전체 성능을 판단하려면 Agent Arena의 순개선율과 개별 벤치마크 점수뿐 아니라 업무별 성공률, 도구 호출 횟수, 재시도 비용을 함께 살펴야 한다.
GPT-6 솔의 공개 가격과 Agent Arena 순위는 확인됐지만, 원문에서 언급한 4000건 이상의 실제 에이전트 세션 규모는 오픈AI나 Agent Arena의 공개 문서에서 별도로 확인되지 않았다. GPT-6 솔의 평가 결과는 비용과 성능을 함께 비교하는 기준을 제시했지만, 실제 비용은 사용 환경에 따라 달라진다.

서지우 기자
댓글0
첫 댓글을 남겨 보세요.