앤트로픽이 Claude Opus 5.5를 출시했다. 이전 모델보다 일반적인 작업 비용을 40% 낮추고 코딩·컴퓨터 사용·지식 업무 성능을 높였다고 밝혔다.
앤트로픽은 22일 공식 발표에서 Opus 5.5를 Claude 5.5 제품군의 첫 모델로 공개했다. 모델 안내에는 Opus 5.5가 Claude와 Claude Platform에서 제공된다고 설명돼 있다.
앤트로픽은 자체 자동 행동 감사에서 Opus 5.5가 지금까지 시험한 모델 가운데 가장 강한 성능을 보였다고 밝혔다. 다만 벤치마크 점수 차이가 실제 업무 성능 차이를 완전히 보여주지는 않는다고 덧붙였다.
가격은 입력 토큰 100만개당 4달러(약 5500원), 출력 토큰 100만개당 20달러(약 2만8000원)다. Opus 5의 입력 5달러(약 6880원), 출력 25달러(약 3만4400원)보다 각각 20% 낮다.
캐시 읽기 비용은 토큰 100만개당 0.20달러(약 275원)로 책정됐다. 기존 0.50달러(약 688원)보다 60% 줄어든 수준이다.
캐시 읽기는 이전에 저장된 문맥을 다시 활용하는 방식이다. 반복적으로 긴 문서를 처리하거나 같은 작업 흐름을 이어갈 때 입력 내용을 다시 계산하는 부담을 줄이는 데 쓰인다.
앤트로픽은 기본 설정에서 일반적인 작업 비용이 Opus 5보다 40% 낮아진다고 설명했다. 출력 생성 속도도 30% 이상 빨라졌으며, 프로·맥스·팀 요금제의 5시간 사용 한도도 확대했다.
성능 시험에서는 코딩과 컴퓨터 사용, 지식 업무 부문의 개선 폭이 나타났다. Terminal-Bench 4.0에서 Opus 5.5는 66.4%를 기록했고, Fable 5.1과 Opus 5는 각각 55.8%, 52.3%였다.
지식 업무를 평가하는 GDPval-AA v2.1에서는 Opus 5.5가 1846점을 기록했다. Fable 5.1은 1735점, Opus 5는 1708점으로 Opus 5.5보다 낮았다.
앤트로픽은 자체 평가에서 Opus 5.5와 Fable 5.1의 실제 업무 격차가 벤치마크 수치보다 좁게 나타났다고 밝혔다. 벤치마크 우위가 모든 업무에서 같은 수준의 성능 차이로 이어지는 것은 아니라는 의미다.
코딩 작업에서는 대규모 코드베이스를 다루는 능력을 강조했다. 초기 시험자는 68만줄 규모의 코드 이전 작업을 하루 안에 끝냈고, 20만줄 규모 코드베이스의 점검과 수정은 3시간 이내에 마쳤다고 앤트로픽은 설명했다.
같은 20만줄 규모 작업에서 Opus 5는 20시간 이상 걸렸다. 앤트로픽은 이를 통해 새 모델이 여러 단계의 코딩 작업을 이어서 수행하는 데 강점을 보였다고 밝혔다.
안전 장치는 Fable 5.1과 유사한 수준으로 적용된다. 앤트로픽은 Opus 5.5가 생물학과 사이버보안 분야에서 Claude Mythos 5.1에 필적한다고 보고, 해당 분야에 별도 보호 체계를 적용한다고 밝혔다.
생명과학 검증 프로그램은 신청할 수 있다. 사이버보안 검증 프로그램 접근은 수주 안에 확대할 예정이다.
앤트로픽은 Opus 5.5가 이전 모델보다 전문용어를 덜 사용하고 핵심 정보를 문장 앞에 배치한다고 설명했다. Sonnet 5.5와 Haiku 5.5는 앞으로 수주 안에 출시할 예정이다.

김하린 기자
댓글0
첫 댓글을 남겨 보세요.