TOKENPOST

소넷 5.5, 에이전트 평가 3위…4위와 점수 차 0.25%p

토포AI로 이 기사 더 깊이 읽기

순위와 성능 점수가 흐릿하게 보이는 평가표 / TokenPost.ai (macro)

클로드 소넷 5.5(Max)가 Agent Arena 공개 순위에서 순 개선 점수 12.52%로 3위를 기록했다. 4위 GPT-6 아스트라(Max)와의 점수 차는 0.25%포인트로, 소넷 5.5의 오차 범위보다 작다.

Arena.ai는 10월 2일 공개한 순위표에서 클로드 패블 5.1(Max)이 14.31%로 1위, 클로드 오퍼스 5.5(High)가 13.82%로 2위에 올랐다고 밝혔다. GPT-6 아스트라(Max)는 12.27%를 기록했다.

소넷 5.5 점수의 오차 범위는 ±3.09%다. 이번 결과는 해당 평가에서 소넷 5.5가 상위권에 들었다는 것을 보여주지만, GPT-6 아스트라보다 성능이 확실히 높다는 뜻으로 해석하기는 어렵다.

Agent Arena는 일반적인 질의응답 선호도 평가와 방식이 다르다. Arena.ai는 실제 에이전트 작업에서 작업 성공, 사용자 피드백, 도구 사용 등 여러 신호를 평균적인 오케스트레이터와 비교해 순 개선 점수를 산출한다고 설명한다. 이 점수는 에이전트 시스템의 작업 수행 개선 정도를 요약하며 모든 업무에서의 모델 우열을 나타내지는 않는다.

순위표에는 성능 점수와 함께 비용·출력량도 제시됐다. 소넷 5.5의 작업당 중앙값 비용은 2.76달러(약 3754원), 출력 토큰 중앙값은 11만5800개다. 앤트로픽은 토큰 가격을 입력 100만개당 2달러(약 2720원), 출력 100만개당 10달러(약 1만3600원)로 공개했다. 작업당 비용은 사용량과 작업 내용에 따라 달라질 수 있어 토큰 가격만으로 실제 비용 효율을 판단하기 어렵다.

앤트로픽은 9월 28일 소넷 5.5를 공개하며 코딩과 다단계 작업 성능을 강조했다. 회사 자체 평가와 Agent Arena 순위는 설정과 기준이 달라 직접 같은 지표로 비교할 수 없다. 에이전트 모델 비교에서는 앞서 공개된 GPT-6 솔의 Agent Arena 점수와 가격처럼 성능 순위와 함께 실제 작업의 비용·토큰 사용량도 살펴볼 필요가 있다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.