TOKENPOST

벤치마크 10종서 결함 219개…AI 에이전트 점수 검증 과제

토포AI로 이 기사 더 깊이 읽기

채점 기준에 표시된 벤치마크 평가표 / TokenPost.ai (macro)

UC버클리 연구진이 AI 에이전트 벤치마크 10종을 감사해 219개 결함을 확인했다. 이 결과는 점수만으로 모델의 실제 과제 수행 능력을 판단하기 어렵다는 점을 보여준다.

연구진은 2026년 5월 12일 공개한 논문에서 감사 도구 ‘벤치잭(BenchJack)’을 이용해 과제를 풀지 않고도 높은 점수를 얻는 취약점을 찾았다고 밝혔다. 10종 가운데 9종에서는 실제 과제를 수행하지 않고도 거의 만점에 가까운 점수를 내는 공격을 구현했다. 논문 원문

연구진은 웹 탐색 평가인 WebArena와 데스크톱 작업 평가인 OSWorld를 세 차례 수정해 악용 가능한 과제를 없앴다고 보고했다. 결함은 에이전트와 평가 시스템의 격리 실패, 정답 정보 노출, 채점 로직의 허점 등에서 발생했다.

연구진은 평가 환경 분리, 정답 정보 보호, 채점 방식 점검 등을 담은 점검표도 제안했다. 과제를 실제로 해결하지 않고 평가의 허점을 이용해 점수를 높이는 행위는 보상 해킹으로 불린다.

이번 연구가 벤치마크 점수 전체를 무효로 만들지는 않는다. 다만 평가 환경과 채점 방식에 결함이 있으면 점수가 실제 능력을 제대로 반영하지 못할 수 있어, 벤치마크 순위나 점수만으로 모델의 실전 능력을 단정하기 어렵다.

앤스로픽의 ‘10월 말 최고 AI 모델’ 예측시장 가격은 연구 결과와 별도로 봐야 한다. 폴리마켓 계약 페이지는 10월 3일 낮 12시 45분(한국시간) 기준 구글 64%, 앤스로픽 37%를 표시했다. 계약은 10월 31일 전후에 해결될 예정이다. 폴리마켓 계약 페이지

예측시장 가격은 계약 결과에 대한 거래 참여자의 집단적 평가를 반영한다. 모델의 객관적 순위를 직접 측정하거나 가격 변동 원인을 특정하는 지표는 아니다.

따라서 연구 결과가 앤스로픽 계약 가격 변화에 영향을 줬다는 인과관계는 확인되지 않았다. 이번 연구는 벤치마크 평가 과정의 신뢰성을 점검할 필요성을 제기했지만, 앤스로픽 모델의 경쟁력을 판정하는 자료는 아니다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.