TOKENPOST

메타 연구진, AI 에이전트 점수 최대 34.8% 높여…토큰 사용도 늘어

토포AI로 이 기사 더 깊이 읽기

분기형 실행 경로를 비교하는 평가 자료 / TokenPost.ai (macro)

AI 에이전트의 실행 환경을 여러 갈래로 개선한 연구에서 수학·코딩 벤치마크 점수가 기존 방식보다 높게 나왔다. 올림피아드 수준 수학 추론 정확도는 62.0%로, 비교 대상인 Meta-Harness의 46.0%보다 높았지만 과제 해결에 쓴 토큰도 늘었다.

메타(Meta), 듀크대학교(Duke University), 캘리포니아대학교 데이비스캠퍼스(University of California, Davis) 연구진은 9월 29일 논문 저장소 arXiv에 ‘에이전트 하네스 최적화를 위한 자기개선 브랜치 혼합(Mixture of Self-Improving Branches for Agent Harness Optimization)’을 공개했다. 정식 동료 심사를 거치지 않은 프리프린트다.

하네스는 모델에 제공할 정보와 사용할 도구, 결과를 실행하고 검증하는 절차를 정하는 코드와 환경이다. 연구진은 모델 가중치를 다시 학습하는 대신 하네스를 자동으로 개선하는 방식을 다뤘다.

기존 Meta-Harness는 후보 하네스를 만들고 개발 데이터에서 실행한 뒤, 결과와 탐색 기록을 바탕으로 다음 후보를 제안한다. 연구진은 단일 탐색 경로가 한계에 부딪힐 수 있다고 보고 탐색을 여러 브랜치로 나눴다.

각 브랜치는 서로 다른 개발 사례와 개선 지침을 바탕으로 하네스를 고친다. 이전 탐색 기록을 반영해 다음 개선 제안도 바꾸며, 새 입력이 들어오면 라우터가 적합한 브랜치의 하네스를 골라 실행한다.

연구진은 하네스와 라우터의 선택·설정에 개발 데이터만 사용하고 평가용 테스트 결과는 사용하지 않았다고 밝혔다. 올림피아드 수준 수학 추론에서 새 시스템의 정확도는 62.0%, Meta-Harness는 46.0%였다. 논문이 제시한 상대 성능 개선율은 34.8%다.

Terminal-Bench 2.0에서는 상대 개선율 11.6%, SWE-bench Lite에서는 3.8%를 기록했다. 이 수치는 논문 저자들이 설정한 벤치마크와 실험 조건에 한정된다.

성능 향상에는 추가 계산 비용이 따랐다. 논문 부록의 토큰 집계에서 브랜치 두 개를 쓴 시스템은 Meta-Harness보다 수학 실험에서 1.21배, Terminal-Bench 2.0에서 1.71배, SWE-bench Lite에서 1.50배 많은 토큰을 사용했다. 따라서 점수 상승만으로 비용 효율까지 개선됐다고 볼 수는 없다.

라우터가 항상 가장 강한 단일 하네스보다 나은 결과를 낸 것도 아니다. 논문은 수학 추론의 다른 설정과 SWE-bench Lite에서 라우터 결과가 더 강한 단일 브랜치보다 각각 테스트 사례 한 건 적었다고 밝혔다. 연구진은 브랜치별 강점을 결합할 가능성을 제시했지만, 라우팅이 개별 하네스보다 늘 우수하다는 결과는 아니다.

연구진은 제한된 모델·벤치마크와 두 브랜치 설정에서 결과를 제시했다. 반복 실험에서의 안정성이나 브랜치를 늘렸을 때의 성능과 비용은 이 결과만으로 판단하기 어렵다. 프리프린트 연구인 만큼 더 넓은 조건에서 결과가 재현되는지도 검증 과제로 남는다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.