TOKENPOST

엔비디아, 터미널 에이전트 성공률 50%→68.03%

토포AI로 이 기사 더 깊이 읽기

실행 전 명령 후보를 검토하는 손과 노트북 / TokenPost.ai

엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식으로 벤치마크 성공률을 높였다. TerminalBench-Lite 실험에서 Pass@1은 기본 에이전트의 50.00%에서 68.03%로 상승했다.

엔비디아 연구진이 공개한 ‘Mid-Harness’는 에이전트가 작업 단계마다 여러 명령 후보를 만들면 검증 모델이 평가한 뒤 하나를 실행하는 구조다. 엔비디아는 연구 페이지에서 잘못된 명령이 실행되면 이후 작업 환경에도 영향을 줄 수 있어 실행 전 검증 단계를 두었다고 설명했다.

실험에서는 TMAX-9B가 명령 후보를 생성하고 GPT-5.6 Sol이 검증을 맡았다. 단계마다 후보 8개를 생성한 조건에서 Pass@1이 50.00%에서 68.03%로 높아졌다. Pass@1은 작업을 한 번 시도했을 때 성공한 비율이다.

연구진은 후보 수를 늘리는 것만으로 성능 향상을 기대하기 어렵다고 밝혔다. 검증 능력이 약하면 후보를 추가해도 이점을 살리기 힘들며, 유효한 행동을 골라내는 검증기가 중요하다는 설명이다. TMAX-9B가 후보 생성과 검증을 모두 맡은 실험에서는 평가한 방식 가운데 쌍별 검증이 가장 나은 결과를 냈다.

연구진은 한 작업을 처음부터 여러 번 실행하는 ‘궤적 확장’과 각 단계에서 후보를 더 만드는 ‘행동 확장’도 비교했다. 엔비디아 연구 페이지는 TMAX-9B와 TerminalBench-Lite 조합에서 두 방식을 함께 쓴 경우 궤적만 늘린 경우보다 성공률이 높고 추정 토큰 비용은 낮았다고 밝혔다. 구체적인 비용 절감률은 제시하지 않았다.

Mid-Harness는 모델 교체나 재학습 없이 생성된 행동을 실행 직전에 검토하는 구조를 시험했다. 다만 공개된 수치는 정해진 벤치마크 실험 결과로, 실제 터미널 작업이나 긴 작업 흐름에서 같은 효과가 나타나는지는 확인되지 않았다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.