AI 모델의 평균 성능이 입력 문맥을 4K에서 128K로 늘렸을 때 7개 오픈 웨이트 모델 평가에서 62.8% 낮아졌다. 긴 문맥을 받아들이는 능력만으로 여러 단계의 작업을 정확히 이어가는 능력을 판단하기 어렵다는 연구 결과다.
엔비디아($NVDA) 연구진은 9월 30일 논문 ‘Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability’를 공개하고 장기 작업 평가 방식인 ‘Long-Transduction’을 제안했다고 크립토브리핑은 보도했다. 이 벤치마크는 산술 계산, UUID 정렬, 변수 조회, 표 변환처럼 모델이 입력을 계속 참조하며 결과를 이어 내야 하는 작업을 다룬다.
연구진은 문맥 길이와 입력 데이터 형식, 단계별 작업 복잡도를 각각 바꿔 성능 변화를 측정했다. 입력 형식을 바꿨을 때 평균 성능은 36.5% 낮아졌고, 단계별 작업 복잡도를 높였을 때는 39.9% 감소했다.
입력 항목의 안정적인 식별자를 제거했을 때도 작업별로 성능이 떨어졌다. UUID 정렬은 64.3%, 변수 조회는 66.4% 하락했다. 두 수치는 논문에서 설정한 특정 작업과 형식 조건의 결과다.
Long-Transduction은 모델이 긴 생성 과정에서 입력을 읽고 상태를 바꾸며 결과를 이어 쓰는 능력을 살펴보도록 설계됐다. 따라서 짧은 문답이나 단일 작업 점수만으로 여러 단계가 이어지는 업무의 안정성을 판단하기 어렵다는 것이 연구진의 문제의식이다.
이번 수치는 통제된 벤치마크에서 측정됐다. 실제 기업 업무나 모든 AI 서비스에서 같은 폭의 성능 저하가 나타난다는 의미는 아니다.
연구진은 긴 작업을 작은 단위로 나누고, 입력 항목과 중간 출력에 안정적인 ID를 붙이는 방안을 제시했다. 복잡한 작업을 긴 문맥에 한꺼번에 결합하지 않는 것도 제안에 포함됐다.
이번 평가는 산술·정렬·조회·표 변환 등 정해진 작업을 대상으로 했다. 연구 결과만으로 실제 업무 시스템의 정확도나 도입 효과를 판단할 수는 없다.

김민준 기자
댓글0
첫 댓글을 남겨 보세요.