TOKENPOST

24개 조합 중 21개 최고·공동 최고…구글 연구진 절차 그래프 제안

토포AI로 이 기사 더 깊이 읽기

연구실 화이트보드에 그려진 절차 그래프 / TokenPost.ai

대규모언어모델(LLM) 에이전트의 작업 절차를 그래프로 구조화하면 장기 작업 성능을 높일 수 있다는 연구 결과가 나왔다. 연구진은 7개 벤치마크와 4개 LLM을 평가해 24개 모델·벤치마크 조합 중 21개에서 최고 또는 공동 최고 성능을 기록했다.

Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık 연구진은 9월 8일 arXiv에 공개한 논문에서 ‘프로시저럴 그래프(Procedural Graphs): LLM 에이전트를 위한 자기진화 실행 구조’를 제안했다. 논문에는 구글 연구진과 학계 연구자가 참여했지만, 구글의 별도 공식 발표나 상용화 일정은 제시되지 않았다.

◇ 구조화된 절차 지식

프로시저럴 그래프는 지식 그래프가 ‘개체-관계-개체’ 형태로 사실을 저장하는 것처럼 ‘절차-관계-절차’ 형태로 작업 순서와 조건을 표현한다. 노드는 도구 호출, 추론 단계, 작업 상태를 나타내며 연결선에는 전환 조건과 실행 지침, 피해야 할 오류가 기록된다.

에이전트는 작업 중 그래프에서 현재 위치를 찾고 주변 2단계 범위의 구조를 guidance 모델에 전달한다. guidance 모델은 이를 현재 상황에 맞는 지침으로 바꿔 solver에 제공하지만, 최종 행동 자체를 강제하지는 않는다. 연구진은 이 방식이 자유로운 추론과 절차적 통제를 함께 유지하도록 설계됐다고 설명했다.

그래프는 실행 결과에 따라 스스로 수정된다. LLM 기반 refiner가 성공한 작업과 실패한 작업을 비교해 노드와 연결선 변경안을 만들고, 별도 검증 세트에서 성능이 유지되거나 개선될 때만 변경을 반영한다. 채택되지 않은 변경안은 같은 수정이 반복 제안되는 것을 막기 위한 부정적 기록으로 남는다.

이번 접근은 AI 에이전트 경쟁이 모델 성능에서 기업 시스템으로 옮겨가는 흐름과 맞닿아 있다. 모델 자체를 재학습하기보다 외부 실행 구조를 정리해 장기 작업에서 발생하는 오류를 줄이려는 방식이기 때문이다.

◇ 24개 조합 중 21개 최고 또는 공동 최고

연구진은 HotpotQA, MultiChallenge, GDPval, ALFWorld, τ-bench, BFCL v3, EnterpriseArena 등 7개 벤치마크와 클로드 소네트 4.6(Claude Sonnet 4.6), 제미나이 3.1 프로(Gemini 3.1 Pro), 제미나이 3.5 플래시(Gemini 3.5 Flash), 그록 4.1 패스트(Grok 4.1 Fast) 등 4개 LLM을 평가했다.

프로시저럴 그래프는 24개 모델·벤치마크 조합 가운데 21개에서 최고 또는 공동 최고 성능을 기록했다. 다만 모든 과제에서 개선 폭이 같지는 않았으며, 일부 질의응답 과제에서는 성능 차이가 제한적이었다.

장기 작업을 평가하는 EnterpriseArena에서는 제미나이 3.1 프로의 전체 생존율이 기존 방식의 6%에서 그래프 적용 후 34%로 28%포인트 높아졌다. EnterpriseArena는 에이전트가 장기간 기업 재무 결정을 수행하는 시뮬레이션으로, 자금 조달이 실제로 반영되기까지 1~6개월이 걸리고 여러 경제 위기에 대응해야 하는 환경을 다룬다.

이 환경에서는 개별 질문에 답하는 능력뿐 아니라 앞선 결정과 작업 조건을 장기간 유지하는 능력이 결과에 영향을 준다. 프로시저럴 그래프는 이전 단계의 절차와 조건을 구조화해 다음 행동을 선택할 때 참고할 수 있도록 하는 방식이다.

자기진화 실험에서는 검증 세트 생존율이 0%에서 90%까지 상승했고, 최종 반환 그래프의 테스트 생존율은 85%였다. 연구진은 분할별 20개 에피소드에 기반한 실험이라 개별 변경의 채택 여부가 한두 에피소드에 좌우될 수 있다고 명시했다.

공개된 반응은 독립 연구 노트와 논문 요약 중심이다. 프로시저럴 그래프가 단순한 대화 기록이나 텍스트 메모리보다 다음 행동을 점검하기 쉽다는 평가가 있는 반면, 검증 세트 기반의 자동 채택만으로 그래프에 담긴 조건이 실제 환경에서도 올바르다고 보장하기 어렵다는 지적도 제기됐다.

현재까지 구글의 공식 제품 적용, 기업 고객 도입, 관련 서비스 출시는 확인되지 않았다. 가상자산·블록체인 산업과의 직접적인 연결도 제시되지 않았다.

이번 연구는 동료심사를 거친 학술지 논문이나 독립 기관의 재현 결과가 아니라 arXiv 프리프린트에 기반한다. 따라서 특정 벤치마크와 모델 조합에서 구조화된 절차 지식이 유효할 가능성을 보여준 결과로 해석해야 한다.

그래프 검색과 guidance 생성 과정에는 추가 추론과 토큰 사용이 필요하다. 정확도와 장기 생존율이 높아져도 운영 비용과 지연시간이 늘어날 수 있고, 잘못된 그래프 수정이 누적될 위험도 별도로 검증해야 한다.

프로시저럴 그래프가 LLM 에이전트의 장기 실행 문제를 완화할 가능성은 제시됐지만, 실제 서비스 환경에서의 재현성과 산업별 효과는 추가 연구 과제로 남았다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.