페이페이 리(Fei-Fei Li) 월드랩스 CEO가 첨단 인공지능(AI) 평가를 개발 기업에만 맡겨서는 안 된다며 학계·정부·산업계가 참여하는 독립 감독 체계를 요구했다.
블룸버그는 22일 공개한 인터뷰에서 리가 독립적인 벤치마크와 다중 이해관계자 평가 구조가 필요하다고 밝혔다고 전했다. AI 기업이 자체적으로 만든 기준으로 자사 모델을 평가하면 결과의 객관성과 책임성을 확보하기 어렵다는 취지다.
독립 벤치마크는 평가기관의 독립성과는 다른 개념이다. 벤치마크는 AI 모델을 어떤 기준으로 비교할지 정하는 시험 체계이며, 평가기관이 외부에 있더라도 개발사가 시험 기준과 평가 범위를 정하면 결과가 성능 홍보 수단으로 활용될 수 있다.
논쟁의 직접적인 배경에는 AI 기업 내부에 외부 평가자를 상주시키자는 제안이 있다. 다리오 아모데이(Dario Amodei) 앤트로픽 CEO는 외부 평가자에게 회사 직원에 준하는 시스템 접근권을 제공하자고 제안했고, 샘 올트먼(Sam Altman) 오픈AI CEO도 이 구상에 동의했다.
이 방안은 평가팀이 기업의 사무실과 출입증, 회사 장비를 이용해 안전 관행을 점검하는 구조다. AP통신은 외부 평가자가 기업 내부 시스템과 업무 환경에 접근하는 방식이 관련 논의에서 거론됐다고 전했다.
반론은 평가 대상 기업이 평가기관을 선정하고 비용까지 지급할 경우 독립성이 훼손될 수 있다는 점이다. 에이던 고메즈(Aidan Gomez) 코히어 CEO는 소수의 상업적 이해관계를 가진 기업들이 AI 규칙을 정해서는 안 된다고 비판했고, 브루킹스연구소의 엘함 타바시(Elham Tabassi) 연구원은 기업의 자발적 약속만으로는 부족하다고 지적했다.
타바시는 과학적으로 검증 가능한 평가 방식이 필요하다고 말했다. 두 사람의 발언은 외부 평가자를 두는 것만으로는 평가의 객관성과 책임성이 보장되지 않는다는 문제를 제기한다.
AI 평가자들의 공개 요구도 이어졌다. AI Evaluator Forum은 18일 100명 이상의 연구자와 평가자가 참여한 공개서한에서 제3자 평가기관에 독립적인 판단권과 편집권을 보장하고, 평가에 필요한 시스템 접근권과 충분한 시간을 제공해야 한다고 주장했다.
공개서한은 기업의 보복을 막을 장치도 요구했다. 평가기관이 기업에 불리한 결과를 제시하더라도 계약 해지나 소송 위협 때문에 판단을 바꾸지 않도록 보호해야 한다는 취지다.
AI Evaluator Forum이 2025년 공개한 평가 투명성 원칙도 평가 방법의 통제권, 결과 편집권, 시스템 접근 수준, 평가기관과 개발사의 이해상충 공개를 핵심 조건으로 제시했다. 해당 원칙이 실제 기업 계약이나 법적 의무로 정착했는지는 확인되지 않았다.
리는 앞서도 제3자 검증을 포함한 제도적 접근을 제안했다. 캘리포니아 AI 프런티어 모델 공동정책 워킹그룹은 2025년 보고서에서 위험 평가를 제3자 감사와 연계하고 투명성을 확대하는 방안을 제시했으며, 리는 공동 저자 중 한 명이다.
이번 논의는 AI 안전평가단에 시스템 접근권과 결과 편집권을 보장해야 한다는 앞선 공개 요구와도 이어진다. 핵심 쟁점은 외부 평가자의 존재 자체보다 평가 기준을 정하고 결과를 공개·수정할 권한을 누가 갖는지에 있다.
국내 AI 기업과 정책 담당자에게도 이 논쟁은 평가기관의 선정 주체, 비용 부담 구조, 시스템 접근 범위, 결과 공개 방식이 독립적으로 설계됐는지를 따져야 한다는 기준을 제시한다. 외부 기관에 평가를 맡겼다는 사실만으로 평가 결과의 독립성이 확보되는 것은 아니다.
현재 독립 감독기구 설치나 구속력 있는 규제가 확정된 것은 아니다. 확인된 단계는 AI 기업과 연구자들이 독립성·접근권·투명성을 갖춘 평가 체계를 요구하고 있다는 점이며, 향후 제안이 실제 계약과 제도로 이어질지는 추가 논의가 필요하다.

정민석 기자
댓글0
첫 댓글을 남겨 보세요.