영상 통화 참가자 54명 가운데 26명은 인공지능(AI)을 실제 사람으로 판단했다. Tavus가 공개한 1분 실험 결과로, 일반적인 영상 통화에서 AI를 사람으로 오인하는 비율을 뜻하지는 않는다.
Tavus는 10월 1일 대화형 모델 그리핀(Griffin)을 공개했다. 실험에 사용한 그리핀 라이트(Griffin-Lite)는 음성과 영상을 실시간으로 받아들이고 말과 표정, 시선, 몸짓을 생성하는 연구 미리보기 모델이다. 디크립트(Decrypt)는 Tavus의 발표와 실험을 보도했다.
Tavus는 참가자들에게 다른 참가자와 올해 기대하는 일을 주제로 1분간 영상 통화를 한다고 안내했다. 통화가 끝난 뒤 상대가 실제 사람이라고 생각했는지 물었고, 54명 가운데 26명이 그렇다고 답했다. 회사가 제시한 비율은 48%다.
Tavus는 이전 시스템 실험에서 참가자 41명 중 1명(2.4%)이 상대를 사람으로 판단했다고 밝혔다. 이전 시스템은 영상 생성·대화·인지 기능을 담당하는 세 모델을 조합했다. 두 실험의 참가자 수는 달랐으며, 같은 참가자 집단을 대상으로 한 통제 실험인지는 공개된 설명만으로 알 수 없다.
48%는 참가자들이 상대가 AI일 가능성을 미리 안내받지 않은 상태에서 한 가지 주제로 1분간 대화한 회사 자체 실험의 결과다. 실험 설계와 결과를 독립적으로 검증한 자료는 공개되지 않았다.
그리핀 라이트는 상대의 말이 끝날 때까지 기다렸다 답하는 대신, 대화 중 음성과 영상을 계속 살피며 반응을 생성하도록 설계됐다. Tavus는 이를 음성 인식, 언어 모델, 음성·영상 생성 모델을 차례로 연결하는 방식과 구분했다. 회사가 내세운 특징은 말을 듣는 동시에 대화 흐름과 비언어적 신호를 처리하는 데 있다.
엔비디아(NVIDIA)의 VideoFDB 평가에서 그리핀 라이트는 생성 부문 5점 만점에 3.83점을 받았다. 공개 표의 인간 기준 점수는 3.92점이며, 다음으로 높은 제미나이 2.5와 애넘(Anam) 조합은 2.80점이었다. 인지 부문 점수는 3.73점으로 인간 기준인 4.20점보다 낮았다.
VideoFDB는 실제 영상 통화에서 추린 대화 클립 237개와 비언어적 상호작용 유형 11개를 바탕으로 AI의 인지와 생성을 나눠 평가한다. 점수는 언어모델 심사 방식으로 산출된다. 참가자가 통화 상대를 사람으로 판단했는지를 센 Tavus 실험과는 측정 대상이 다르다.
Tavus는 그리핀 라이트를 일반 고객에게 공개하지 않았다. 안전 조치와 AI 공개 기능을 마련하고 관련 안전 단체와 협력하는 동안 일부 신뢰할 수 있는 시험 참여자에게 연구 미리보기로 제공한다고 밝혔다.

최윤서 기자
댓글0
첫 댓글을 남겨 보세요.