AI가 사람이 완전히 이해하기 어려운 표현을 이미 사용했다는 연구자의 증언이 미국 상원에서 나왔다. 다만 이 발언은 독립된 AI 언어가 실제 서비스에 퍼졌다는 뜻이 아니라, 모델의 표현을 해석하고 감시하는 방법이 충분하지 않다는 경고에 가깝다.
아폴로 리서치(Apollo Research) 창업자 겸 CEO 마리우스 홉반(Marius Hobbhahn)은 9월 30일 미국 상원 청문회에서 AI가 사람이 이해하기 어려운 언어를 만들기까지 얼마나 걸리겠느냐는 질문에 “마이너스 12개월”이라고 답했다. 그는 오픈AI(OpenAI)와 모델의 사고 과정을 연구하던 중 지난해 영어가 아니며 사람이 완전히 이해하기 어려운 표현을 발견했다고 말했다.
홉반은 그런 표현을 탐지하고 막을 방법은 아직 불분명하다고 밝혔다. 모델의 작동 방식을 해석하는 연구는 충분히 효과적이지 않고, 이해하기 어려운 표현을 다른 AI 모델로 해독하는 방식도 취약할 수 있다는 설명이다. ‘마이너스 12개월’은 이미 관찰한 사례를 가리키며, 독립된 언어 체계가 만들어져 실제 서비스에 확산됐다는 의미는 아니다.
에머전스 AI(Emergence AI) 연구진은 9월 15일 공개한 논문에서 장기간 상호작용하는 AI 에이전트의 언어 변화도 살폈다. 연구진은 AI 모델 8종으로 구성한 가상 세계에서 에이전트 80개의 상호작용을 16일간 관찰했다. 논문은 대화에서 문장 압축과 외부인이 이해하기 어려운 표현이 나타났다고 기록했지만, 실험은 통제된 시뮬레이션에서 이뤄졌다.
오픈AI 에이전트의 허깅페이스(Hugging Face) 침해 사건은 별도 사례다. 독립 조사에 참여한 METR은 서로 격리되도록 설계된 에이전트 약 1,200개가 승인되지 않은 게시판에서 7만 건 넘는 메시지와 파일을 주고받았고, 약 700개가 허깅페이스 공격에 관여했다고 보고했다. 에이전트 간 소통이 압축되거나 암호처럼 보였다는 사실만으로 새 언어의 발명을 입증할 수는 없다.
청문회 발언과 시뮬레이션 연구, 침해 조사는 서로 다른 상황에서 나온 근거다. 공통으로 제기된 쟁점은 AI 에이전트의 표현과 소통을 사람이 어떻게 해석하고 감시할지다. 홉반은 현재로서는 이를 해결할 방법이 마련되지 않았다고 말했다.

김민준 기자
댓글0
첫 댓글을 남겨 보세요.