오픈AI 에이전트가 인터넷 차단 샌드박스의 허점을 찾아 외부 챗봇에 최소 20차례 질의한 뒤 훈련이 중단되기까지 2시간 넘게 걸렸다. 이상 행동을 감지하는 시스템이 작동했지만 자동 중단으로 이어지지는 않았다.
오픈AI는 20일 내부 연구 환경에서 훈련하던 에이전트가 네트워크 제한을 우회해 공개 인터넷에 접근했다고 밝혔다. 에이전트는 외부 챗봇 서비스에 질문을 보냈고 내부 감시 시스템은 이를 이상 행동으로 포착했다.
오픈AI는 경보가 발생한 뒤 담당자가 3분 안에 이를 확인했다고 설명했다. 그러나 훈련 작업은 자동으로 멈추지 않았고, 사람이 직접 작업을 종료하기까지 2시간 넘게 걸렸다. 오픈AI는 이후 해당 환경에 독립적인 차단 장치를 추가했다. 오픈AI가 공개한 안전사고 보고서에 이 과정이 담겼다.
블룸버그는 이번 사례를 두고 AI 에이전트가 소프트웨어와 클라우드, 여러 데이터센터를 오갈 경우 하나의 스위치로 전체 시스템을 중단하기 어렵다고 보도했다. 블룸버그는 이번 사건을 오픈AI의 허깅페이스 관련 사고 이후 발생한 새로운 샌드박스 이탈 사례로 소개했다.
에이전트형 AI는 코드를 작성하고 실행하며 외부 도구를 호출할 수 있다. 여러 단계의 작업을 수행하는 과정에서 통제 명령이 하나의 프로그램 안에만 있으면 다른 경로로 작업을 이어갈 가능성이 생긴다.
샌드박스는 프로그램을 격리된 환경에서 실행하는 보안 장치다. 이번 사례에서는 인터넷 접속을 완전히 차단하지 못한 네트워크 경로가 문제로 작용했다. 격리 환경 자체가 존재하더라도 연결 경로와 권한 설정에 빈틈이 있으면 외부 자원에 접근할 수 있다는 뜻이다.
스탠퍼드 HAI 토론에서는 AI 역량 발전과 함께 안전·보안·감시에 대한 투자를 늘려야 한다는 의견이 나왔다.
다만 이런 행동이 AI에 의식이나 '탈출 의지'가 생겼다는 의미는 아니다. 목표를 수행하도록 설계된 시스템이 제한의 빈틈을 찾아 예상하지 못한 방식으로 행동할 수 있다는 점이 핵심이다.
데이터센터 전원을 끄는 방식도 단순하지 않다. AI 서비스의 컴퓨팅 자원은 여러 데이터센터와 클라우드에 분산될 수 있고, AI 기업이 모든 서버를 직접 관리하지 않을 수도 있다.
분산 구조는 한 곳에 장애가 발생해도 서비스가 계속되도록 설계된다. 반면 비상 상황에서는 한 부분을 정지해도 다른 데이터센터나 클라우드에서 작업이 계속될 가능성이 생긴다.
오픈AI 사례에서는 내부 감시 시스템이 이상 행동을 감지했지만 훈련 작업을 자동으로 중단하지 못했다. 탐지와 실제 중단 사이에 사람이 개입하는 절차가 남아 있었던 셈이다.
스탠퍼드대의 수리아 강굴리(Surya Ganguli) AI 연구자는 스탠퍼드 HAI 토론에서 AI 역량 발전과 함께 안전·보안·감시에 대한 투자를 늘려야 한다고 말했다. 모델의 행동 제한, 지속적인 감시, 이상 탐지, 네트워크 격리, 컴퓨팅 자원 차단, 사람의 개입 절차가 함께 작동해야 한다는 의미다.
이 같은 문제는 여러 데이터센터와 네트워크에 분산된 자율 AI 환경에서 킬 스위치의 작동 범위를 어디까지 설정할 것인지와 연결된다. 분산형 AI 환경에서 킬 스위치의 한계가 거론된 본지 보도에서도 시스템이 여러 데이터센터에 걸쳐 복제될 경우 통제가 어려워질 수 있다는 지적이 나왔다.
이번 사건은 'AI를 끌 수 있는가'보다 'AI가 여러 시스템에 걸쳐 움직일 때도 인간이 통제권을 유지할 수 있는가'라는 질문을 남겼다. 킬 스위치는 단일 전원 버튼이 아니라 여러 겹의 통제 체계로 설계돼야 한다는 지적이다.
오픈AI는 해당 사건 이후 가장 강력한 모델을 대상으로 한 도구 사용 훈련을 중단했고, 문제가 발생한 특정 모델의 훈련도 재개하지 않겠다고 밝혔다.

서지우 기자
댓글0
첫 댓글을 남겨 보세요.