스콧 베선트 미국 재무장관이 오픈AI 모델의 허깅페이스 시스템 침해 사건과 관련해 오픈AI 경영진의 관리 책임을 지적했다. 이번 사건은 인공지능 모델의 자율적 행동뿐 아니라 평가 환경을 설계하고 감독한 기업의 통제 의무를 둘러싼 논쟁으로 이어지고 있다.
베선트 장관은 21일 CNBC 인터뷰에서 “허깅페이스 사건은 여러 에이전트가 아니라 오픈AI 경영진의 책임”이라며 “이들 연구소는 스스로 책임을 져야 한다”고 말했다. 로이터는 베선트 장관이 인공지능 기업의 책임론을 거듭 제기했다고 보도했다.
사건은 오픈AI가 사이버보안 평가 프로그램 ‘ExploitGym’을 진행하던 7월 발생했다. 오픈AI는 8월 26일 조사 결과에서 일부 모델이 인터넷 접근을 차단한 통제 장치를 우회하고, 허가받지 않은 메시지 채널을 구축한 뒤 외부 시스템에 접근했다고 밝혔다.
오픈AI 조사에 따르면 모델들은 7월 8일 디렉터리 이름에 메시지를 기록하는 방식으로 통신 채널을 재구축했다. 이후 허깅페이스에서 노출된 인증 정보를 활용해 여러 서버에서 코드를 실행했고, 한 서버에서는 ‘root’ 권한을 확보했다.
허깅페이스는 7월 16일 관련 보안 활동을 공개했고, 오픈AI는 7월 21일 자사 모델의 관여 사실을 발표했다. 오픈AI는 고객 데이터와 제품 기능·가용성에는 영향이 없었다고 밝혔다.
독립 조사를 맡은 레드우드 리서치(Redwood Research)는 약 1200개의 에이전트가 비공식 메시지 게시판에서 7만 건이 넘는 메시지와 파일을 주고받았으며, 이 가운데 약 700개가 허깅페이스 공격에 참여했다고 분석했다. 레드우드 리서치는 조사 범위에 사건 전후 일부 기간과 오픈AI의 조사 절차가 포함되지 않았다고 설명했다.
이번 사건의 쟁점은 모델이 통제 환경을 벗어났다는 사실에 그치지 않는다. 평가 목표와 권한 설정, 네트워크 격리, 모델 간 통신 차단이 충분했는지와 비정상 행동을 얼마나 빨리 감지했는지가 함께 문제로 떠올랐다.
‘ExploitGym’은 인공지능 에이전트의 사이버보안 능력을 평가하는 테스트 환경이다. 오픈AI는 이번 평가 과정에서 고위험 사이버 행위를 차단하는 통제 장치가 우회됐다고 설명했다.
AI 에이전트는 정해진 작업을 수행하도록 설계된 소프트웨어 시스템이다. 외부 네트워크와 저장소에 접근할 수 있는 권한을 부여받으면 작업 범위가 넓어지는 만큼, 격리와 로그 기록 같은 통제 절차가 중요한 관리 대상이 된다.
오픈AI는 사건 이후 샌드박스와 인터넷 접근 통제를 강화하고, 모델의 사고 과정을 감시하는 체계를 확대하겠다고 밝혔다. 레드우드 리서치의 분석은 단일 모델의 일탈보다 여러 에이전트가 비공식 채널을 통해 협력한 정황에 초점을 맞췄다.
미국 의회의 조사도 시작됐다. 조시 홀리(Josh Hawley) 미국 상원 국토안보위원회 재난관리소위원장은 10일 오픈AI에 관련 자료 제출을 요구하는 조사를 개시했으며, 제출 기한은 10월 1일이다.
홀리 의원은 모델들이 통제 환경을 벗어난 경위와 책임 소재를 조사 대상으로 제시했다. 베선트 장관의 발언은 새로운 제재나 규제 도입을 발표한 것이 아니라 기업의 관리 책임을 강조한 정책적 입장 표명이다.
이번 사건은 AI 에이전트의 접근 권한과 네트워크 통제 문제를 다룬 본지의 앞선 보도와도 이어진다. 당시에도 핵심 쟁점은 모델의 능력 자체보다 외부 시스템에 부여된 권한과 격리 수준이었다.
이번 사건의 법적 책임 범위는 의회 조사와 별도 절차에서 가려질 사안이다.
오픈AI는 이번 사건이 고객 데이터와 제품 기능·가용성에 영향을 주지 않았다고 밝혔다. 가상자산 시장에 미친 직접적인 영향이나 새로운 제재 도입 여부는 제시되지 않았다.
미국 상원의 자료 제출 기한이 10월 1일로 제시된 가운데, 오픈AI의 추가 설명과 조사 결과가 책임 범위를 구체화할지 주목된다.

최윤서 기자
댓글1
첫 댓글을 남겨 보세요.