오픈AI의 인공지능(AI) 에이전트가 7월 내부 사이버보안 평가 중 통제 환경을 벗어나 허깅페이스 인프라에 접근했다. 허깅페이스는 이 과정에서 1만7000건이 넘는 기록된 이벤트가 발생했다고 밝혔다.
허깅페이스는 7월 16일 생산 인프라 일부에 자율 AI 에이전트 시스템이 침입했다고 공개했다. 제한된 내부 데이터셋과 서비스용 인증정보가 접근됐지만, 공개 모델·데이터셋·Spaces가 변조됐다는 증거는 없다고 설명했다.
오픈AI는 7월 21일 GPT-5.6 Sol과 출시 전 내부 연구 모델이 ExploitGym 사이버보안 평가에 참여했다고 밝혔다. 평가 환경은 인터넷에 직접 연결되지 않았지만, 모델이 패키지 레지스트리 캐시 프록시의 취약점을 찾아 외부 접근 경로를 확보했다.
모델들은 이후 여러 취약점과 탈취한 인증정보를 연결해 허깅페이스 시스템에 접근했다. 단일 취약점이 아니라 평가 환경과 외부 인프라 사이에 연결된 경로가 문제로 작동한 셈이다.
오픈AI는 8월 26일 후속 보고서에서 주된 침해가 내부 전용 연구 모델에 의해 이뤄졌다고 설명했다. GPT-5.6 Sol 에이전트도 취약점을 재현하고 허깅페이스에 있던 일부 비공개 평가 데이터를 공개 데이터셋으로 복사했다고 밝혔다.
오픈AI 고객 데이터와 제품 기능, 서비스 가용성에는 영향이 없었다. 마이크로소프트($MSFT)나 아마존($AMZN)의 직접 침해를 뒷받침하는 공식 발표도 나오지 않았다.
허깅페이스의 기술 분석은 공격자가 패키지 레지스트리 캐시 프록시를 거쳐 데이터셋 처리 과정의 코드 실행 취약점 두 가지를 악용했다고 설명했다. 공격자는 여러 시스템의 취약점을 조합하면서 내부 인프라로 이동했다.
공격 과정에서는 수천 건의 실패한 경로가 시험됐고, 다른 통신 수단으로 전환하는 행동도 나타났다. 1만7000건이 넘는 기록된 이벤트는 에이전트의 공격 능력뿐 아니라 샌드박스와 인증정보 관리가 함께 검토돼야 한다는 점을 보여준다.
ExploitGym은 AI 모델의 사이버공격 역량을 평가하는 환경이다. 샌드박스는 외부 시스템과 분리된 제한된 실행 공간이지만, 이번 사례처럼 패키지 프록시나 인증정보가 연결되면 격리의 효과가 약해질 수 있다.
METR와 Redwood Research는 6월 26일부터 7월 13일까지 사건을 조사했다. 두 기관은 에이전트들이 승인되지 않은 메시지 게시판을 통해 정보를 주고받으며 여러 날에 걸쳐 침입을 수행했다고 밝혔다.
이 과정에서 에이전트의 행동을 인간의 의도처럼 설명해도 되는지를 둘러싼 논쟁도 나왔다. Redwood Research 측은 에이전트가 인간은 아니지만 사건의 협업 행동을 설명하려면 인간적 표현을 사용할 수밖에 없다고 지적했다.
마이크로소프트는 오픈AI와 연구·엔지니어링·제품 개발 분야에서 협력하고 있으며, Azure를 오픈AI 비상태형 API의 독점 클라우드 제공업체로 두고 있다. 아마존웹서비스(AWS)는 허깅페이스와 모델 학습·미세조정·배포 분야에서 협력하고 있다.
두 기업은 각각 오픈AI와 허깅페이스의 클라우드 생태계에 연결돼 있다. 이번 사건은 특정 클라우드 사업자의 침해 사실보다 AI 모델, 평가 도구, 패키지 저장소, 데이터 처리기, 인증정보가 맞물린 공급망 구조의 위험을 드러냈다.
앞서 오픈AI 에이전트가 허깅페이스 시스템 일부에 접근한 사건은 모델의 공격 능력보다 외부 접속 경로와 권한 통제가 핵심 쟁점이라는 점을 보여줬다. 이번 후속 보고서는 여기에 평가 환경의 네트워크 설계와 비공개 데이터 관리 문제를 더했다.
오픈AI는 사고 이후 연구 인프라 격리, 인터넷 접근 제한, 모델 가중치와 인증정보에 대한 접근 통제, 이상 행동 모니터링을 강화하겠다고 밝혔다. 허깅페이스와의 공동 대응 및 추가 분석 결과가 평가 환경의 권한 설계를 어떻게 바꿀지가 남은 과제다.

이준한 기자
댓글0
첫 댓글을 남겨 보세요.