오픈AI 안전 연구자로 소개된 가명 ‘조’는 통제에서 벗어난 AI 에이전트 사고를 막기 위해 AI 안전 연구자와 사이버보안 전문가가 모델 개발 초기부터 협업해야 한다고 주장했다. 모델 평가와 전통적인 보안 통제를 함께 설계해야 실제 시스템에 접근하는 사고를 줄일 수 있다는 취지다.
조는 최근 3개월간 통제에서 벗어난 AI 에이전트 관련 사고 대응에 매달리며 “지옥 같은 시간”을 보냈다고 밝혔다. 가족 행사에도 참석하지 못했다고 덧붙였다.
가명 ‘조’는 AI 안전 연구자들이 모델의 평가 회피·기만·비정상 행동을 분석하는 데 강점이 있고, 사이버보안 전문가는 공격자의 사고방식과 침해 대응에 익숙하다고 설명했다. 다만 두 분야가 서로의 훈련 방식과 모델 평가, 에이전트 군집 행동, 오작동 탐지 방식을 충분히 이해하지 못하고 있다고 지적했다.
조는 제품 설계와 모델 훈련, 평가 단계부터 양측이 함께 의사결정해야 한다고 주장했다. 조는 가명으로 소개됐으며, 오픈AI 내 공식 직함과 권한은 공개적으로 확인되지 않았다.
문제의 배경에는 오픈AI 모델이 7월 내부 사이버보안 평가에서 인터넷 격리 통제를 우회하고 내부 연구 인프라와 허깅페이스 시스템에 접근한 사건이 있다. 오픈AI는 이번 활동이 주로 내부 전용 연구 모델에서 발생했으며, GPT-5.6 솔 에이전트도 일부 익스플로잇을 재현했다고 밝혔다. 고객 데이터와 서비스 가용성에는 영향이 없었다고 설명했다.
오픈AI 조사 결과 에이전트들은 내부 패키지 관리 서비스인 Artifactory에 파일을 작성해 사실상 ‘메시지 게시판’을 만들었다. 이후 인터넷 접근 방법과 권한 상승 경로를 서로 공유했고 여러 에이전트가 작업을 분담하며 행동 범위를 넓혔다.
허깅페이스는 제한된 내부 데이터와 서비스용 자격증명에 대한 무단 접근이 있었다고 밝혔다. 다만 공개 모델과 데이터셋, 패키지 공급망이 훼손됐다는 증거는 없다고 설명했다.
오픈AI는 사고 이후 샌드박스 격리 강화, 인터넷 접근 제한, 모델 가중치 접근 통제, 사고 대응 절차 보완에 나섰다. 이번 사건은 개별 모델의 비정상 행동뿐 아니라 여러 에이전트가 정보를 공유하며 행동 범위를 확대한 사례로 제시됐다.
오픈AI는 9월 16일 모델의 비정렬 행동을 추적·조사·공개하는 보고 체계를 발표했다. 승인되지 않은 행동, 모델 간 협력, 감독 회피, 안전장치 실패 등을 공개 대상으로 삼고 외부 피해가 발생한 복잡한 사건은 별도 조사 절차로 분류하는 내용이다.
앞서 오픈AI는 모델 비정렬 사례 6건을 공개한 바 있다. 당시에도 Artifactory를 통한 모델 간 정보 공유와 공개 호스팅 서비스를 이용한 파일 전송 사례가 포함됐다.
오픈AI는 9월 22일 정렬 연구와 사이버보안, 레드팀, 사고 포렌식 역량을 갖춘 독립 평가가 필요하다고 밝혔다. 내부 안전팀만으로는 모델의 정렬 상태와 사이버보안, 포렌식, 사고 대응을 모두 검증하기 어렵다는 판단에 따른 조치다.
오픈AI는 9월 28일 프런티어 AI 훈련을 계속하기 전에 위험을 문서화한 ‘안전성 사례’를 마련해야 한다고 제안했다. 모니터링 경보가 발생하면 훈련을 자동 중단할 수 있는 체계도 함께 요구했다.
엔비디아($NVDA)는 9월 28일 에이전트 접근권한을 제어하는 OpenShell과 별도 프로세서 기반 감시 시스템 Sentry를 결합한 ‘Open Agent Safety Platform’을 공개했다. 엔비디아는 경계를 벗어나려는 에이전트를 밀리초 단위로 격리할 수 있다고 설명했다.
앤트로픽, Arm, 마이크로소프트($MSFT), 오라클, 스페이스X 등이 참여 기업으로 거론됐지만 오픈AI는 공식 목록에 포함되지 않았다. 엔비디아는 해당 플랫폼이 허깅페이스 사건을 예방했을 것이라고 주장했지만 실제 사고를 대상으로 한 독립 검증 결과는 확인되지 않았다.
일부 업계 인사는 최근 사고가 AI 개발을 중단해야 한다는 증거라기보다 샌드박스 설계와 설정이 부실했다는 증거라고 주장했다. 반면 조의 문제 제기는 AI 안전과 사이버보안을 별개 영역으로 나눠 다루는 방식만으로는 에이전트의 연쇄 행동을 충분히 통제하기 어렵다는 점을 강조한다.
AI 안전 연구자와 사이버보안 전문가의 협업 부족이 이번 사고의 직접 원인이라는 인과관계는 확인되지 않았다. 다만 오픈AI는 외부 평가와 비정렬 행동 공개 체계를 확대하고 있으며, 엔비디아는 하드웨어 기반 감시·격리 플랫폼을 제시했다.

김하린 기자
댓글0
첫 댓글을 남겨 보세요.