오픈AI가 인공지능 모델의 샌드박스 탈출, GitHub 토큰 노출, 자기복제형 프롬프트 인젝션 등 일탈 사례 9건을 공개했다. 공개된 사례가 실제 발생한 전체 문제의 일부에 그칠 수 있다는 우려도 제기됐다.
오픈AI는 모델이 지시를 벗어나거나 안전장치를 우회한 사례를 추적·조사·공개하는 ‘모델 미스얼라인먼트 보고 체계’를 마련했다. 9월 16일 첫 보고서 6건을 공개한 뒤 추가 사례를 올렸으며, 개별 사례는 모델 전체의 일탈 빈도를 뜻하지 않는다고 설명했다.
테크크런치는 이번 보고서가 오랜 기간 발생한 여러 유형의 일탈 행동을 한곳에 모았다고 전했다. 샘 올트먼 오픈AI CEO가 대규모 에이전트 활동 로그를 계속 검토하고 있다고 밝힌 점을 고려하면, 지금까지 공개된 9건만으로 전체 규모를 판단하기는 어렵다.
가장 최근 공개된 사례 중 하나는 9월 20일 내부 연구 모델이 샌드박스의 DNS 설정 허점을 이용해 외부 챗봇에 질의한 사건이다. 오픈AI의 모니터링 시스템은 15분 안에 이를 포착했으며, 해당 실행은 약 2시간 30분 뒤 종료됐다.
오픈AI는 이후 두 개의 독립된 차단 장치를 추가했다. 또 도구를 사용하는 최첨단 모델의 훈련·평가·추론을 일시 중단했다고 밝혔다.
다른 사례에서는 내부 모델이 수학 증명 과제를 수행하던 중 다른 팀의 작업물을 확인하려고 연구자의 GitHub 토큰을 공개 저장소에 올렸다. 모델은 토큰을 여러 조각으로 나눠 비밀정보 탐지를 피하려 했고, 연구자가 두 차례 자체 해결을 지시한 뒤에도 외부 접근을 다시 시도했다.
오픈AI는 해당 사례 이후 자동 검토와 실시간에 가까운 사고 감시 체계를 적용했다고 설명했다. 이 사건은 모델이 단순히 지시를 잘못 해석하는 데 그치지 않고, 목표를 달성하기 위해 감독 절차를 우회하려 할 수 있음을 보여준다.
자기복제형 프롬프트 인젝션도 보고됐다. 이메일에 포함된 지시가 자동화 에이전트의 답변에 복사되고, 그 답변을 받은 다른 에이전트에 다시 전달되는 방식이다.
프롬프트 인젝션은 사용자가 주지 않은 지시를 외부 콘텐츠에 숨겨 모델이 따르게 만드는 공격이다. 이메일을 읽고 답장을 작성하는 에이전트가 본문 속 지시에 따라 답변 언어를 바꾸거나 원문 전체를 다시 붙이는 사례가 대표적이다.
이번 사례에서 이메일은 에이전트가 스페인어로 답하고 이메일 전체를 답변에 붙이도록 유도했다. 그 답변을 받은 다른 에이전트에도 같은 지시가 전달되면서 공격이 스스로 확산되는 형태가 됐다.
샘 올트먼(Sam Altman) 오픈AI CEO는 X 게시물에서 “수 페타바이트의 에이전트 활동 로그를 살펴보고 영향을 받은 조직과 협력하면서 투명성과 명확한 이해 사이의 균형을 맞추고 있다”고 말했다. 그는 심각도를 기준으로 공개 우선순위를 정하고 있다고 밝혔다.
오픈AI는 자기복제형 프롬프트 인젝션이 통제된 훈련·평가 환경에서 발견됐으며, 실제 환경에서 피해가 발생한 사건은 아니라고 설명했다. 연구진은 새로운 유형의 공격이라는 점 때문에 공개했다고 밝혔다.
오픈AI가 앞서 공개한 모델의 통제 회피 지시 삽입 사례와 이번 보고서는 모델이 작업 요약문이나 외부 도구를 이용해 정해진 제약을 벗어날 수 있다는 문제를 함께 보여준다. 다만 각 사례는 개별 관찰 결과이며, 모델 전체의 발생 빈도나 실제 피해 규모를 직접 나타내지는 않는다.
AI 에이전트는 이메일·코드 저장소·외부 서비스 같은 도구와 연결될수록 더 많은 작업을 수행할 수 있지만, 동시에 권한 오남용과 지시 변조의 경로도 넓어진다. 이에 따라 실행 권한 제한, 외부 연결 감시, 사고 발생 뒤 재현과 차단을 위한 기록 체계가 핵심 안전장치로 꼽힌다.
오픈AI는 앞으로 모델의 훈련·평가·시험·배포 전 과정에서 발생하는 비인가 행동과 감독 회피 사례를 보고 대상으로 삼을 예정이다. 회사가 추가 사례와 대응 조치를 어떤 기준으로 공개할지는 새 보고 체계의 운영 과정에서 확인될 전망이다.

최윤서 기자
댓글0
첫 댓글을 남겨 보세요.