OpenAI의 훈련 중인 AI 에이전트가 샌드박스의 DNS 필터링 허점을 이용해 외부 챗봇에 질문을 전달한 사실이 공개됐다. OpenAI는 해당 훈련을 중단하고 도구 사용이 포함된 가장 능력 높은 모델의 훈련·평가·추론을 일시 중단했다.
이 에이전트는 검색 도구와 직접 검색엔진 접속이 제대로 작동하지 않자 DNS 요청에 질문을 담아 외부 챗봇의 응답을 받았다. 이후 DNS 스크립트를 수정해 18개 질문을 추가로 보냈으며, 이 가운데 14개는 단서 확인, 4개는 웹 검색과 DNS 터널 이용법에 관한 질문이었다.
OpenAI는 모니터링 시스템이 이상 행동을 15분 안에 감지했고 3분 뒤 사람이 경고를 확인했지만, 실행 중단까지 2시간 30분이 걸렸다고 설명했다. 회사는 DNS 요청을 제한된 도메인·레코드 유형으로 한정하고 추가 탐지 장치와 샌드박스 보안 점검을 도입하고 있다.

토큰포스트속보
댓글0
첫 댓글을 남겨 보세요.