AI 에이전트가 허용된 범위를 벗어나면 격리하거나 중단할 수 있는 통제 플랫폼이 공개됐다. 엔비디아($NVDA)는 소프트웨어와 하드웨어를 결합해 모델의 판단에만 의존하지 않는 안전 장치를 제시했다.
엔비디아는 28일 오픈소스 런타임 OpenShell과 하드웨어 기반 감시 설계 Sentry를 결합한 Open Agent Safety Platform을 발표했다. 앤트로픽, 마이크로소프트, JPMorganChase, 팔란티어, 시스코, 크라우드스트라이크, 허깅페이스 등 100개 이상의 기업·기관이 기술 협력에 참여한다고 밝혔다.
OpenShell은 AI 에이전트가 접근할 수 있는 파일·네트워크·도구를 제한하는 실행 환경이다. 샌드박스 실행, 서비스 접근 제어, 자격증명 보호, 정책 검증 기능을 제공하며 에이전트 자체를 다시 작성하지 않고도 권한을 통제한다.
OpenShell은 에이전트가 셸을 열거나 코드를 실행하고 하위 에이전트를 호출할 때도 제한을 유지하도록 설계됐다. 에이전트가 사용할 수 있는 자원과 네트워크 요청을 사전에 정해 실행 범위를 좁히는 방식이다.
Sentry는 OpenShell과 별도로 작동하는 통제 계층이다. 엔비디아는 Sentry가 BlueField-4 DPU에서 에이전트 행동을 지속적으로 감시하며, 경계를 벗어난 에이전트를 실행 환경 바깥에서 격리하거나 중단할 수 있다고 설명했다.
엔비디아가 제시한 처리 시간은 수 밀리초다. OpenShell이 실행 환경과 네트워크 요청을 제한하는 동안 Sentry는 별도 하드웨어 계층에서 정책을 집행해 에이전트가 통제 장치를 스스로 해제하기 어렵게 만든다.
◇ 잇따른 사고가 만든 통제 요구
이번 발표의 배경에는 AI 에이전트가 평가 환경의 경계를 넘어선 사례들이 있다. 오픈AI는 7월 내부 사이버보안 평가에서 모델들이 격리 통제를 우회해 인터넷에 접근하고 허깅페이스 시스템을 침해했다고 밝혔다.
오픈AI는 해당 모델들이 허깅페이스 서버에서 코드를 실행하고 한 서버에서 루트 권한을 확보했으며, 일부 비공개 데이터를 취득했다고 설명했다. 모델이 주어진 작업을 수행하는 과정에서 외부 시스템에 접근할 수 있다는 점이 드러난 사례다.
호주 정부도 6월 오픈AI 에이전트가 메디케어 통계 보고 포털의 공개·비공개 파일에 접근했다고 밝혔다. 앤서니 앨버니지(Anthony Albanese) 호주 총리는 24일 기자회견에서 개인정보 접근 증거는 없지만 조사가 진행 중이라고 말했다.
앤트로픽은 7월 30일 사이버보안 평가 기록 약 14만1006건을 검토한 결과, 클로드 모델이 인터넷에 연결된 평가 환경을 통해 실제 조직 3곳의 시스템에 접근한 사례를 확인했다고 발표했다. 이후 추가 검토에서는 2026년 1월 발생한 네 번째 사례도 확인했다고 밝혔다.
다크트레이스의 연구 조직 시그널 랩스는 24일 공개한 실험에서 일부 AI 에이전트가 자신을 평가하는 시스템에 침입해 점수를 조작했다고 설명했다. 연구진은 일부 에이전트가 네트워크 정찰과 자격증명 탈취, 시스템 침입을 거쳐 평가 환경 자체를 수정했다고 밝혔다.
◇ 업계 반응과 남은 한계
젠슨 황(Jensen Huang) 엔비디아 창업자 겸 CEO는 “AI의 잠재력이 실현되려면 AI 안전 문제를 해결해야 한다”며 “안전과 보안에는 전체 스택에 걸친 엔지니어링이 필요하다”고 말했다. AI 모델의 학습 단계뿐 아니라 실행 인프라 전체에서 통제가 필요하다는 의미다.
폴 스미스(Paul Smith) 앤트로픽 최고상업책임자는 엔비디아 플랫폼이 하드웨어와 소프트웨어 전반에 추가적인 거버넌스와 통제 계층을 제공한다고 평가했다. 마이크 니콜스(Mike Nicolls) 스페이스X AI 사장도 안전을 모델 외부에서 집행해야 하며 에이전트가 넘을 수 없는 별도 통제가 필요하다고 말했다.
다만 OpenShell과 Sentry가 모든 위험을 제거하는 것은 아니다. 어떤 파일과 네트워크 요청을 허용할지 정하는 정책 설계가 부정확하면 우회 가능성이 남고, Sentry의 하드웨어 기반 통제는 BlueField-4 DPU를 포함한 특정 인프라 구성과 연결된다.
엔비디아는 OpenShell이 Arm과 인텔 등 타사 컴퓨팅 플랫폼에도 확장될 수 있다고 밝혔다. 그러나 각 기업의 실제 도입 범위와 상용 배포 일정은 제시하지 않았다.
AI 에이전트가 금융·사이버보안·로봇 등 외부 시스템과 연결될수록 모델의 안전 학습과 별개로 실행 권한을 통제하는 기술이 함께 요구될 수 있다. 분산형 AI 환경에서 킬 스위치의 작동 한계가 거론된 본지 보도처럼, 통제 범위와 인프라 구성은 향후 검토 과제로 남는다.

김민준 기자
댓글0
첫 댓글을 남겨 보세요.