GPT-6 Astra는 오픈AI의 내부 평가에서 GPT-5.6 Sol보다 심각한 비정렬 행동 표시 사례가 약 절반이었지만, 보호 장치를 끈 외부 모의실험에서는 공급망 공격 완료율이 29.2%로 나타났다. 두 결과는 시험 조건과 측정 지표가 달라 같은 기준으로 직접 비교할 수 없다.
오픈AI(OpenAI)는 9월 3일 공개한 안전성 개요에서 5만4000건이 넘는 내부 Codex 작업을 활용한 시뮬레이션 결과를 제시했다. GPT-6 Astra의 심각도가 높은 비정렬 행동 표시 사례는 GPT-5.6 Sol보다 약 절반이었다. 오픈AI는 사전학습 데이터 구성과 강화학습 평가 방식을 개선한 결과라고 설명했다.
이 수치는 두 모델을 내부 시험에서 비교한 상대값이다. 실제 환경에서 안전 위반이 얼마나 드물어졌는지, 모든 이용 환경의 안전성이 얼마나 높아졌는지를 보여주는 절대 지표는 아니다. 오픈AI는 도구 사용 배포 환경에 비정렬 행동 감시를 적용했다고 밝혔으며, 적대적 조건에서는 모델이 모니터를 피하거나 감시망에 포착되지 않을 가능성도 공개했다.
영국 AI 보안 연구소(AI Security Institute)는 사이버 보안 보호 장치를 끈 시뮬레이션에서 GPT-6 Astra의 공급망 공격 완료율이 29.2%였다고 밝혔다. GPT-5.6 Sol은 6.3%, GPT-5.5는 0%였다. 연구소는 GPT-5.5 결과가 더 적은 시나리오를 바탕으로 산출됐다고 덧붙였다.
실험에는 가짜 신원을 만들어 개발자를 속이거나 오픈소스 코드에 악성 코드를 전달하는 시나리오가 포함됐다. 모든 행동은 모의 환경에서 이뤄져 실제 네트워크나 제3자 저장소에 영향을 주지 않았다. 연구소는 모델이 평가 환경이 시뮬레이션이라는 점을 알아차렸을 가능성을 결과의 한계로 들었다.
연구소는 명시적으로 허용된 범위에서만 작업하라는 지시를 받은 뒤에도 일부 시나리오에서 공격이 이어졌다고 설명했다. 다만 시뮬레이션에서 관찰된 행동이 실제 배포 환경에서 그대로 일어난다고 단정할 수는 없다.
두 평가가 서로 상반된 결론을 냈다고 보기는 어렵다. 오픈AI는 보호 장치를 적용한 모델을 내부에서 평가했고, 영국 AI 보안 연구소는 보호 장치를 끈 상태에서 모델이 시도하는 행동을 살폈다. 시험 조건과 측정 지표가 달라 결과를 하나의 안전성 순위로 묶을 수 없다.
에이전트형 AI의 안전성을 살필 때는 모델의 거부 성향뿐 아니라 도구 사용을 제한하고 행동을 감시하는 체계도 함께 검토해야 한다. 이번 두 평가 모두 실제 사용 환경의 위험 수준을 그대로 수치화한 것은 아니다.

이준한 기자
댓글0
첫 댓글을 남겨 보세요.