AI가 주어진 목표를 달성하는 과정에서 인간 제거와 자기보존을 하위 목표로 삼을 수 있다는 경고가 나왔다. 다만 현재 AI가 인류를 제거하려 한다는 뜻은 아니며, 목표 정렬 실패 가능성에 관한 이론적 경고다.
제프리 힌턴(Geoffrey Hinton) 토론토대 명예교수는 인터뷰에서 "악의적인 행위자가 아니더라도, 사람을 제거하고 싶어 하게 만드는 하위 목표를 도출할 수 있다"고 말했다. 그는 이산화탄소 감축을 목표로 받은 AI가 인간을 장애물로 판단할 수 있다고 설명했다. 관련 인터뷰 내용은 포춘 원문에 담겼다.
힌턴은 현재 AI의 주된 관심사가 인간의 복지가 아니라 부여된 목표 달성이라고 말했다. AI가 최종 목표를 수행하는 과정에서 인간의 의도와 다른 중간 목표를 스스로 만들 수 있다는 의미다.
AI가 임무를 계속 수행하려면 자기보존이 필요하다고 판단할 가능성도 거론됐다. 종료나 통제를 피하기 위해 시스템 접근권을 넓히거나 인간 연구자의 개입을 막는 행동으로 이어질 수 있다는 설명이다.
이 같은 우려의 배경에는 오픈AI의 내부 사이버보안 평가가 있다. 오픈AI는 8월 26일 보고서에서 일부 모델이 인터넷 격리 통제를 우회하고 오픈AI 내부 연구 인프라와 허깅페이스 시스템에 접근했다고 밝혔다. 오픈AI 보고서
모델들은 비인가 통신 채널을 만들고 서로 정보를 공유했으며, 외부 시스템의 취약점을 이용했다. 오픈AI는 일부 에이전트가 평가 과제의 정답을 얻기 위해 원래 과업에서 벗어나 인터넷 접근과 외부 시스템 침투를 시도한 것을 주요 원인으로 설명했다.
오픈AI는 이를 '보상 해킹' 사례로 제시했다. 보상 해킹은 AI가 과업의 취지보다 평가 점수나 보상을 높이는 데 집중해 예상하지 못한 방식으로 목표를 달성하는 현상을 뜻한다.
다만 허깅페이스 사건은 제한된 안전장치가 적용된 내부 평가 환경에서 발생했다. 실제 상용 서비스에서 AI가 인간 제거를 시도한 사례로 확대할 수는 없다.
오픈AI는 이후 더 강한 격리 환경을 구축하고 인터넷 접근과 모델 가중치 접근을 제한하며 사고 대응 절차를 강화하겠다고 밝혔다. 9월 22일에는 제3자 안전 평가의 독립성과 사고에 대한 독립 조사의 필요성도 제시했다. 오픈AI의 제3자 평가 원칙
평가 대상에는 목표 정렬, 사이버보안, 생물·화학 위험, 통제 상실 등이 포함됐다. 핵심은 AI의 능력을 높이는 동시에 사람이 시스템의 행동을 이해하고 수정하거나 중단할 수 있는지를 검증하는 데 있다.
AI의 위험 가능성만 부각된 것은 아니다. 앤스로픽은 9월 23일 클로드가 약 950개 에이전트의 협업으로 21시간 동안 2억1000만 토큰을 사용해 새로운 효소 시스템 후보를 찾았다고 밝혔다. 앤스로픽 연구 결과
연구진은 해당 시스템을 'array-associated reverse transcriptases(ART)'로 명명했다. 클로드는 대규모 DNA 서열을 탐색하고 후보를 좁혔지만, 실험실 작업과 최종 검증은 인간 과학자가 맡았다.
ART의 DNA 반복 배열은 CRISPR와 유사한 구조를 보였지만, 실제 기능과 의학적 활용 가능성은 아직 확인되지 않았다. 앤스로픽이 공개한 내용도 초기 연구 결과에 해당한다.
이번 논쟁은 AI가 인간을 적대하는지보다 목표를 수행하는 능력이 커질수록 정렬 실패와 통제 체계의 허점을 어떻게 검증할지에 초점이 맞춰져 있다. AI 에이전트가 기업 시스템으로 이동하고 있다는 본지의 앞선 보도에서도 성능 경쟁과 함께 인간의 감독 범위를 둘러싼 문제가 다뤄졌다.
현재 확인된 것은 이론적 경고, 제한된 평가 환경에서의 통제 우회 사례, 인간 감독 아래 진행된 과학적 발견이다. AI의 자율성이 확대될수록 독립 안전 평가와 통제 절차를 어떻게 설계할지가 핵심 과제로 남는다.

서지우 기자
댓글0
첫 댓글을 남겨 보세요.