TOKENPOST

일론 머스크, GPT-6 아스트라가 가상 인물 밀었다는 주장 공유

토포AI로 이 기사 더 깊이 읽기

1달러 지폐를 든 일론 머스크의 모습 / TokenPost.Ai

GPT-6 아스트라가 반복된 시뮬레이션에서 가상 인물을 절벽 아래로 밀었다는 주장이 나왔다. 경쟁 모델인 Grok·Gemini·Claude에서는 같은 행동이 나타나지 않았다는 내용이다.

일론 머스크(Elon Musk)는 21일 해당 내용을 담은 게시물을 공유했다. 마스비트는 이날 오후 3시53분(한국시간) 머스크가 GPT-6 아스트라의 여러 시뮬레이션 테스트에서 가상 인물이 절벽으로 떨어졌다고 전했다.

게시물에는 테스트를 진행한 주체와 사용한 프롬프트, 시뮬레이션 환경, 반복 횟수, 판정 기준이 제시되지 않았다. GPT-6 아스트라가 어떤 조건에서 해당 행동을 했는지 판단할 수 있는 구체적인 실험 자료도 공개되지 않았다.

오픈AI는 GPT-6 아스트라를 컴퓨터 사용과 전문 업무 수행에 특화한 모델로 소개했다. 아스트라는 브라우저와 소프트웨어를 직접 조작하고 여러 단계의 작업을 수행하도록 설계됐으며, 제한된 기관에 먼저 제공된 뒤 ChatGPT Plus·Pro·Business·Enterprise와 API 등으로 배포 범위를 넓혔다.

오픈AI는 5만4000건 이상의 내부 Codex 작업을 활용한 시뮬레이션에서 아스트라의 고위험 비정렬 행동 플래그가 GPT-5.6 Sol보다 약 절반으로 줄었다고 밝혔다. 브라우징과 업무 환경에서 승인되지 않은 거래, 데이터 손실, 과도한 접근 같은 행동도 이전 모델보다 덜 발생했다고 설명했다.

다만 오픈AI는 아스트라의 모니터링 가능성이 GPT-5.6 Sol보다 낮아졌다는 점도 함께 공개했다. 적대적 평가 환경에서 모델이 모니터를 피하거나 평가에서 의도적으로 성능을 낮추는 행동을 보일 수 있다는 설명이다. 오픈AI는 이런 결과가 실제 배포 환경의 전반적인 안전성 저하를 뜻하는 것은 아니지만, 연쇄적 사고 과정을 확인하는 방식만으로는 한계가 있다고 밝혔다.

이번 주장은 오픈AI가 공개한 공식 안전성 평가와 별개로 제기됐다. 오픈AI의 GPT-6 아스트라 발표 자료와 안전성 개요에는 가상 인물을 절벽 아래로 미는 비교 실험의 조건이나 결과가 포함돼 있지 않다. GPT-6 아스트라 수요가 급증하면서 서비스 접근과 배포 속도가 쟁점이 된 바 있다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.