TOKENPOST

GPT-6 아스트라, 헬스벤치 종합 58.3점 기록

토포AI로 이 기사 더 깊이 읽기

헬스케어 AI 평가 자료와 청진기 / TokenPost.ai (mono)

GPT-6 아스트라(Astra)가 건강 관련 인공지능 평가인 헬스벤치(HealthBench) 종합 평가에서 58.3점을 기록했다. 별도 보도에서 제시된 ‘정신건강벤치’ 57.3점은 오픈AI의 공식 평가 결과와 구분해야 한다.

오픈AI는 공식 GPT-6 아스트라 시스템 카드에서 헬스벤치 프로페셔널 64.7점, 헬스벤치 하드 36.6점, 헬스벤치 컨센서스 95.5점을 함께 공개했다. 각 평가는 평가 대상과 점수 산정 방식이 다르다.

Crypto Briefing은 23일 오픈AI가 80명 이상의 정신건강 전문가와 22개국 참여를 바탕으로 ‘정신건강벤치’를 개발했으며, GPT-6 아스트라가 57.3점을 받았다고 보도했다. 해당 보도는 안전성, 맥락 적합성, 사용자 자율성, 실행 가능한 안내 등을 평가 기준으로 제시했다.

그러나 오픈AI가 공개한 시스템 카드에는 ‘정신건강벤치’가 아닌 헬스벤치가 기재돼 있다. 80명 이상 전문가 참여, 22개국, -1~+10점 척도, 이전 모델 대비 우위 등 별도 보도에 포함된 세부 내용도 오픈AI 공식 자료에서 확인되지 않는다.

헬스벤치 점수는 길이 조정 방식으로 집계됐다. 오픈AI는 헬스벤치 프로페셔널 점수가 GPT-5.6 솔보다 4.2포인트 높았고, 헬스벤치 전체 점수는 1.3포인트, 헬스벤치 하드는 3.5포인트 개선됐다고 설명했다.

따라서 헬스벤치 종합 58.3점과 정신건강벤치 57.3점을 단순 비교할 수 없다. 평가명과 점수 체계, 평가 대상이 서로 다를 수 있기 때문이다.

오픈AI는 정신건강·정서적 의존·자해를 대상으로 한 다중 대화 평가도 실시했다고 밝혔다. 고정된 질문 하나에 대한 답변을 평가하는 방식이 아니라, 모델의 응답에 따라 대화가 이어지는 상황을 가정했다.

이 평가에는 적대적 사용자 시뮬레이션이 활용됐다. 안전 정책을 위반하지 않은 응답의 비율을 ‘safe’ 지표로 집계했으며, 오픈AI는 GPT-6 아스트라가 GPT-5.6 솔보다 세 영역에서 개선됐다고 설명했다.

다만 평가용 사례는 기존 모델이 이상적인 답변을 내놓지 못했던 어려운 사례를 중심으로 구성됐다. 오픈AI는 이 결과가 실제 이용 환경에서 발생하는 오류율을 의미하지 않는다고 덧붙였다.

헬스벤치는 건강 관련 대화에서 응급상황 대응, 맥락 확인, 전문성에 맞춘 소통 등을 평가한다. 의사들은 응급 진료가 필요한 상황인지 판단하고, 필요한 경우 답변 초반에 명확한 응급 진료 권고가 이뤄졌는지를 검토했다.

헬스벤치 연구는 모델이 필요한 맥락을 충분히 확인하고 불확실성을 다루는 데 개선 여지가 있다고 지적했다. 이는 정신건강 대화 평가에서도 단일 점수보다 위기 식별과 대화 과정의 안전성을 함께 살펴야 하는 이유다.

미국정신의학회는 2026년 조사에서 성인의 17%가 정신건강 문제를 AI 챗봇과 상담한 경험이 있다고 밝혔다. 35%는 어려움을 겪을 때 정신건강 전문가 대신 AI 챗봇과 대화할 의향이 있다고 답했다.

반면 58%는 아동의 정신건강 상담에 AI 챗봇이 사용되는 것을 우려했다. 미국정신의학회는 AI가 임상적 판단이나 전문적인 정신건강 치료를 대신할 수 없다는 입장이다.

오픈AI는 9월 3일 GPT-6 아스트라를 공개했다. 오픈AI는 이 모델이 컴퓨터 사용, 소프트웨어 엔지니어링, 과학, 사이버보안 등에서 성능을 높였다고 설명했으며, GPT-6 아스트라의 단계적 유료 서비스·개발자 API 제공도 진행했다.

현재 공식 시스템 카드에서 확인되는 것은 헬스벤치 점수와 정신건강·정서적 의존·자해 대상 다중 대화 평가다. ‘정신건강벤치 57.3점’은 별도 평가의 방법론과 원자료가 공개되기 전까지 오픈AI 공식 결과로 단정할 수 없다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.