TOKENPOST

제미나이 4 아르곤, 외부 평가 224개 모델 중 8위

토포AI로 이 기사 더 깊이 읽기

코드 편집기가 열린 노트북 화면 / TokenPost.ai

구글의 제미나이 4 아르곤이 외부 평가에서 224개 모델 중 8위에 올랐다. 구글은 자체 벤치마크 점수와 데이터센터 메모리 최적화 사례도 공개했지만, 외부 기업의 실제 업무 성능은 아직 제한적으로 검증됐다.

구글은 9월 30일 제미나이 4 아르곤을 공개했다. 코레이 카부쿠오글루(Koray Kavukcuoglu) 구글 딥마인드 수석부사장 겸 구글 최고 AI 아키텍트는 구글 공식 발표에서 모델이 복잡한 장기 업무를 처리하도록 설계됐다고 설명했다. 구글은 소프트웨어 개발과 법률·금융 업무, 사이버 보안에 활용할 수 있다고 밝혔다.

초기에는 페어윈드(Fairwind) 프로그램에 참여하는 신뢰받는 사이버 보안 전문가에게 제공한다. 이후 유료 API 고객과 Google AI Ultra 구독자로 이용 범위를 넓힐 계획이지만, 일반 공개 날짜는 발표하지 않았다. 앞서 오픈AI와 앤트로픽도 고성능 AI 모델의 접근을 제한한 사례가 있다.

구글은 장기 소프트웨어 엔지니어링 과제를 평가하는 DeepSWE v1.1에서 77.9%, 업무 자동화 평가인 AutomationBench에서 51.3%를 기록했다고 밝혔다. 두 수치는 구글이 공개한 자체 평가 결과다.

외부 평가 기관 아티피셜 애널리시스(Artificial Analysis)는 고추론 설정의 제미나이 4 아르곤에 53점을 부여했다. 모델은 이 기관의 인텔리전스 지수에서 224개 모델 가운데 8위에 올랐다. 지수는 지식 업무와 자동화, 코딩, 추론 등 10개 평가를 합산한다.

평가마다 과제와 채점 기준이 달라 종합 순위만으로 실제 업무 전반의 우위를 판단하기는 어렵다. 구글 자체 평가와 외부 기관 평가도 측정 방식과 범위가 다르므로 각각의 결과로 봐야 한다.

구글은 사내 적용 사례로 데이터센터 메모리 최적화를 제시했다. 모델 에이전트가 메모리 300TiB 이상을 확보하는 최적화를 찾아 적용했고, 추가 절감량은 500TiB~1PiB로 추산된다고 밝혔다. 이는 구글이 공개한 내부 성과와 추정치다.

블룸버그는 익명 취재원을 인용해 일부 구글 직원이 특히 코딩 성능을 실제 사용에서 벤치마크만큼 높게 평가하지 않았다고 보도했다. 이는 내부 직원의 평가를 전한 것으로, 공개된 독립 재현 결과와는 구분된다.

제미나이 4 아르곤의 이용 대상은 사이버 보안 전문가에서 유료 API 고객과 Google AI Ultra 구독자로 단계적으로 확대될 예정이다. 구글은 일반 공개 일정을 발표하지 않았다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.