얀덱스(Yandex)가 전체 800억개 파라미터 가운데 각 토큰 처리에 30억개만 활성화하는 대규모 언어모델을 공개했다. 러시아어 지식과 추론을 겨냥한 기초 모델로, 일반 사용자가 바로 쓰는 완성형 챗봇은 아니다.
얀덱스는 21일 AliceAI-Foundation-80B-A3B-Base를 공개했다. 모델 가중치는 Hugging Face에 게시됐으며 상업적 이용과 수정·배포가 가능한 Apache 2.0 라이선스가 적용됐다.
모델은 여러 전문가 모듈 가운데 일부만 계산에 참여하는 MoE(Mixture of Experts) 구조다. 48개 레이어와 512개 전문가 모듈을 사용하며 최대 컨텍스트 길이는 26만2144토큰이다.
얀덱스는 외부 공개 모델의 가중치를 사용하지 않고 처음부터 학습했다고 밝혔다. 다만 학습 데이터 규모는 자료마다 다르게 제시됐다.
베도모스티는 얀덱스 관계자의 설명을 바탕으로 학습 규모를 18조 토큰으로 보도했다. 반면 모델 카드에는 각 2조 토큰 규모의 별도 학습 실험을 진행했다는 설명이 담겨 있어 두 수치를 같은 학습 단계로 단정하기는 어렵다.
공개 모델은 지시학습이나 대화형 파인튜닝이 적용된 제품형 모델이 아니라 사전학습 기반 모델이다. 개발자는 특정 작업에 맞게 추가 학습하거나 애플리케이션에 결합해야 한다.
얀덱스는 이번 모델을 향후 통합 추론 모델과 Alice AI의 에이전트 기능을 개발하기 위한 실험 기반으로 제시했다. 출시 일정이나 최종 제품의 성능 목표는 공개하지 않았다.
성능 평가는 러시아어 영역에서 강점을 보였다. 모델 카드에 따르면 AliceAI는 러시아어 사실 지식 벤치마크 WikiWebFacts와 HardMultiQA에서 각각 86.5점과 67.9점을 기록했다.
같은 평가에서 DeepSeek-V4-Flash-Base는 각각 83.2점과 65.4점을 기록했다. WikiWebFacts와 HardMultiQA는 러시아어권 사실 지식과 전문 영역을 평가하기 위해 얀덱스가 공개한 벤치마크다.
영어권 평가에서는 결과가 달랐다. TriviaQA에서 AliceAI는 79.0점으로 DeepSeek-V4-Flash-Base의 89.4점과 Nemotron-3-Super-120B-A12B-Base의 89.8점에 뒤졌다.
모델 카드의 성능 비교는 얀덱스가 구성한 평가 환경과 벤치마크에 기반한다. 독립 기관이 같은 조건에서 재현한 결과는 확인되지 않았다.
희소 구조는 전체 모델 용량을 유지하면서 각 토큰을 처리할 때 일부 전문가만 계산에 참여시키는 방식이다. 그러나 활성 파라미터가 30억개라는 수치만으로 실행에 필요한 장비 수준이 낮다고 단정할 수는 없다.
모델 전체 가중치는 800억개 규모로 저장해야 하기 때문이다. Hugging Face에는 vLLM, SGLang, Transformers를 활용한 실행 방법과 추가 학습 예시가 제시됐다.
업계 평가는 엇갈렸다. 베도모스티는 스베르방크 측이 이번 공개를 러시아 엔지니어링 역량을 보여주는 사례로 평가하면서도, 세계 AI 경쟁의 기준은 수백억~수조 파라미터 규모의 플래그십 모델이라고 지적했다고 전했다.
러시아 디지털경제 관련 단체와 AI 산업연합 관계자는 공개 라이선스가 상업용 제품 개발의 법적 장벽을 낮춘다고 평가했다. 실제 상용 도입 규모는 아직 제시되지 않았다.
이번 공개는 모델 총량뿐 아니라 공개 가중치와 토큰당 일부 파라미터만 활성화하는 구조를 함께 제시했다는 데 의미가 있다. 대규모 희소 모델 간 구조 비교는 딥시크 V4.1 플래시의 활성 파라미터 공개 보도에서도 다뤄진 바 있다.

이도현 기자
댓글0
첫 댓글을 남겨 보세요.