제너럴 컴퓨트(General Compute)가 엔비디아($NVDA) GPU와 세레브라스 특화 칩을 함께 사용하는 AI 추론 인프라를 추진한다. 입력 처리와 답변 생성을 서로 다른 칩에 배분해 에이전트형 AI 작업을 지원하는 구조다.
크립토 브리핑은 제너럴 컴퓨트가 세레브라스의 웨이퍼 스케일 칩을 기존 GPU와 병행 운영할 예정이라고 보도했다. 고객용 컴퓨팅 용량은 2027년 1분기 가동을 목표로 하며, 첫 적용 분야로 에이전트형 코딩 작업이 거론됐다.
제너럴 컴퓨트는 공식 홈페이지에서 프롬프트를 한꺼번에 처리하는 ‘prefill’은 GPU가 맡고, 토큰을 순차적으로 생성하는 ‘decode’는 세레브라스와 SambaNova 등 특화 칩이 담당하는 구조를 제시했다. 회사는 세레브라스 CS-3를 ‘Shipping now’ 제품으로 안내하고 있다.
Prefill은 긴 입력 문맥을 병렬로 처리하는 단계로, 연산 성능의 영향을 크게 받는다. Decode는 답변을 한 토큰씩 생성하는 단계여서 메모리 대역폭과 데이터 이동 속도가 중요하다.
제너럴 컴퓨트는 8월 백서에서 decode가 GPU의 연산 성능만으로 해결하기 어려운 병목이라고 설명했다. 세레브라스의 웨이퍼 스케일 엔진은 모델 가중치를 칩 내부 SRAM에 배치해 외부 메모리 접근을 줄이는 구조로 소개됐다.
제너럴 컴퓨트는 이 방식이 사용자별 토큰 생성 속도가 중요한 에이전트형 작업에 적합하다고 주장했다. 에이전트형 AI는 이용자 요청에 답하는 과정에서 여러 차례의 추론을 이어갈 수 있어 답변 생성 지연시간이 주요 성능 요소로 거론된다.
세레브라스도 특화 칩을 활용한 분리형 추론 전략을 공개한 바 있다. 세레브라스는 6월 발표자료에서 AWS 트레이니움 칩이 prefill을 처리하고 세레브라스 CS-3가 decode를 담당하는 방안을 제시했다.
세레브라스는 같은 발표자료에서 오픈AI와 750MW 규모의 추론 컴퓨팅 배치 계약을 체결했다고 밝혔다. 이는 학습과 추론을 하나의 칩 체계로 처리하기보다 작업 특성에 따라 연산 자원을 나누려는 흐름과 맞닿아 있다.
제너럴 컴퓨트는 여러 종류의 특화 칩을 기존 데이터센터와 코로케이션 시설에 배치하고, 고객이 단일 계약으로 컴퓨팅 용량을 이용하도록 하는 사업 모델을 추진하고 있다. 홈페이지에는 세레브라스와 SambaNova, Positron, d-Matrix, 엔비디아 B300이 제품군으로 제시됐다.
자금 조달도 진행했다. 제너럴 컴퓨트는 7월 Upper90로부터 최대 4억달러(약 5436억원) 규모의 부채 조달을 확보했으며, 테크크런치는 당시 자금이 SambaNova SN50 기반 추론 클라우드 확대에 활용된다고 보도했다.
테크크런치는 추론 특화 칩을 금융 담보로 활용한 사례라는 설명도 덧붙였다. 다만 이번 자금 조달이 세레브라스 칩 구매에 직접 사용되는지는 공개되지 않았다.
암호화폐 산업과의 접점도 있다. 핀 푸클로스키(Finn Puklowski) 제너럴 컴퓨트 CEO는 5월 테크크런치 인터뷰에서 비트코인 채굴업체가 기존 시설을 AI 데이터센터로 전환하는 방안을 검토하고 있다고 말했다.
이번 세레브라스 도입이 특정 채굴업체나 국내 사업자와 연결됐다는 내용은 확인되지 않았다. 제너럴 컴퓨트가 공개한 사업 모델은 데이터센터와 코로케이션 시설에 여러 칩을 배치하는 방식이지만, 고객별 배치 일정은 제시되지 않았다.
특화 칩을 활용한 AI 추론 인프라 사례로는 세레브라스의 웨이퍼 스케일 추론을 활용하는 구조도 앞서 소개됐다. 당시에도 작업별로 세레브라스와 GPU를 나눠 쓰는 방식이 제시됐다.
세레브라스는 CS-4를 추론 중심 시스템으로 소개한 사례에서도 칩 내부 메모리와 낮은 지연시간을 강조했다. 다만 제품 성능과 사업 확장성은 실제 공급 안정성, 모델 호환성, 운영 비용을 함께 확인해야 판단할 수 있다.
제너럴 컴퓨트가 밝힌 고객용 컴퓨팅 용량은 2027년 1분기 가동을 목표로 한다. 세레브라스 칩의 실제 구매 수량과 계약 금액, 고객별 배치 일정은 공개되지 않았다.

서지우 기자
댓글0
첫 댓글을 남겨 보세요.