TOKENPOST

AI 연산 병목, 칩에서 패키징·메모리로 이동

토포AI로 이 기사 더 깊이 읽기

개방형 AI 연산 랙의 연결 보드와 메모리 모듈 / TokenPost.ai

AI 연산 인프라의 병목이 반도체 성능 경쟁에서 첨단 패키징과 시스템 연결, 메모리 관리로 이동하고 있다는 분석이 나왔다.

선임 칩 설계자이자 하드웨어 분석가인 미스터 버블(Mr. Bubble)은 22일 Frictionless Podcast 인터뷰에서 이 같은 견해를 밝혔다고 블록비츠(BlockBeats)가 전했다.

배경에는 선단 공정 비용 상승과 트랜지스터 집적도 개선 폭 둔화가 있다. 공정 미세화만으로 성능을 높이는 방식은 경제성 측면에서 부담이 커지고 있다는 설명이다.

이에 따라 업계는 여러 칩을 하나의 계산 시스템으로 연결하는 첨단 패키징에 더 큰 비중을 두고 있다. 첨단 패키징은 여러 칩을 하나의 시스템으로 결합해 연산과 데이터 이동을 지원하는 기술이다.

미스터 버블은 앞으로 AI 연산의 기본 단위가 단일 칩이나 서버가 아니라 완전한 랙, 나아가 복수의 랙이 될 수 있다고 내다봤다. 랙은 서버와 네트워크, 전력·냉각 장비를 함께 구성한 단위다.

이 경우 PCB와 패키징, 칩과 칩을 연결하는 상호 연결 기술이 전체 시스템 성능을 제한하는 요소가 된다. 칩의 연산 성능이 높아져도 부품 사이 데이터 이동이 늦으면 시스템 처리량이 제한될 수 있다는 의미다.

메모리 구조도 바뀔 수 있다. AI 추론에서 처리해야 할 문맥 창이 길어질수록 모든 과거 정보를 고가의 고대역폭메모리(HBM)에 저장하기 어렵기 때문이다.

미스터 버블은 사용 빈도가 높은 데이터는 HBM에 두고, 사용 빈도가 낮은 문맥은 더 큰 용량과 낮은 비용의 플래시 메모리로 옮기는 방식을 제시했다. 메모리를 하나의 공간으로 다루기보다 사용 빈도와 비용에 따라 여러 계층으로 나누는 접근이다.

이 같은 메모리 계층화는 AI 추론 과정에서 데이터의 위치와 이동 경로를 함께 관리해야 한다는 점을 보여준다. 고속 메모리 용량을 무작정 늘리는 대신 데이터 특성에 맞춰 저장 위치를 나누는 방식이다.

차세대 메모리 기술의 방향으로는 3D DRAM도 거론됐다. 다만 해당 기술이 실제 상용 제품으로 언제, 어떤 형태로 적용될지는 제시된 내용만으로 확인되지 않는다.

AI 시스템 설계에서는 학습과 추론 과정의 구조 변화도 변수로 제시됐다. 사전 입력 처리와 디코딩이 점차 분리형 구조를 채택하면 개별 칩의 성능뿐 아니라 시스템 전체를 설계하고 연결하는 역량이 중요해질 수 있다는 설명이다.

사전 입력 처리는 모델이 입력 문맥을 먼저 읽고 계산하는 단계이며, 디코딩은 그 결과를 바탕으로 응답을 순차적으로 생성하는 단계다. 두 과정을 나누면 각 단계에 맞는 연산·메모리·네트워크 구성을 따로 설계할 수 있다.

미스터 버블은 22일 Frictionless Podcast 인터뷰에서 대형언어모델 기업보다 하드웨어·패키징·메모리·기타 기반시설 역량을 보유한 기업이 AI 산업에서 장기적인 역할을 할 가능성을 언급했다. 다만 특정 기업이나 기술이 실제 상용화와 수요 확대를 주도할지는 별도로 확인해야 한다.

이번 분석은 AI 연산 경쟁의 초점이 GPU와 모델 개발사에만 머물지 않고, 여러 부품과 메모리 계층을 하나의 시스템으로 묶는 기술로 확장되고 있음을 보여준다. 패키징과 연결 지연, 메모리 용량을 함께 관리하는 시스템 설계가 AI 인프라의 주요 과제로 제시됐다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.