TOKENPOST

RTX 5090 240장으로 8B 학습…스마트폰 CPU서 초당 59.6토큰

토포AI로 이 기사 더 깊이 읽기

스마트폰과 RTX 5090 그래픽카드 / TokenPost.ai

Chutes AI가 30개 호스트와 13개 국가에 분산된 RTX 5090 GPU 240장으로 80억 매개변수 규모의 인공지능 모델을 학습하고, 완성된 모델을 스마트폰 중앙처리장치(CPU)에서 구동했다고 밝혔다.

이번 시연은 9월 28~29일 캐나다 몬트리올에서 열린 Exploit Summit에서 공개됐다. 관련 내용은 Crypto Briefing이 9월 30일 전했다.

학습에 사용된 GPU는 엔비디아($NVDA) RTX 5090 240장이다. Chutes AI가 제시한 학습 비용은 약 6500달러(약 880만원)이며, 10억 토큰당 비용은 약 11달러(약 1만4894원)다.

이 비용은 Chutes AI가 제시한 자체 계산값이다. 동일한 학습 조건에서 외부 기관이 비용과 성능을 재현한 자료는 공개되지 않았다.

완성된 8B 모델은 스마트폰 CPU에서 초당 약 59.6토큰을 생성했다. 토큰은 인공지능 모델이 문장을 처리할 때 사용하는 기본 단위다.

407억5000만 매개변수 규모의 더 큰 모델은 12GB 메모리를 사용하면서 초당 26.9토큰을 처리했다. 두 수치 모두 자체 시연 결과로, 스마트폰 기종과 세부 테스트 조건은 제시되지 않았다.

핵심 기술은 분산 학습 시스템 'Parallax'다. 하나의 대형 GPU 클러스터를 임대하는 대신 서로 다른 장소에 있는 하드웨어를 연결해 학습 작업을 나누는 방식이다.

Chutes AI는 공식 자료에서 Parallax를 서로 연결되지 않은 이기종 노드에서 희소 혼합전문가 모델을 학습하도록 설계한 시스템이라고 설명했다. 희소 혼합전문가 모델은 여러 전문가 모델 가운데 필요한 부분만 선택해 계산량을 줄이는 구조다.

Parallax는 libp2p 기반 P2P 구조를 활용한다. 여러 노드 사이에서 데이터와 작업 상태를 동기화해 특정 데이터센터에 대한 의존도를 낮추는 접근이다.

분산 구조에서는 노드 장애와 네트워크 지연이 학습 과정에 영향을 줄 수 있다. 데이터 무결성 검증과 장애 대응이 대규모 학습 환경에서 어떻게 이뤄졌는지는 공개 자료에 담기지 않았다.

온디바이스 추론도 이번 시연의 주요 요소다. 모델이 스마트폰에서 직접 실행되면 이용자 입력을 클라우드 서버로 보내지 않는 구조를 만들 수 있어 개인정보 보호와 오프라인 처리에 활용할 수 있다.

다만 스마트폰 기종별 발열과 전력 소모, 실제 응답 지연에 관한 세부 측정치는 공개되지 않았다. 초당 토큰 수만으로 실제 이용 환경의 편의성이나 배터리 효율을 판단하기는 어렵다.

Chutes AI는 Bittensor의 서버리스 분산 컴퓨팅 서브넷 SN64를 운영한다. 회사는 Parallax를 기존의 모델 추론 중심 인프라를 학습 단계로 확장하는 기술로 소개했다.

이번 사례는 소비자용 GPU와 분산형 가상자산 인프라를 인공지능 모델 학습에 연결한 실험으로 제시됐다. Chutes AI 커뮤니티는 9월 10일부터 학습 토큰 수와 호스트 수, 초당 처리량 등을 실시간 대시보드로 공개했다고 설명했다.

일부 이용자는 소비자용 GPU를 활용하면 인공지능 학습 비용을 낮출 수 있다는 점에 주목했다. 반면 커뮤니티 게시물 자체에서도 RTX 5090의 안정성 문제와 비교 기준 부족이 언급됐다.

Chutes AI는 종합 기술 보고서와 전체 모델을 공개할 계획이라고 밝혔다. 공개 시점은 정해지지 않았으며, 상용 서비스 수준의 재현성·보안성·전력 효율은 추가 검증이 필요하다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.