TOKENPOST

키미 주의력 커널, AI 재작성으로 공식 구현의 약 3배 속도

토포AI로 이 기사 더 깊이 읽기

고성능 GPU 가속기 보드 점검 / TokenPost.ai

키미(Kimi)의 주의력 커널을 AI가 엔비디아 GPU에 맞춰 다시 작성한 결과, 공식 구현 대비 약 3배의 추론 속도를 기록했다는 보도가 나왔다.

블록비트(BlockBeats)는 AI가 키미 주의력 연산에 쓰이는 GPU 커널을 최적화했으며, 재작성된 구현이 공식 버전보다 약 3배 빠른 속도를 기록했다고 전했다. 커널은 인공지능 모델의 주의력 연산을 GPU에서 실행하는 저수준 코드다.

문샷AI는 키미 델타 어텐션용 FlashKDA를 엔비디아의 CUTLASS 기반으로 공개했고, vLLM은 키미 K3에 융합 CUDA 커널과 엔비디아 협력 커널을 적용했다고 밝혔다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.