GLM-5.3 희소 어텐션, HBM 캐시 용량 한계를 SGLang이 보완

SemiAnalysis는 희소 어텐션이 SDPA 연산의 메모리 대역폭은 줄이지만, top-k 선택 시 전체 컨텍스트를 HBM에 올려야 해 KV 캐시 용량 절감으로는 이어지지 않는다고 설명했다. SGLang 팀은 이를 보완하기 위해 KV 캐시를 HBM과 호스트 DRAM 사이에서 LRU 방식으로 옮기는 계층형 메모리 시스템 HiSparse를 설계했으며, 레이어 단위로 캐시 로딩과 연산을 겹쳐 처리해 캐시 미스 지연을 줄였다. 이어 SemiAnalysis는 Z.ai GLM-5.3 모델이 KV 압축과 희소 어텐션을 결합해 에이전트형 대화 이력을 처리하는 방식과, InferenceX 벤치마크를 통한 GB200·GB300·MI355X 기반 서빙 비교 결과를 소개했다. 벤치마크에서는 동시 요청 수가 늘수록 GPU 메모리 재사용 비중은 줄고 호스트 메모리 재사용 비중이 늘었지만, 전체 캐시 적중률은 높은 수준으로 유지됐다.
이 글에 나온 것
이 글은 원문을 요약한 큐레이션입니다. 제목은 요약에 맞춰 새로 붙였습니다. 수치와 단위는 원문 표기를 유지했습니다. 전체 내용은 원 매체에서 읽어 주세요.원문: SemiAnalysis 「How GLM5.3 Sparse Attention Affects HBM Memory Usage」
SemiAnalysis 원문 보기 ↗
