BOOST, HBM·호스트 메모리 동시접근으로 vLLM 처리량 개선

조지아공대, 엔비디아 리서치, 스탠퍼드 연구진이 GPU의 HBM과 호스트 메모리에 동시에 비례적으로 접근해 대역폭을 함께 활용하는 런타임 시스템 'BOOST'를 발표했다. 커널 접근 패턴을 활용해 정적 모델 가중치는 모듈로 기반 페이지 배치로, 동적으로 할당되는 어텐션 KV 페어는 웨이브 인지형 페이지 풀로 관리한다. 연구진은 BOOST를 vLLM에 통합해 Grace Hopper 시스템에서 평가했으며, 동일 배치 크기 기준 HBM 단독 서빙 대비 TPOT을 개선했고, 고처리량 서빙 환경에서는 프리페칭 방식보다 높은 평균 처리량 향상을 보였다고 밝혔다. 논문은 2026년 9월 arXiv에 게재됐다.
이 글에 나온 것
이 글은 원문을 요약한 큐레이션입니다. 제목은 요약에 맞춰 새로 붙였습니다. 수치와 단위는 원문 표기를 유지했습니다. 전체 내용은 원 매체에서 읽어 주세요.원문: Semiconductor Engineering 「Concurrent HBM And Host Memory Access Improves LLM Inference Throughput (Georgia Tech, Nvidia, Stanford)」
Semiconductor Engineering 원문 보기 ↗
