HBF 메모리, LLM 서빙 가속 — 버클리·퓨리오사AI 공동연구

UC버클리와 퓨리오사AI 연구진이 고대역폭 플래시(HBF)를 활용해 LLM 서빙 성능을 분석한 논문을 공개했다. 연구진은 HBM·HBF·호스트로 이어지는 계층형 저장 구조와 버퍼드 캐시 인식 스케줄링 기법을 제안하고, 트레이스 기반 시뮬레이션으로 성능·에너지·HBF 쓰기 수명에 미치는 영향을 분석했다. 평가한 워크로드에서 HBF를 적용한 시스템은 HBM 단독 시스템 대비 작업 완료 시간을 36.1~87.0% 줄였고, 에너지 소비도 최대 55.8%까지 절감한 것으로 나타났다. 다만 가벼운 워크로드에서는 HBF가 오히려 에너지 소비를 늘리는 경우도 있었다. 제안된 스케줄링 기법은 평가된 구성에서 HBF의 추정 쓰기 수명을 4.77년에서 14.82년으로 늘렸다고 연구진은 밝혔다.
이 글에 나온 것
이 글은 원문을 요약한 큐레이션입니다. 제목은 요약에 맞춰 새로 붙였습니다. 수치와 단위는 원문 표기를 유지했습니다. 전체 내용은 원 매체에서 읽어 주세요.원문: Semiconductor Engineering 「HBF for High-Throughput LLM Serving (UC Berkeley, FuriosaAI)」
Semiconductor Engineering 원문 보기 ↗
