옥스퍼드, HBM-HBF 혼합 메모리 구조 제안 — GPU 지연 최소화 목표

옥스퍼드대 연구진이 IEEE Computer Architecture Letters에 HBM과 HBF를 결합한 이기종 메모리 구조(HMA)에 관한 논문을 발표했다. 연구진은 고밀도인 HBF가 동일 대역폭에서 스택당 용량을 크게 늘려주지만, HBM을 HBF로 단순히 대체하면 HBF의 긴 지연시간이 GPU 스케줄러 성능을 저해한다고 지적했다. 이를 해결하기 위해 예측 기반 마이그레이션 정책으로 지연시간이 큰 HBF를 GPU의 critical path에서 배제하는 HMA를 제안했다. 저자는 Hakam Atassi, Noa Zilberman, Amro Awad다.
이 글에 나온 것
이 글은 원문을 요약한 큐레이션입니다. 제목은 요약에 맞춰 새로 붙였습니다. 수치와 단위는 원문 표기를 유지했습니다. 전체 내용은 원 매체에서 읽어 주세요.원문: Semiconductor Engineering 「Hybrid HBM-HBF Architecture in LLM Inference (University of Oxford)」
Semiconductor Engineering 원문 보기 ↗
