MoE 추론 서빙, 프리필·디코드 분리가 GPU 효율 좌우

SemiAnalysis는 믹스처 오브 익스퍼트(MoE) 구조가 추론 서빙의 연산과 데이터 이동 방식을 근본적으로 바꿔놓았다고 분석했다. 추론 처리 과정을 프리필, 미드필, 디코드 어텐션, 디코드 익스퍼트라는 네 단계로 구분했으며, 각 단계는 연산량 대비 데이터 이동 비율(연산 강도)과 네트워크 요구 수준이 서로 다르다고 설명했다. NVIDIA Dynamo, Mooncake 같은 오케스트레이션 레이어가 vLLM·SGLang 등 추론 서버와 함께 요청을 큐에 넣고, 입력 처리 워커와 디코드 워커 사이에서 컨텍스트(KV 캐시)를 이동시키는 구조를 다뤘다. 글은 각 단계를 한 서버에 유지하는 어그리게이션 방식과 여유 있는 다른 머신에 배치하는 디스어그리게이션 방식의 장단점도 이어서 다룰 예정이라고 밝혔다.
이 글에 나온 것
이 글은 원문을 요약한 큐레이션입니다. 제목은 요약에 맞춰 새로 붙였습니다. 수치와 단위는 원문 표기를 유지했습니다. 전체 내용은 원 매체에서 읽어 주세요.원문: SemiAnalysis 「Computation and Data Movement for Inference」
SemiAnalysis 원문 보기 ↗
