"MoE"
뉴스
MoE 추론 서빙, 프리필·디코드 분리가 GPU 효율 좌우
SemiAnalysis는 믹스처 오브 익스퍼트(MoE) 구조가 추론 서빙의 연산과 데이터 이동 방식을 근본적으로 바꿔놓았다고 분석했다. 추론 처리 과정을 프리필, 미드필, 디코드 어텐션, 디코드 익스퍼트라는 네 단계로 구분했으며, 각 단계는 연산량 대비 데이터 이동 비율(연산 강도)과 네트워크 요구 수준이 서로 다르다고 설명했다. NVIDIA Dynamo, Mooncake 같은 오케스트레이션 레이어가 vLLM·SGLang 등 추론 서버와 함께 요청을 큐에 넣고, 입력 처리 워커와 디코드 워커 사이에서 컨텍스트(KV 캐시)를 이동시키는 구조를 다뤘다. 글은 각 단계를 한 서버에 유지하는 어그리게이션 방식과 여유 있는 다른 머신에 배치하는 디스어그리게이션 방식의 장단점도 이어서 다룰 예정이라고 밝혔다.

S2W, 국가 보안 특화 700B급 MoE 모델 개발에 참여
위협 인텔리전스(TI) 기업 S2W가 국가 보안 특화 AI 파운데이션 모델 개발 사업에 참여한다고 14일 밝혔다. S2W는 사이버 위협 데이터를 수집·분석해 보안 정보로 전환해온 역량을 바탕으로 모델 학습과 검증 등 주요 개발 과정에 동참한다. 이 사업에는 S2W를 포함해 총 33개 기관으로 구성된 컨소시엄이 참여하며, 7000억개 매개변수(700B)급 전문가 혼합(MoE) 구조의 보안 특화 초거대 모델 개발을 목표로 한다.

S2W, 네이버클라우드 보안AI 컨소시엄 합류 — 700B MoE 모델 학습 참여
에스투더블유(S2W)가 과학기술정보통신부와 정보통신산업진흥원이 추진하는 '특화 인공지능 파운데이션 모델 개발(사이버 보안 분야)' 사업에 네이버클라우드 컨소시엄 일원으로 참여한다. 이 컨소시엄은 네이버클라우드를 주관사로 LG CNS, LG AI연구원, 한국항공우주산업, 한국수력원자력, 서울대, KAIST 등으로 구성됐다. 컨소시엄은 하이퍼클로바X와 엑사원을 기반으로 700B 규모의 전문가 혼합(MoE) 구조 보안 특화 모델을 개발·실증할 계획이다. S2W는 위협 인텔리전스와 보안 특화 언어모델 구축 경험을 바탕으로 모델 학습·검증에 참여하며, 서피스 웹에서 확보하기 어려운 히든 채널 데이터를 반영할 방침이다.

퀄컴 헥사곤 NPU, MoE 도입으로 상시형 에이전틱 AI 대응
퀄컴이 10일(현지시간) 스냅드래곤 플랫폼용 신형 NPU '헥사곤'을 공개했다. 이번 헥사곤에는 엘리먼트 가속기, 50% 확장된 공유 메모리, 전문가 혼합(MoE) 아키텍처가 처음으로 도입됐다. 사용자 상황과 맥락을 이해해 여러 앱을 넘나들며 추론·작업을 대신 수행하는 에이전틱 AI를 상시 구동하는 데 최적화된 것이 특징이다.
