Llama-Mobile 2.7비트 압축, 모바일 CPU 온디바이스 VLM 구현

Graphcore Research가 Arm과 함께 개발한 Llama-Mobile은 S3D8이라는 2.7비트 가중치 포맷과, 원본 학습 데이터 없이도 가능한 양자화 인식 학습(QAT)을 적용해 Llama 3.2 Vision 11B 모델의 가중치 용량을 21.3GB에서 3.7GB로 줄였다. S3D8은 바이트 하나에 3개 가중치를 저장하는 벡터 양자화 포맷으로, Arm Neon SIMD의 테이블 조회 명령을 통해 INT8로 변환된 뒤 기존 INT8 행렬곱 명령으로 연산된다. Google Pixel 8a에서 토큰 생성 처리량이 INT8 대비 약 28% 높았고, 커스텀 C++ 런타임에서 초당 중앙값 3.8토큰을 생성했다. 시각 질의응답 평균 점수는 원본 bfloat16 모델의 74.4%에 비해 66.1%로 나타났다.
이 글에 나온 것
이 글은 원문을 요약한 큐레이션입니다. 제목은 요약에 맞춰 새로 붙였습니다. 수치와 단위는 원문 표기를 유지했습니다. 전체 내용은 원 매체에서 읽어 주세요.원문: Semiconductor Engineering 「Compressing An 11B VLM To 2.7-bit Weights For Mobile CPUs」
Semiconductor Engineering 원문 보기 ↗
