시스템반도체·팹리스딥시크, GPU 메모리 절감형 V4.1 Flash 공개
중국 AI 기업 딥시크가 비용·지연시간 최적화형 Flash 모델의 새 버전인 V4.1을 공개했다. 이 모델은 7630억 개 파라미터로 이전 버전보다 커졌음에도 KV 캐시 소비량은 V4 Flash 대비 13~25% 수준으로 줄었다. 전체 파라미터 중 1960억 개는 N-그램 기반의 '조건부 메모리 모듈'로, 메모리를 연산과 분리해 GPU에 전부 상주시키지 않고도 지식을 조회할 수 있게 한다. 이 N-그램 가중치는 토큰 생성 시마다 전체를 읽어야 하는 기존 가중치와 달리 조회표 방식으로 접근하기 때문에 시스템 RAM 등으로 오프로드가 가능하다.
The Register영문 원문↗