"LLM"
뉴스
WiCi 무선 eGPU, 4TB SSD 내장으로 LLM 가중치 로컬 저장
WiCi가 Wi-Fi 7 무선 통신으로 PC와 연결되는 외장 GPU 박스 'WiCi One'을 공개했다. 이 제품은 PCIe 5.0 방식의 4TB SSD를 내장해 대형 언어모델(LLM) 가중치를 저장하고, 데이터 캐싱·중복제거·압축을 수행하는 드라이버 소프트웨어로 무선 통신의 지연 문제를 보완한다고 설명했다. 기본 사양은 RTX 5060 Ti 16GB를 탑재하며 2026년 4분기 프리뷰가 예정돼 있고, 정식 출시일은 아직 정해지지 않았다. RTX 5090 32GB 탑재 버전도 계획돼 있으나 출시 시기는 공개되지 않았다. 파이썬 라이브러리와 HTTP API를 통해 여러 기기가 하나의 GPU를 네트워크로 공유할 수 있다.

BOOST, HBM·호스트 메모리 동시접근으로 vLLM 처리량 개선
조지아공대, 엔비디아 리서치, 스탠퍼드 연구진이 GPU의 HBM과 호스트 메모리에 동시에 비례적으로 접근해 대역폭을 함께 활용하는 런타임 시스템 'BOOST'를 발표했다. 커널 접근 패턴을 활용해 정적 모델 가중치는 모듈로 기반 페이지 배치로, 동적으로 할당되는 어텐션 KV 페어는 웨이브 인지형 페이지 풀로 관리한다. 연구진은 BOOST를 vLLM에 통합해 Grace Hopper 시스템에서 평가했으며, 동일 배치 크기 기준 HBM 단독 서빙 대비 TPOT을 개선했고, 고처리량 서빙 환경에서는 프리페칭 방식보다 높은 평균 처리량 향상을 보였다고 밝혔다. 논문은 2026년 9월 arXiv에 게재됐다.

TypeSafe AI, LLM 대체하는 의사결정 전용 모델 Jev 공개
전직 OpenAI 엔지니어 디오구 알메이다가 이끄는 TypeSafe AI가 'System One' 계열 첫 모델 Jev를 공개했다. Jev는 일반 대화형 LLM과 달리 프로그램이 제공한 상태(state) 정보를 바탕으로 특정 문장의 참·거짓을 신뢰도 수치와 함께 평가하도록 설계됐다. 자체 강화학습 기법인 RLCD로 학습돼 구조화된 답변을 생성하며, 같은 요청 내 여러 질문을 병렬로 처리할 수 있고 컨텍스트 창은 6만4000토큰으로 제한된다. 회사 측은 GPT-6 Astra 같은 프런티어 모델보다 훨씬 빠르고 저렴하다고 주장했으며, 개방형 추론이 필요한 작업은 기존 LLM과 결합해 쓰는 방식을 권장했다.
시스템반도체·팹리스맥 스튜디오 M5 울트라, 쿼드다이 구조로 로컬 LLM 공략
애플이 맥 프로를 단종하며 맥 스튜디오를 최상위 데스크톱으로 내세운 가운데, 톰스하드웨어가 M5 울트라 탑재 모델을 리뷰했다. M5 울트라는 두 개의 M5 맥스 다이를 UltraFusion으로 연결한 애플 최초의 쿼드다이 칩으로, 다이 간 대역폭이 4.4TB/s를 넘는다고 애플은 밝혔다. 메모리 대역폭은 최대 1.2TB/s이며, 유니파이드 메모리는 최대 256GB(추후 512GB 지원 예정)로 대형 LLM을 기기 내에서 구동할 수 있다. 긱벤치7에서 싱글코어 3,770점, 멀티코어 52,293점을 기록했고, 핸드브레이크 영상 변환에서는 AMD 스레드리퍼 9980X보다 빨랐지만 블렌더 CPU 렌더링에서는 스레드리퍼 7980X·9980X, 인텔 제온 w-3495X에 뒤처졌다.

DRC-Aid, 에이전틱 LLM으로 DRC 위반 자동 수정
퍼듀대학교 연구진이 'DRC-Aid'라는 폐루프 에이전틱 프레임워크를 제안한 기술 논문을 발표했다. 이 프레임워크는 추론 시점 대형언어모델(LLM)을 활용해 로컬 DRC(Design Rule Check) 위반 수정을 검증-루프 탐색 문제로 formulating해 자동화한다. 방대한 기하학적 수정 조합을 제한하기 위해 결정론적 규칙 엔진이 물리적 검증 툴이 보고한 위반 사항을 제한된 기하학적 편집 메뉴로 변환하는 방식이다. 해당 논문은 2026년 7월 arXiv에 프리프린트로 공개됐다.

에든버러대, EDA용 LLM 3단계 위계로 정리 — 오케스트레이터가 관건
영국 에든버러대 연구진이 'LLMs in Digital EDA' 논문을 통해 반도체 설계 자동화(EDA)에서 LLM의 역할을 세 단계로 구분했다. 단발성으로 설계 산출물을 생성하는 '제너레이터', 도구 피드백으로 결과를 반복 개선하는 '에이전트', EDA 여러 단계의 결정을 조율하는 '오케스트레이터'로 구분하고 능력이 축적되는 과정을 설명했다. 논문은 현재 모델들이 물리적으로 올바른 하드웨어보다 그럴듯해 보이는 코드를 생성하도록 학습되는 '구문 함정' 문제와, 도구 분절 및 설계 맥락 손실 문제를 지적했다. 연구진은 세 역할 비교를 통해 기존 접근법이 산업용 설계 규모로 확장하기 어렵다며, 표준화되고 물리 인식이 가능한 오케스트레이터로의 전환이 필요하다고 밝혔다.

아크프라 뉴트리 1.2, GPU 메모리 자동계산으로 배포 실패 줄여
아크프라는 2026년 9월 17일 기업용 AI 플랫폼 뉴트리 1.2를 발표했다. 자체 개발한 추론 엔진 플렉스 엔진을 도입해 마이너U, 패들OCR 등 비LLM 모델을 지원하며, vLLM·SGLang 기반으로 언어·멀티모달·임베딩·리랭크·문서 파싱·OCR·머신러닝 모델을 하나의 플랫폼에서 관리할 수 있다. 시각적 모델 레지스트리, 자동 KV캐시 및 GPU 메모리 계산, 프로젝트 기반 API 키 관리 기능이 새로 추가됐다. 뉴트리 1.2는 깃허브에 오픈소스로 공개됐다.

OpenAI '잘라페뇨' 칩, 자체 LLM으로 HLS 설계 가속
OpenAI가 8월 25일 공개한 첫 자체 AI 가속기 칩 '잘라페뇨(Jalapeño)'는 4비트 연산 기준 최대 13.4페타플롭스 성능과 232기가바이트 메모리, 초당 15.4테라바이트의 메모리 대역폭을 갖췄다. OpenAI는 엔비디아 GB300 대비 종단간 지연시간을 최대 3.6배 줄이면서 전력 소비도 낮췄다고 밝혔다. 설계는 아키텍처 구상부터 첫 실리콘까지 20개월, RTL 작성부터 테이프아웃까지는 9개월이 걸렸으며, 100명 미만의 설계팀이 물리설계를 담당한 브로드컴과 협업해 진행했다. OpenAI는 오픈소스 고수준 합성(HLS) 도구인 XLS 기반 워크플로에 자체 LLM을 접목했고, 시제품 도착 후 약 40시간 만에 특정 커널 성능을 이론적 한계 대비 0.31%에서 88.94%로 끌어올렸다고 설명했다. 잘라페뇨는 2048개 칩 단위 '팟'으로 배치되도록 설계됐다.
