래블업 Backend.AI, 1000장급 GPU 분산학습 운영 인프라

래블업은 연구실 GPU 공유 문제 해결을 위해 2015년 창업해 AI 인프라 운영 소프트웨어 Backend.AI를 개발해왔다. 자체 개발한 분할 GPU(fGPU) 기술로 하나의 물리 GPU를 여러 사용자가 나눠 쓰도록 하고, AI 전용 오케스트레이터 소코반(Sokovan)으로 자원 배치를 관리한다. Backend.AI는 엔비디아 외에 AMD·인텔 GPU와 리벨리온·퓨리오사AI 등 국산 NPU도 함께 지원한다. 업스테이지 컨소시엄의 파운데이션 모델 프로젝트에서는 엔비디아 B200 GPU 504장 클러스터를 73일간 운영했고, 이후 H100·B200으로 구성된 약 1,000장 규모 클러스터로 확장해 모델 학습을 지원했다.
이 글에 나온 것
이 글은 원문을 요약한 큐레이션입니다. 제목은 요약에 맞춰 새로 붙였습니다. 수치와 단위는 원문 표기를 유지했습니다. 전체 내용은 원 매체에서 읽어 주세요.원문: 테크42 「[K-AX는 지금] “GPU를 몇 개 가졌느냐가 아니라 얼마나 많은 가치를 뽑아내는지가 중요”…신정규 래블업 대표가 말하는 AI 인프라의 ‘운영체제’」
테크42 원문 보기 ↗
