국내 반도체 생태계래블업 Backend.AI, 1000장급 GPU 분산학습 운영 인프라
래블업은 연구실 GPU 공유 문제 해결을 위해 2015년 창업해 AI 인프라 운영 소프트웨어 Backend.AI를 개발해왔다. 자체 개발한 분할 GPU(fGPU) 기술로 하나의 물리 GPU를 여러 사용자가 나눠 쓰도록 하고, AI 전용 오케스트레이터 소코반(Sokovan)으로 자원 배치를 관리한다. Backend.AI는 엔비디아 외에 AMD·인텔 GPU와 리벨리온·퓨리오사AI 등 국산 NPU도 함께 지원한다. 업스테이지 컨소시엄의 파운데이션 모델 프로젝트에서는 엔비디아 B200 GPU 504장 클러스터를 73일간 운영했고, 이후 H100·B200으로 구성된 약 1,000장 규모 클러스터로 확장해 모델 학습을 지원했다.
테크42