AI 개발 및 서비스 엔터프라이즈 운영 플랫폼​(Backend.AI)

AI 개발 및 서비스를 위한 올인원 엔터프라이즈 운영 플랫폼​

 

 

Backend.AI의 Sokovan™을 통한 강력한 컨테이너 오케스트레이션

Sokovan™은 멀티테넌트 및 멀티노드 확장 시나리오에 적합한 독립 실행형 오픈소스 컨테이너 오케스트레이터입니다. Sokovan™은 최신 하드웨어 가속 기술에 최적화되어 있으며, 사용자가 정의할 수 있는 작업 스케줄링 및 노드 할당 정책을 통해, AI 성능 저하 없이 단일 클러스터에서 인터랙티브, 배치, 그리고 서비스 워크로드가 혼합된 형태의 하이브리드 환경까지도 지원합니다.

AI 가속기를 최대치로 활용하고, 여러분의 잠재력을 실현하세요.

복잡한 비즈니스에서는 탁월한 AI 성능과 우수한 관리 용이성이 성공의 열쇠입니다. 인텔의 최신 제품인 인텔® Gaudi® 3 AI 가속기는 강력한 AI 성능과 기능을 제공합니다. 서비스형 플랫폼인 Lablup Backend.AI는 엔터프라이즈급 AI 환경에 최적화된 다양한 기능을 제공합니다.

인텔® Gaudi® 2 및 3 플랫폼과 깊숙이 결합된 우리의 기술 혁신

이미 비즈니스 환경에 인텔® Gaudi® 2 AI 가속기 또는 인텔® Gaudi® 3 AI 가속기를 도입한 고객과 향후 인텔® Gaudi® 2 & 3 플랫폼을 도입할 고객 모두 래블업 Backend.AI가 인텔® Gaudi®에 대해 지원하는 다양한 혜택을 누릴 수 있습니다. 인텔® Gaudi® 2 & 3 플랫폼과 함께 동작하는 Backend.AI 기능의 일부를 확인해 보세요.

카드 레벨 가속기 할당 (Card-level accelerator allocation)

사용자가 의도한 만큼의 실제 가속기를 제공하여 인텔® Gaudi® 2 & 3 AI 가속기 클러스터 워크로드를 극대화합니다. 예를 들어, 고객은 기존에 선호하는 플랫폼에서 모델을 실행 및 훈련한 다음 인텔® Gaudi® 2 및 3 플랫폼에서 서비스를 제공하거나 그 반대의 경우도 가능합니다.

외부 스토리지 할당 (External storage allocation)

통합 스토리지 솔루션을 최대한의 성능으로 활용하세요. 사용자의 개입 없이 공급업체별 파일 시스템 가속 기능을 활용하세요. Backend.AI는 Dell PowerScale, VAST Data, WEKA, NetApp 등과 같이 널리 사용되는 주요 플랫폼을 지원합니다.

멀티스케일 워크로드 (Multi-scale workloads)

소규모 모델을 실행할 수 있는 단일 카드 AI 워크로드부터 대규모 모델을 실행할 수 있는 멀티 노드 멀티 카드 AI 워크로드까지, 어떤 환경에서도 Backend.AI는 최고의 성능을 보장합니다. 11월 1일 현재, Backend.AI는 단일 카드 AI 워크로드와 단일 노드, 다중 카드 AI 워크로드를 실행할 준비가 되었습니다. 다중 노드, 다중 카드 AI 워크로드 지원은 올해 마무리될 예정입니다.

추론 통계 데이터 관리 (Inference statistics management)

AI 프레임워크에서 제공하는 성능에 대한 최신의 상세한 지표를 모니터링하세요. Backend.AI는 하드웨어의 정보뿐만 아니라 소프트웨어의 통계 데이터를 가져올 수 있기 때문에, 관리자가 메트릭을 심층적으로, 쉽게 분석할 수 있도록 만들어줍니다.

규칙 기반 추론 레플리카 자동 스케일링 (Rule-based inference replica auto scaling)

시스템이 리소스 사용량을 스스로 최적화할 수 있습니다. 다양한 하드웨어 및 소프트웨어 수치 모니터링을 통해, 관리자의 수동 개입 없이도 다양한 사용자의 사용 패턴에 대응합니다.

*현재 개발 중(2024년 12월 개발 완료 목표)

NUMA 인식(NUMA-aware) 리소스 할당

CPU 소켓이 여러 개 있고 각 소켓마다 여러 개의 가속기가 있는 경우 단일 노드 내에서 CPU 간 및 PCIe 버스 오버헤드를 제거하여 베어메탈에 가까운 성능을 달성할 수 있습니다.

유저 및 프로젝트 기반의 스토리지 할당량 관리

사용자 또는 단일 프로젝트당 데이터 스토리지 할당량을 제한하여 예산 효율적이고 간편하게 데이터 공간을 관리할 수 있습니다.

Hugepage 메모리 할당 지원

주소 변환 (Address Translation)의 오버헤드를 줄이기 위해 더욱 큰 메모리 페이지 (Hugepage)를 사용하되, 그 수를 줄여 AI 가속기를 사용할 때의 CPU 오버헤드를 최소화합니다. 해당 기능에 대한 Backend.AI의 지원은 올해 안에 마무리 될 예정입니다.

 

Sokovan은 가속 컴퓨팅에 특화된 오케스트레이터입니다.

Sokovan은 가속화 인식, 멀티 테넌트, 배치 지향 작업 스케줄링을 제공하며 다양한 시스템 레이어에 여러 하드웨어 가속 기술을 완전히 통합하여 잠재력 있는 성능을 발휘합니다.​

Sokovan은 클러스터 수준 노드 할당 스케줄러와 노드 수준 리소스/장치 할당 스케줄러 두 가지 수준의 스케줄링을 제공합니다. 클러스터 수준 스케줄러는 사용자가 작업 배치 전략을 사용자 정의하고 워크로드의 밀도와 우선 순위를 제어할 수 있도록 합니다. 노드 수준 스케줄러는 각 컨테이너에 하드웨어 가속기를 자동으로 감지하고 활성화하여 컨테이너 당 성능을 최적화합니다.​

이는 Slurm 및 기존 도구와 비교하여 AI 워크로드의 성능을 향상시키는 데 도움이 됩니다. Sokovan은 또한 AI 훈련 및 서비스를 포함한 다양한 GPU 워크로드에 대해 다양한 산업에서 대규모로 배포되었습니다. 그 설계와 기능은 컨테이너 기반 MLOps 플랫폼이 최신 하드웨어 기술을 더욱 효과적으로 활용할 수 있도록 도와줍니다.​

https://www.backend.ai/ko/platform/sokovan

일반적인 쿠버네티스 Pod 기반 GPU 자원 할당

  • Pod 수준에서 GPU 및 다른 컴퓨팅 리소스를 매핑합니다.
  • 미리 Pod를 생성하고 Job을 Pod에 할당합니다.
  • 기존 Pod에서 자원을 할당하기 어려워 일부 작업이 대기 중일 수 있습니다.

​Sokovan / Backend.AI를 사용한 동적 GPU 할당

  • 더 높은 GPU 활용도를 가진 모든 작업을 수용합니다.
  • 분할 GPU 스케일링을 통해 더 세분화된 리소스 분배가 가능합니다.
  • 작업 스케줄링 결정 시 세션을 동적으로 생성하고 삭제합니다.
  • 세션이 생성되고 삭제되는 즉시 리소스를 할당하고 회수합니다.

Tags:

No responses yet

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다