OpenLake MLPerf Storage v3.0 성능 결과
OpenLake는 Llama 3.1 8B 체크포인팅에 대한 MLPerf Storage v3.0 벤치마크에서 유사한 Closed division S3 제출물 중 가장 높은 읽기 및 쓰기 대역폭을 달성했습니다. 이 결과는 대규모 LLM 학습 중 상태 저장 시 GPU 유휴 시간을 최소화하고 장애 발생 후 복구를 가속화하는 시스템의 능력을 입증합니다.
MLPerf Storage v3.0 벤치마크 결과
OpenLake는 Llama 3 제품군 모델을 에뮬레이션하는 Llama 3.1 8B 구성에 대해 유사한 S3 제출물을 선도했습니다. 이 벤치마크는 학습 프로세스가 모델 상태를 저장하거나 복구할 때의 스토리지 시스템 동작을 테스트합니다.
성능 지표
Llama 3.1 8B 구성에 대해 OpenLake는 다음과 같은 성능 지표를 제공했습니다:
| Metric | OpenLake Result |
|---|---|
| Write Bandwidth | 6.72 GiB/s |
| Write Duration | 29.42 seconds |
| Read Bandwidth | 11.55 GiB/s |
| Read Duration | 9.37 seconds |
다른 제출물과의 비교
동일한 Closed division 체크포인팅 워크로드, S3 API 인터페이스, Llama 3.1 8B 모델, 1개의 클라이언트 노드 및 1개의 데이터 병렬 인스턴스를 사용하는 다른 발표된 결과와 비교했을 때, OpenLake는 경쟁사들을 압도했습니다:
| Organization | Write Bandwidth | Read Bandwidth | Write Duration | Read Duration |
|---|---|---|---|---|
| OpenLake | 6.72 GiB/s | 11.55 GiB/s | 29.42 s | 9.37 s |
| NVIDIA AIStore (6 node) | 3.40 GiB/s | 11.08 GiB/s | 30.83 s | 9.47 s |
| NVIDIA AIStore (12 node) | 3.20 GiB/s | 8.33 GiB/s | 30.83 s | 12.90 s |
| NVIDIA AIStore (3 node) | 3.02 GiB/s | 6.99 GiB/s | 34.67 s | 15.00 s |
| Nebius Object Storage | 2.81 GiB/s | 7.14 GiB/s | 37.24 s | 14.67 s |
OpenLake의 쓰기 대역폭 6.72 GiB/s는 다음으로 빠른 유사한 제출물의 1.98배였습니다.
OpenLake의 기술적 아키텍처
OpenLake는 AI 워크로드에 대한 고성능 스토리지를 달성하기 위해 Infinity Core I/O Engine을 활용합니다. 이 시스템은 저지연 및 고처리량을 위해 설계된 io_uring 및 GPUDirect Storage를 기반으로 작동합니다.
주요 구현 세부 사항
CPU 오버헤드를 줄이면서 진행 중인 I/O 작업을 최대화하기 위해, OpenLake는 다음과 같은 기술을 채택했습니다:
- Asynchronous io_uring I/O: 비차단 커널 작업을 위해 사용됩니다.
- Pinned Execution Threads: 스케줄링 오버헤드를 줄입니다.
- Fine-grained I/O Coalescing: 데이터 이동을 최적화합니다.
- XFS and Workload-Specific Tuning: AI 스토리지 요구 사항에 맞게 조정되었습니다.
- S3 API Interface: 체크포인트를 읽고 쓰기 위한 표준 인터페이스를를 제공합니다.
또한, 이 프로젝트는 KV offloading을 지원하기 위해 온-GPU 압축과 함께 Rust compio (thread-per-core 디자인)를 사용하여 96개 노드 클러스터에서 1ms 내에 100만 IOPS 이상을 달성했습니다.
체크포인트 성능이 LLM 학습에 미치는 영향
체크포인팅은 몇 주 동안 지속될 수 있는 대규모 학습 실행 중 진행 상황을 보호하기 위해 모델 가중치, 옵티마이저 상태 및 학습 상태를 주기적으로 스토리지에 저장하는 프로세스입니다.
학습 비용 절감
동기식 체크포인팅에서는 상태가 안정적으로 기록될 때까지 학습이 일시 중지됩니다. 더 빠른 쓰기 대역폭은 GPU가 유휴 상태로 머무는 시간을 줄여 가속기 활용도를 높이고 전반적인 학습 비용을 것을ken
가속화된 복구
더 빠른 읽기 대역폭은 장애 발생 후의 복구 경로를 줄여 학습이 더 빠르게 재개될 수 있도록 합니다. 이는 체크포인트가 빈번하게 생성되고 인프라 장애가 발생할 수 있는 강화 학습, 사전 학습 및 사후 학습 작업에 매우 중요합니다.