Safetensors, PyTorch Foundation에 합류

Safetensors, PyTorch Foundation에 합류

Safetensors는 Linux Foundation 아래 재단 호스팅 프로젝트로서 PyTorch Foundation에 합류했습니다. 이번 전환으로 프로젝트의 상표, 저장소, 거버넌스가 벤더 중립적인 환경으로 이동하여 모델 가중치 저장 포맷의 개발이 단일 기업이 아닌 보다 넓은 머신러닝 커뮤니티에 의해 주도되도록 보장합니다.

Safetensors의 기술 아키텍처

Safetensors는 모델 로딩 시 임의 코드 실행 위험을 제거함으로써 pickle 기반 포맷을 대체하도록 설계된 직렬화 포맷입니다. 이 포맷은 두 가지 주요 구성 요소로 이루어진 단순한 아키텍처 위에 구축되었습니다:

  • JSON Header: 텐서 메타데이터를 설명하는 100MB 제한의 메타데이터 섹션.
  • Raw Tensor Data: 헤더 뒤에 이어지는 실제 가중치 데이터로, 제로 카피 로딩(디스크에서 텐서를 직접 매핑) 및 지연 로딩(전체 체크포인트를 역직렬화하지 않고 개별 가중치를 읽기) 을 가능하게 합니다.

거버넌스 및 커뮤니티 전환

PyTorch Foundation에 합류함으로써 Safetensors는 Hugging Face 프로젝트에서 커뮤니티 주도 프로젝트로 전환됩니다. Hugging Face 유지관리자 Luc와 Daniel은 여전히 Technical Steering Committee에 참여하며 일상 운영을 이끌지만, 프로젝트는 이제 공식적으로 Linux Foundation에 속합니다.

기여자들을 위해 유지관리자가 되는 경로가 이제 저장소의 GOVERNANCE.mdMAINTAINERS.md 파일에 공식적으로 문서화되었습니다. 이 변화는 포맷 위에 구축하는 조직들에게 안정적이고 장기적인 기반을 제공합니다.

사용자 및 기여자에 대한 영향

기존 사용자에게는 파괴적인 변화가 없습니다. 포맷, API, 그리고 Hugging Face Hub 통합은 동일하게 유지되며, 현재 Safetensors 포맷으로 저장된 모든 모델은 지금과 같이 계속 작동합니다.

향후 로드맵 및 통합

Safetensors는 ML 생태계 전반의 성능 및 호환성을 향상시키기 위해 여러 핵심 기술 개선을 진행하고 있습니다:

PyTorch Core 통합

이 프로젝트는 PyTorch 팀과 협력하여 Safetensors를 torch 모델을 위한 직렬화 시스템으로 PyTorch 코어에 통합하고 있습니다.

하드웨어 가속 및 병렬 처리

로드맵에는 디바이스 인식 로딩 및 저장 개발이 포함되어 있어, 텐서를 CPU 단계 없이 CUDA 및 ROCm과 같은 가속기에 직접 로드할 수 있게 합니다. 또한, Tensor Parallel 및 Pipeline Parallel 로딩을 위한 일류 API가 개발되어 각 랭크 또는 파이프라인 단계가 필요한 가중치만 로드하도록 보장합니다.

양자화 지원

Safetensors는 다음과 같은 진화하는 양자화 포맷에 대한 지원을 공식화할 예정입니다:

  • FP8
  • 블록 양자화 포맷 (예: GPTQ 및 AWQ)
  • 서브바이트 정수 타입

Sources