google-research/scenic
Scenic: A Jax Library for Computer Vision Research and Beyond
What it solves
Scenic은 컴퓨터 비전 분야에서 대규모 어텐션 기반 모델을 연구하고 프로토타이핑하기 위한 간소화된 프레임워크를 제공합니다. 공통 트레이닝 작업을 위한 공유 라이브러리, 최적화된 루프, 입력 파이프라인을 제공함으로써, 멀티 디바이스·멀티 호스트 환경에서 복잡한 비전 모델을 구축하는 데 필요한 노력을 크게 줄여줍니다.
How it works
JAX와 Flax로 구축된 Scenic은 아키텍처를 두 단계로 나눕니다.
- Library-level code: 최소화되고 충분히 테스트된 공유 라이브러리로,
dataset_lib(확장 가능한 IO 파이프라인),model_lib(추상 모델 인터페이스, 어텐션/Transformer 레이어, bipartite matcher),train_lib(최적화된 트레이닝 루프),common_lib(일반 유틸리티)를 포함합니다. - Project-level code: 특정 작업에 맞게 커스터마이징 가능한 구현입니다. 연구자는 기존 config를 사용하거나 라이브러리 컴포넌트를 포크하여 아키텍처, 손실, 메트릭을 재정의할 수 있습니다.
Who it’s for
이미지 분류, 세그멘테이션, 객체 탐지 및 이미지·비디오·오디오를 포함하는 멀티모달 작업을 위한 모델을 개발하는 AI 연구자와 개발자를 위해 설계되었습니다.
Highlights
- Broad Modality Support: 이미지, 비디오, 오디오 및 멀티모달 조합에 성공적으로 사용되었습니다.
- Scalable Infrastructure: 다수 디바이스·호스트에 걸친 대규모 학습을 기본 지원합니다.
- Extensive Baseline Library: ViT, DETR, CLIP, SAM 등 최신 모델 구현을 포함합니다.
- ** فلسفه (Philosophy)**: 복잡한 추상화보다 포크와 복사‑붙여넣기를 장려하여 단순함과 빠른 프로토타이핑을 우선시합니다.