google-research/scenic

Scenic: A Jax Library for Computer Vision Research and Beyond

What it solves

Scenic は、コンピュータビジョン向けの大規模注意機構モデルの研究・プロトタイピングを効率化するフレームワークです。共通のトレーニングタスク用ライブラリ、最適化されたループ、入力パイプラインを提供し、マルチデバイス・マルチホスト環境での複雑なビジョンモデル構築の手間を大幅に削減します。

How it works

JAX と Flax で構築された Scenic は、アーキテクチャを 2 つのレベルに分割しています。

  1. Library-level code: 最小限で十分にテストされた共有ライブラリ。dataset_lib(スケーラブルな IO パイプライン)、model_lib(抽象モデルインターフェース、注意/Transformer 層、二部マッチャー)、train_lib(最適化されたトレーニングループ)、common_lib(汎用ユーティリティ)を含みます。
  2. Project-level code: 特定タスク向けにカスタマイズ可能な実装。研究者は既存の config を使用するか、ライブラリコンポーネントをフォークしてアーキテクチャ、ロス、メトリクスを再定義できます。

Who it’s for

画像分類、セグメンテーション、検出、画像・動画・音声を含むマルチモーダルタスクのモデル開発に取り組む AI 研究者・開発者向けです。

Highlights

  • Broad Modality Support: 画像、動画、音声、マルチモーダルの組み合わせで実績あり。
  • Scalable Infrastructure: 複数デバイス・ホストにまたがる大規模トレーニングを標準でサポート。
  • Extensive Baseline Library: ViT、DETR、CLIP、SAM など最新モデルの実装を含む。
  • ** فلسفه (Philosophy)**: シンプルさと迅速なプロトタイピングを重視し、複雑な抽象化よりもフォークやコピーペーストを推奨します。