Gemini 2.5 Flash-Lite リリースノート

Google DeepMindは、Gemini 2.5 ファミリーの中で最も高速かつコスト効率の良いモデルであるGemini 2.5 Flash-Liteの安定版をリリースしました。このモデルは、スケールされた本番利用向けに設計されており、ドルあたりの高い知能と、翻訳や分類などのタスクにおける低レイテンシを優先しています。

技術仕様と価格

Gemini 2.5 Flash-Liteは、2.5シリーズの中で最も低コストのモデルで、入力トークン100万トークンあたり0.10ドル、出力トークン100万トークンあたり0.40ドルの価格設定となっています。さらに、プレビュー版リリースと比較してオーディオ入力の価格が40%削減されています。

主な技術的機能は次のとおりです:

  • Context Window: 100万トークンのコンテキストウィンドウ。
  • Reasoning: コントローラブルな思考予算を介して、要求の高いユースケースでオプションとしてオンにできるネイティブな推論機能。
  • Tool Integration: Code Execution、URL Context、Google SearchによるGroundingなどのネイティブツールのサポート。
  • Performance: 広範なプロンプトサンプルにおいて、2.0 Flash-Liteおよび2.0 Flashよりも低いレイテンシ。

パフォーマンスベンチマークと品質

Gemini 2.5 Flash-Liteは、次のドメインにおいて2.0 Flash-Liteよりも全体的な品質が高いことを示しています:

  • コーディング
  • 数学
  • 科学
  • 推論
  • マルチモーダル理解

本番ユースケース

いくつかの組織はすでに、特定のオペレーションワークフローを最適化するためにGemini 2.5 Flash-Liteを導入しています:

  • Satlyt: 分散型スペースコンピューティングプラットフォームでモデルを使用し、軌道上のテレメトリーの要約および衛星間通信のパースを処理します。これにより、オンボード診断のレイテンシが45%削減され、消費電力が30%減少しています。
  • HeyGen: モデルを使用してビデオプランニングを自動化し、コンテンツを最適化し、ビデオを180以上の言語に翻訳します。
  • DocsHound: モデルを使用して長いビデオを処理し、数千枚のスクリーンショットを抽出して、AIエージェントのドキュメントとトレーニングデータを生成します。
  • Evertune: モデルの速度を活用して、モデル出力の大量データをスキャンおよび合成し、AIモデル全体におけるブランド表現の動的な洞察を提供します。

可用性と移行

Gemini 2.5 Flash-Liteは、Google AI StudioおよびVertex AIを通じて利用可能です。開発者はコードでgemini-2.5-flash-liteを指定することでモデルにアクセスできます。プレビュー版のユーザーは、プレビューエイリアスが8月25日に削除される予定であるため、安定版エイリアスに移行する必要があります。

Sources