Gemini 3.8 Flashおよび3.8 Flash Cyberのリリースノート

GoogleはGemini 3.8 FlashおよびGemini 3.8 Flash Cyberをリリースし、6週間で3回目のFlashリリースとなりました。これらのモデルはエージェントワークフローとサイバーセキュリティ向けに設計されており、高度な推論とコーディング機能を提供しながら、以前の3.7 Flashバージョンの速度と低コストを維持しています。

Gemini 3.8 Flash: 高度な推論とエージェントワークフロー

Gemini 3.8 Flashは高知能の「ワークホース」モデルとして位置づけられ、ソフトウェアエンジニアリングや専門的なプロフェッショナル領域で大幅な向上を実現しています。価格は100万入力トークンあたり$0.75、100万出力トークンあたり$3.75です。

長期的なソフトウェアエンジニアリング

長期的なソフトウェアエンジニアリングのDeepSWE v1.1ベンチマークにおいて、3.8 Flashは複雑なエンジニアリング問題をエンドツーエンドで自律的に解決する点で、ほとんどのより大きなフロンティアモデルを上回っています。

専門領域のパフォーマンス

3.8 Flashは定量的および専門分野で高い信頼性を示し、以下のベンチマークで3.7 Flashや他のフロンティアモデルを上回っています:

  • Vals Finance Agent V2: 高度な財務分析とレポート作成。
  • Harvey's Legal Agent Benchmark: 専門的な法的推論。
  • HLE-Verified: 54.9%のスコアを達成し、STEM、人文科学、専門分野にわたる多段階推論を実証。

設計思想: 勤勉さの向上

パフォーマンスの向上は、モデルがより多くの推論ステップを実行し、複雑なタスクでツールを反復的に呼び出すという設計上の選択によってもたらされています。これにより、高い努力レベルではトークン使用量が増加する可能性がありますが、開発者はより低い努力レベルを利用したり、効率優先のワークロードにはGemini 3.7 Flashを使用したりすることができます。

Gemini 3.8 Flash Cyber: 専門的なサイバーセキュリティ機能

Gemini 3.8 Flash Cyberは、Fairwindプログラムを通じて信頼できる防御者に提供される専門モデルです。防御能力に焦点を当てており、攻撃的なエクスプロイトよりも脆弱性の修正を優先しています。

脆弱性の発見とパッチ適用

  • 自律的な発見: CyberGymベンチマークにおいて、3.8 Flash Cyberは3.5 Flash Cyberやより大きなフロンティアモデルを上回っています。20のプログラミング言語にわたる内部ベンチマークでは、70%を超える成功率を達成しています。
  • 自動パッチ適用: CWE-Bench(Collinearが実行)において、3.8 Flash Cyberは47.2%のpass@1を達成し、コストに対するパッチ適用能力のパレートフロンティアに位置しています。

Googleでの現実世界での影響

Googleは社内で3.8 Flash Cyberを利用して自社のコードベースを保護しています:

  • Chromeセキュリティ: 最も優れた大型商用モデルと比較して、Chromeの脆弱性に対して2.6倍多くの正しいパッチを生成しました。
  • Cloudの脆弱性調査: 2時間未満で重大な基盤的脆弱性を特定しました。これは通常数ヶ月かかるタスクです。
  • Wiz: 他のフロンティアモデルと比較して、2.3〜5.2倍低いコストで、内部ペネトレーションテストベンチマークにおいて7.5〜9.7%高い再現率を報告しました。

安全性と堅牢性

両モデルには、化学・生物・放射線・核(CBRN)およびサイバー攻撃の悪用に対する保護措置が含まれています。Gemini 3.8 Flash Cyberには、信頼できる防御者が包括的なセキュリティ作業を実行できるよう、より寛容な緩和策が設けられています。さらに、3.8ファミリーはGray Swan IPIベンチマークで測定されたプロンプトインジェクションの堅牢性が大幅に向上しています。

コミュニティの洞察と技術的議論

Hacker Newsのユーザーフィードバックからは、特定のタスクにおけるモデルの速度と有用性に対する高い評価と、一貫性と可用性に関する懸念が混在していることが明らかになりました。

強み

  • マルチモーダリティ: ユーザーは、競合他社と比較してGeminiの優れた音声および動画入力サポートを強調し、メディア分析や動画からの構造化データ抽出に理想的であるとしています。
  • 散文と行動指向: 一部のユーザーは、Claudeファミリーと比較してGeminiの散文がより直接的で「実用的に簡潔」であると感じ、行動に向けてより適切に調整されていると指摘しています。
  • ドキュメント抽出: あるユーザーは、信頼性とコストの理由から、Gemini Flashがクライアントのドキュメント抽出ワークフローの主要なモデルになったと報告しています。
  • 特定タスクでの成功: 3Dプリント用CADでの成功した使用や、中国語での高品質な論説作文の報告が含まれています。

批評と制限事項

  • コーディングの信頼性: ベンチマークは高いものの、一部のユーザーはモデルがコーディングにおいて「無謀」になることがあり、Opusモデルと比較して動作しないコードを生成したり、複雑なコードレビューに失敗したりすると報告しています。
  • レイテンシとトークン効率: 一部のユーザーは、3.8 Flashは3.7よりもトークン効率が低い可能性があり、高い1秒あたりのトークン数(TPS)にもかかわらず全体的な応答時間が遅くなると指摘しました。
  • 可用性: ユーザーは、Geminiウェブインターフェースへのモデルのロールアウトが遅いことに不満を表明し、最新リリースの代わりに古いバージョン(3.6 Flashなど)が利用可能なままになっていることが多いと述べています。
  • 知識のカットオフ: Gemini 3.8 Flashの知識のカットオフは2026年3月ですが、一部のドメインは2025年1月に制限されたままです。

"Geminiモデルについて最も興味深いのは、やはりそのマルチモーダルサポートです。音声と動画の入力を受け付けるのに対し、OpenAIやAnthropicの旗艦モデルはまだ画像のみです。"

"Claudeの冗長さやTEDトーク風の表現についてはここで何度も不満を述べてきましたが、それとは対照的に、Geminiは散文の観点からすでにClaudeの夢の最終状態に到達しているようです。"

可用性

  • 開発者: Google AI Studio、Android Studio、Google Antigravity、Stitchから利用可能。
  • エンタープライズ: Gemini Enterpriseから利用可能。
  • コンシューマー: Geminiアプリ、Google検索のAIモード、GoogleスプレッドシートのGeminiを通じて、Google AI ProおよびUltraのサブスクライバーに利用可能。
  • サイバーセキュリティ専門家: 3.8 Flash Cyberへのアクセスは、政府機関や重要インフラ事業者向けにFairwindプログラムを通じて管理されます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch